【對話生成】常見對話生成資料集整理,含下載鏈接(持續更新)
- 前言
- 用于對話理解的對話資料集
- IEMOCAP
- SEMAINE
- Mastodon
- MELD
- EMOTyDA
- MEmoR
- 常規開放域對話資料集
- OpenSubtitles
- Cornell Movie-Dialogs
- STC
- Ubuntu Dialogue Corpus
- Douban Conversation Corpus
- LCCC
- OpenViDial
- PchatbotW
- WDC-Dialogue
- 待更新
- 情感對話資料集
- DailyDialog
- ESTC
- EMPATHETICDIALOGUES
- ESConv
- 待更新
- 個性對話資料集
- PERSONA-CHAT
- PersonalDialog
- 待更新
- 策略控制對話生成
- PsyQA
- 待更新
前言
本文主要整理對話生成領域相關的資料集,尤其是開放域對話生成,當前可以把開放域對話生成任務劃分為:傳統開放域對話生成、多模態對話生成、情感對話生成、個性化對話生成、策略控制對話生成等,筆者的劃分是根據自己對該任務研究進展梳理而得到的理解,并不一定合理,
用于對話理解的對話資料集
IEMOCAP
發布時間:2008年
論文鏈接:https://link.springer.com/article/10.1007/s10579-008-9076-6
資料集鏈接:https://sail.usc.edu/iemocap/
資料集語言:英文
資料集模態:視頻、音頻、文本
資料集描述:IEMOCAP主要用于對話情感識別,包含151個對話、7433個陳述句、10個對話角色、10種情感標簽,
SEMAINE
發布時間:2012年
論文鏈接:https://ieeexplore.ieee.org/document/5959155
資料集鏈接:https://semaine-db.eu/
資料集語言:英文
資料集模態:視頻、音頻、文本
資料集描述:SEMAINE主要用于對話情感識別,由四個固定形象的機器人與人進行對話,標注了4個情感維度:Valence (愉悅度), Arousal (激活度), Expectancy (預期), Power (力量),Valence表示情感積極的程度,Arousal表示興奮的程度,Expectancy表示與預期相符的程度,Power表示情感影響力,其中Valence、Arousa和Expectancy為[-1, 1]范圍內的連續值,Power為大于等于0的連續值,
Mastodon
發布時間:2018年
論文鏈接:https://www.aclweb.org/anthology/C18-1063/
資料集鏈接:https://github.com/cerisara/DialogSentimentMastodon
資料集語言:英文
資料集模態:文本
資料集描述:Mastodon主要用于對話當中的情感與對話動作(DA)識別,尤其是聯合識別任務,它包括535個對話、2217個陳述句,標注了3大類情感標簽、27類對話動作(DA),
MELD
發布時間:2019年
論文鏈接:https://www.aclweb.org/anthology/P19-1050
資料集鏈接:https://affective-meld.github.io/
資料集語言:英文
資料集模態:視頻、音頻、文本
資料集描述:MELD主要用于對話中的情感識別,也有部分論文將其用于情感對話生成或者多模態對話生成,它包括1433個對話、13708個陳述句,提供了3大類粗粒度情感標簽以及7種細粒度情感標簽,視頻被切割成按陳述句劃分的短視頻,可以通過陳述句索引獲得該陳述句對應的視頻,
EMOTyDA
發布時間:2020年
論文鏈接:https://www.aclweb.org/anthology/2020.acl-main.402/
資料集鏈接:https://github.com/sahatulika15/EMOTyDA
資料集語言:英文
資料集模態:視頻、音頻、文本
資料集描述:EMOTyDA是一個類似于Mastodon的對話資料集,它主要整理了IEMOCAP以及MELD資料集,并且增加了12種常見的對話動作標簽,最終包括了1341個對話以及19365個對話陳述句,可以用于情感和DA的聯合識別任務,
MEmoR
發布時間:2020年
論文鏈接:https://dl.acm.org/doi/10.1145/3394171.3413909
資料集鏈接:https://github.com/sunlightsgy/MEmoR
資料集語言:英文
資料集模態:視頻、音頻、文本
資料集描述:MEmoR資料集主要用于多模態情感推理(ER),包括8536個對話以及22732個陳述句,提供了14種情感標簽并且對64個說話人標注了16PF、Big Five、MBTI三種個性特質用于輔助情感推理,我認為該資料集還可以用于情感對話或者個性化對話任務,
常規開放域對話資料集
OpenSubtitles
發布時間:2009年
論文鏈接:http://www.lrec-conf.org/proceedings/lrec2016/pdf/947_Paper.pdf
資料集鏈接:http://nlp.stanford.edu/data/OpenSubData.tar
資料集鏈接2:https://opus.nlpl.eu/OpenSubtitles-v2018.php
資料集語言:多語言(62種語言)
資料集模態:文本
資料集描述:OpenSubtitles主要用于開放域對話生成,包含2.6 billion陳述句,
Cornell Movie-Dialogs
發布時間:2011年
論文鏈接:https://www.aclweb.org/anthology/W11-0609/
資料集鏈接:http://www.cs.cornell.edu/~cristian/Cornell_Movie-Dialogs_Corpus.html
資料集語言:英文
資料集模態:文本
資料集描述:Cornell Movie-Dialogs包含從原始電影腳本中提取的大量元資料豐富的虛構對話集合,10,292 對電影角色之間的 220,579 次對話交流, 涉及 617 部電影中的 9,035 個角色,總共 304,713 潭訓語,
STC
發布時間:2015年
論文鏈接:https://www.aclweb.org/anthology/P15-1152/
資料集鏈接:https://coai-dataset.oss-cn-beijing.aliyuncs.com/STC-corpus.zip
資料集語言:中文
資料集模態:文本
資料集描述:STC是從微博爬取的語料構造的短文本對話(Short-Text Conversation)資料集,包含4.4 million個對話,,這里的資料集下載鏈接來自專案CDial-GPT,
Ubuntu Dialogue Corpus
發布時間:2015年
論文鏈接:https://www.aclweb.org/anthology/W15-4640/
資料集鏈接:https://github.com/rkadlec/ubuntu-ranking-dataset-creator
資料集語言:英文
資料集模態:文本
資料集描述:該資料集包含930,000個對話,7,100,000個陳述句,平均對話輪次為7.71輪,常用于開放域對話生成,
Douban Conversation Corpus
發布時間:2017年
論文鏈接:https://www.aclweb.org/anthology/P17-1046/
資料集鏈接:https://github.com/MarkWuNLP/
資料集語言:中文
資料集模態:文本
資料集描述:Douban資料集主要爬取自中文豆瓣論壇,包含1.1M個對話,7.7M個陳述句,
LCCC
發布時間:2020年
論文鏈接:https://arxiv.org/abs/2008.03946
資料集鏈接:https://github.com/thu-coai/CDial-GPT
資料集語言:中文
資料集模態:文本
資料集描述:LCCC資料集分為base和large兩個版本,主要用于預訓練大規模對話生成模型,其base版本包括了12M個對話,32.9M個對話陳述句,
OpenViDial
發布時間:2020年
論文鏈接:https://arxiv.org/abs/2012.15015
資料集鏈接:https://github.com/ShannonAI/OpenViDial
資料集語言:英文
資料集模態:影像、文本
資料集描述:OpenViDial 中的資料來自電影與電視劇,使用 OCR 從視頻中抽取出對話文本,并配以當前對話所在的影像,因此,每一句話都有相應視覺背景,最終形成包含百萬余條句子的大規模多模態對話資料集,其包含了1.1M個對話陳述句+視覺背景,
PchatbotW
發布時間:2021年
論文鏈接:https://arxiv.org/abs/2009.13284
資料集鏈接:https://github.com/qhjqhj00/Pchatbot
資料集語言:中文
資料集模態:文本
資料集描述:PchatbotW主要從微博爬取得到,包括了139,448,339個對話、 278,896,678,并且提供了時間戳和用戶ID兩種個性資訊,可以隱式地建模說話者的個性,
WDC-Dialogue
發布時間:2021年
論文鏈接:https://arxiv.org/pdf/2108.01547.pdf
資料集鏈接:https://github.com/thu-coai/EVA
資料集語言:中文
資料集模態:文本
資料集描述:這是一個超大規模的中文對話資料集,其平均輪次為2.1,所以我認為其是單輪對話資料集比較妥當,該資料集包括了1.4B個對話,以及3.0B個陳述句,其規模可以說是前所未有的大!
待更新
發布時間:
論文鏈接:
資料集鏈接:
資料集語言:
資料集模態:
資料集描述:
情感對話資料集
DailyDialog
發布時間:2017年
論文鏈接:https://www.aclweb.org/anthology/I17-1099/
資料集鏈接:http://yanran.li/dailydialog
資料集語言:英文
資料集模態:文本
資料集描述:DailyDialog主要包括13118個對話、102K個對話陳述句,標注了7種情感、4類對話動作(DA)以及10個對話主題,可以用于對話情感識別、對話動作識別任務,以及情感對話生成任務,
ESTC
發布時間:2018年
論文鏈接:https://arxiv.org/abs/1704.01074
資料集鏈接:http://coai.cs.tsinghua.edu.cn/hml/challenge2017/
資料集語言:中文
資料集模態:文本
資料集描述:ESTC資料集是在STC資料集的基礎上,使用一個訓練好的文本情感分類器得到,通過文本情感分類器,自動標注了6類情感標簽,常用于中文情感對話生成任務,
EMPATHETICDIALOGUES
發布時間:2019年
論文鏈接:https://www.aclweb.org/anthology/P19-1534/
資料集鏈接:https://github.com/facebookresearch/EmpatheticDialogues
資料集語言:英文
資料集模態:文本
資料集描述:EMPATHETICDIALOGUES主要用于共情對話生成,由25000個對話組成,提供了32種情感標簽,
ESConv
發布時間:2021年
論文鏈接:https://arxiv.org/abs/2106.01144
資料集鏈接:https://github.com/thu-coai/Emotional-Support-Conversation
資料集語言:英文
資料集模態:文本
資料集描述:ESConv包括了1053個對話、31410個陳述句,提供了7種負向情緒、5個負向情緒問題以及8種情感支持策略,伴隨著該資料集誕生的是首次出現的情感支持對話(ESC)任務,
待更新
發布時間:
論文鏈接:
資料集鏈接:
資料集語言:
資料集模態:
資料集描述:
個性對話資料集
PERSONA-CHAT
發布時間:2018年
論文鏈接:https://www.aclweb.org/anthology/P18-1205/
資料集鏈接:https://github.com/facebookresearch/ParlAI/tree/master/projects/personachat
資料集語言:英文
資料集模態:文本
資料集描述:PERSONA-CHAT包括10981個對話以及164356個陳述句,由1155個人參與對話,每個人指定了至少5句profile句子表示其個性,
PersonalDialog
發布時間:2019年
論文鏈接:https://arxiv.org/abs/1901.09672
資料集鏈接:https://github.com/silverriver/PersonalDilaog
Please contact [zhengyinhe1@163.com] for the PersonalDialog dataset
資料集語言:中文
資料集模態:文本
資料集描述:該資料集包括20.83M個對話、56.25M個句子,對于每個說話人,提供了5種個性特征(Age, Gender, Location, Interest, self descriptions),
待更新
發布時間:
論文鏈接:
資料集鏈接:
資料集語言:
資料集模態:
資料集描述:
策略控制對話生成
PsyQA
發布時間:2021年
論文鏈接:https://arxiv.org/abs/2106.01702
資料集鏈接:https://github.com/thu-coai/PsyQA
資料集語言:中文
資料集模態:文本
資料集描述:一個用于生成心理健康支持長篇咨詢文本的中文資料集,該資料集主要收集了壹心理社區的問答資料,標注了6種助人策略,總共包括了22346個問題以及56063個回復,
待更新
發布時間:
論文鏈接:
資料集鏈接:
資料集語言:
資料集模態:
資料集描述:
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/297067.html
標籤:AI
