參考論文:Zhao, Sicheng, et al. “Emotion Recognition from Multiple Modalities: Fundamentals and Methodologies.” arXiv preprint arXiv:2108.10152 (2021).
PDF鏈接:Emotion Recognition from Multiple Modalities: Fundamentals and Methodologies.
新鮮出爐的趙思成和楊巨峰大佬的論文哦(情感識別領域的專家),全面的梳理了多模態情感識別(Multi-modal Emotion Recognition, MER)的多個關鍵方面,是一篇日期新鮮(2021.08),內容詳實,高質量的綜述,非常適合入門的同學入手和老司機們回顧總結,翻譯和整理了一上午,有用請幫我點個贊再走吧,謝謝Thanks?(・ω・)ノ~
一、多模態資料集
下表為多模態資料集,可以看到最后一列給出了下載地址,需要資料集的朋友們可以點上面鏈接地址進入文章下載,如果除了資料集還想了解多模態情感識別(MER)的其他章節內容(模型,難點,挑戰,任務,方法,應用),請繼續往下閱讀哦~


二、廣泛使用的情感表達模型
目前,學術界對情緒分類并沒有統一的定義,一般的情緒分類主要有兩大基本觀點:離散模式(categorical emotion states (CES))和連續模式( dimensional emotion space (DES)),離散模式認為情緒具有完全不同的結構,連續模式認為不同情緒之間有著過渡階段,
1、CES情感模型定義情感通過幾個基本分類,包括以下:
binary sentiment :positive and negative, sometimes including neutral;
Ekman’s six basic emotions: positive happiness, surprise and negative anger, disgust, fear, sadness;
Mikels’s eight emotions: positive amusement, awe, contentment, excitement, and negative anger, disgust, fear, sadness;
Plutchik’s emotion wheel :eight basic emotion categories by three intensities;
Parrott’s tree hierarchical grouping :primary, secondary and tertiary categories.
2、DES定義情感通過連續空間的2D,3D或更高維度的的卡爾坐標系,包括以下:
valence-arousal-dominance (VAD):where valence, measure all emotions as different coordinate points in the continuous Cartesian space, but the absolute continuous values are beyond users’ understanding.
- PAD情感三維理論是由Mehrabian 和Russell 于1974年提出的維度觀測量模型 ,該模型認為情感具有愉悅度 、激活度和優勢度3個維度,其中P代表愉悅度(Pleasure-displeasure),表示主體情感狀態的正負性;A代表覺醒度(Arousal-nonarousal),表示主體的神經生理激活水平;D代表優勢度(Dominance-submissiveness),表示主體對情景和他人的控制狀態,是個體情緒被控制和主導的狀態,由內而外的自發情緒就是支配性的情緒如憤怒,由外而內的被動情緒就是服從性的情緒如害怕,同時也可以用這3個維度的值來代表具體的情緒和情感,研究表明,利用 PDA的3 個維度可有效地解釋人類的情感,Mehrabian 等人利用這3個維度可解釋其他42種情感量表中的絕大部分變異 ,而且這3個維度并不限于描述情感的主觀體驗,它與情感的外部表現、生理喚醒有較好的映射關系,前人研究表明:PAD三維情感模型可以充分地表達和量化人類情緒和情感,是情感計算研究的基礎 ,
- 情緒自我評價等級系統(SAM)
佛羅里達大學情緒和注意研究中心教授 Bradley 和 Lang,以 PAD 模型為基礎設計了一種測量被試情緒反應的情緒自我評價等級系統 SAM,SAM 通過抽象的卡通人物繪圖表示愉悅度、覺醒度、支配度,如下圖所示,其中,皺眉噘嘴的頭像到微笑的影像代表愉悅度從低到高;從放松昏睡的影像到興奮睜眼的影像表示覺醒度從弱到強;從小人到大人的影像表示支配度從小到大,

These two types of definitions of emotions are related, with possible transformation from CES to DES. For example, anger relates to negative valence, high arousal, and high dominance. Besides emotion, there are several other widely used concepts in affective computing, such as mood, affect, and sentiment. Emotions can be expected, induced, or perceived. We do not aim distinguishing them in this article. Please refer to [11] for more details on the differences or correlations between these concepts.(兩種模型之間可以想換轉換)
三、多模態情感誘發方式
在MER(多模態情感識別)領域,多種模式(multi-modal)被用于識別和預測人類情緒,根據情感是來自人體的身體變化還是來自外部數字媒體,MER中的情感模態可以大致分為兩類:
顯性情感線索:包括面部表情、眼球運動、語言、動作、步態和腦電圖,所有這些都可以直接觀察、記錄或從個人身上收集,
隱性情感刺激:后者表示常用的數字媒體型別,如文本、音頻、影像和視頻,我們使用這些資料型別來存盤資訊和知識,以及在數字設備之間傳輸資訊和知識,通過這種方式,情感可能會含蓄地參與和喚起,雖然單一模式作為情感表達的可靠渠道的有效性無法保證,但聯合考慮多種模式將顯著提高[12]的可靠性和穩健性,
四、多模態情感識別任務
對于多模態情感信號,我們可以進行不同的MER任務,包括分類、回歸、檢測和檢索,
1、 Emotion Classification(分類)
在情感分類任務中,我們假設樣本只能屬于一個或固定數量的情感類別,其目標是發現資料空間[16]中的類邊界或類分布,目前的作業主要集中在多模態特征和分類器的手工設計或以端到端方式使用深度神經網路,
MER定義為單標簽學習(SLL)問題,為每個樣本分配一個顯性情緒標簽,然而,情感可能是來自不同區域或序列的所有成分的混合物,而不是一個單一的代表性情感,與此同時,不同的人可能有對同一刺激產生不同的情緒反應,這是由性格等多種因素引起的,因此,多標簽學習(MLL)被用來研究一個實體與多個情緒標簽關聯的問題,
最近,為了解決MLL不能很好地適應實際應用的問題,不同標簽重要性的總體分布很重要,標簽分布學習(LDL)被提出,覆寫一定數量的標簽,代表每個情緒標簽描述實體[20]的程度,
2、 Emotion Regression(回歸)
情感回歸的目的是學習一種映射函式可以有效地將一個實體與笛卡爾空間中的連續情感值聯系起來,最常用的MER回歸演算法旨在將平均維數值分配給源資料,為了解決情緒固有的主觀性,研究者提出了預測在維價喚起空間中表現的情緒的連續概率分布的方法,具體地說,可以用高斯混合模型(GMM)來表示情感標簽,然后將情感分布預測形式化為引數學習問題[21],
3、Emotion Detection
由于原始資料不能保證承載情緒,或者只有部分資料能夠引起情緒反應,所以情緒檢測的目的是找出源資料中哪一種情緒在哪里,例如,Yelp上的餐廳評論可能是“這家餐廳就在我作業的街對面,非常方便,步行對我來說是一個巨大的加分!” 在食物方面,那里和我去過的幾乎所有地方都一樣,所以沒什么可說的,我不得不說,客戶服務是命中注定或錯過,”同時,總體評分是3星(滿分5星),這篇評論包含了不同的情緒和態度:第一句是積極的,第二句是中立的,最后一句是消極的,因此,系統檢測哪個句子對應哪個情緒是至關重要的,另一個例子是影像[22]中的情感區域檢測,
4、 Emotion Retrieval
如何基于人的感知來搜索情感內容是另一個有意義的任務,現有框架首先檢測查詢和候選資料源中的區域興趣塊或序列,然后,通過確定兩個patch或序列之間的距離是否小于給定的固定閾值來發現所有匹配的對,查詢與每個候選項之間的相似度得分被計算為匹配組件的數量,然后對該查詢的可候選項進行相應的排名,盡管情感檢索系統有助于從海量存盤庫[10]中獲取具有所需情感的在線內容,但抽象和主觀特征使任務具有挑戰性和難以評估,
五、該領域存在的挑戰和困難
1、Affective Gap(情感鴻溝/差距)
情感鴻溝是MER的主要挑戰之一,它衡量的是提取的特征和感知到的高級情緒之間的不一致性,在客觀多媒體分析中,情感鴻溝比語意鴻溝更具挑戰性,即使語意上的鴻溝被彌合了,情感上的鴻溝仍然可能存在,例如,一朵盛開的玫瑰和一朵凋謝的玫瑰都含有玫瑰,但卻能喚起不同的情感,對于同一個句子,不同的語調可能對應著完全不同的情緒,提取具有區別性的高級特征,特別是與情緒相關的特征,有助于彌合情感鴻溝,主要難點在于如何評價所提取的特征是否與情緒相關,
2、Perception Subjectivity(情感主觀性)
有的人可能會因為巨大的雷聲而感到恐懼,有的人可能會因為捕捉到這樣罕見的場景而感到興奮;即使相同的情緒(如興奮),也會有不同的反應,如面部表情、步態、動作和語言,對于主觀性的挑戰,一個直接的解決方案是學習每個受試者的個性化的MER模型,從刺激的角度,我們也可以預測一定數量被試參與時的情緒分布,除了刺激內容和直接的生理和心理變化外,上述個人因素、情境因素和心理因素的聯合建模也有助于MER任務的完成,
3、Data Incompleteness(資料缺失)
由于在資料采集中存在許多不可避免的因素,如傳感器設備故障,特定形式的資訊可能會被破壞,從而導致資料丟失或不完整,資料不完整是現實世界MER任務中常見的現象,例如,對于明確的情感線索,腦電圖耳機可能會記錄受污染的信號,甚至無法記錄任何信號;在晚上,攝像機無法捕捉到清晰的面部表情,對于內隱情感刺激,一個用戶可能只發布包含影像(沒有文本)的tweet;對于一些視頻,音頻通道變化不大,在這種情況下,最簡單的特征融合方法,即早期融合,是行不通的,因為在沒有捕獲信號的情況下,我們無法提取任何特征,設計能夠處理資料不完整性的有效融合方法是一種廣泛采用的策略,
4、Cross-modality Inconsistency(模態間不一致性)
同一樣本的不同模態可能會相互沖突,從而表達不同的情緒,例如,面部表情和言語可以很容易地被抑制或掩蓋,以避免被發現,但腦電圖信號是由中樞神經系統控制的,可以反映人類無意識的身體變化,當人們在社交媒體上發布推文時,影像與文本在語意上不相關的現象非常普遍,在這種情況下,一種有效的MER方法有望自動評估哪些模式更可靠,例如通過為每個模式分配權重,
5、Cross-modality Imbalance(模態間不平衡性)
在一些MER應用中,不同的模式對喚起的情緒的貢獻可能是不平等的,例如,網路新聞在我們的日常生活中扮演著重要的角色,除了了解讀者的偏好,預測他們的情緒反應在各種應用中都有很大的價值,比如個性化廣告,然而,一篇網路新聞通常包含不平衡的文字和圖片,即文章可能很長,有很多詳細的資訊,而新聞中只有一兩個插圖,可能更有問題的是,新聞編輯可能會為一篇帶有明顯情緒的文章選擇一幅中性的影像,
6、Label Noise And Absence(標簽問題)
現有的MER方法,特別是基于深度學習的MER方法需要大量的標記資料進行訓練,然而,在實際應用中,在生成ground-truth給情緒貼標簽不僅花費昂貴和時間,而且高度不一致,這導致資料量大,但很少或甚至沒有情緒標簽,隨著情感需求的日益多樣化和細粒度化,我們可能有足夠的訓練資料來處理某些情感類別,而不是其他類別,手動注釋的另一種解決方案是利用社交推文的標簽或關鍵字作為情感標簽,但這樣的標簽是不完整的和嘈雜的,因此,為無監督/弱監督學習和少/零次學習設計有效的演算法可以提供潛在的解決方案,
同時,我們可能在一個領域有足夠的標記情感資料,如合成面部表情和語音,問題是如何有效地將經過訓練的MER模型在有標記的源域轉移到另一個未標記的目標域,當使用直接傳輸[23]時,疇移的存在導致顯著的性能下降,多模態域自適應和域泛化有助于緩解這種域間隙,還應該考慮實際的設定,例如多源域,
六、該領域的方法論

一般而言,在目標域具有足夠標記訓練資料的MER框架中,有三個組成部分:表示學習、特征融合和分類器優化,如上圖2所示,在本節中,我們將介紹這些部分,進一步,我們將描述在目標域沒有標記訓練資料和在另一個相關源域有足夠標記資料時的域自適應,
1、Representation Learning of Each Affective Modality (表征學習)
- 為了將文本表示為計算機能夠理解的形式:文本特征可以通過簡單的平均詞向量得到,采用**回圈神經網路(RNN)**對文本中單詞的順序關系進行建模,**卷積神經網路(CNN)**在計算機視覺界得到了廣泛的應用,它也被用來提取單詞之間的背景關系關系,
- 為了提取音頻中情感刺激的代表性特征[13,14]:研究發現,音調、對數能量、過零率、頻譜特征、語音質量和抖動等音頻特征在情感識別中很有用,隨著深度學習的發展,CNN在處理自然資料的許多領域中實作了最先進的大規模任務性能,當然也包括音頻情感識別,音頻通常被轉換成圖形表示,如聲譜圖,然后輸入CNN,由于CNN使用共享權重過濾器和池給模型更好的頻譜和時間不變屬性,它通常產生更好的泛化和更健壯的情感識別模型,
- 為了影像中情感刺激的資訊性表征:一般來說,影像可以分為兩種型別,非限制性影像和面部表情影像,對于前者,例如自然影像,早期開發了各種手工特征,包括顏色、紋理、形狀、構圖等,來代表影像情感[10],這些低級特征是在心理學和藝術理論的啟發下發展起來的,在此基礎上,提出了基于視覺概念的中級特征,以彌補影像像素與情感標簽之間的差距,最具代表性的引擎是SentiBank,它由1200對形容詞-名詞組合而成,在所有的手工工程特征中,它的識別性能非常出色,在深度學習時代,CNN被認為是端到端的強特征提取器,具體來說,為了整合不同層次的各種表示,從CNN的多層提取特征,同時,采用注意機制更好地學習特定區域情緒區域[22]的情緒表征,
- 為了人臉識別影像:首先檢測人臉并對其進行對齊,然后對人臉地標進行編碼進行識別,注意,對于那些偶然包含人臉的非限制性影像,面部表情可以作為一個重要的中間線索,
- 為了構建視頻的表示,人們提出了各種各樣的方法,早期的方法主要利用手工制作的區域表示,包括顏色、運動和鏡頭切割率,隨著深度學習的出現,最近的方法提取有區別的表示,采用3D CNN捕捉多個相鄰幀編碼的時間資訊,在提取視頻中特定模態特征后,對不同型別的特征進行整合,可以獲得更有效的結果,提高性能,
- 對步態[24]表征的學習主要有兩方面的方法來感知情緒:一方面,我們可以明確地建立與情緒相關的姿勢和動作資訊的模型,為了對這些資訊進行建模,我們首先提取一個人的骨骼結構,然后用三維坐標系表示人體的每個關節,在得到這些坐標后,可以很容易地提取不同關節之間的角度、距離或面積(姿態資訊)、速度/加速度(運動資訊)和它們的協方差描述符等,另一方面,高水平的情緒表征可以通過長短期記憶(LSTM)、深度卷積神經網路或圖卷積網路來模擬步態,一些方法從步態視頻中提取光流,然后利用這些網路提取序串列示,其他方法學習步態的骨骼結構,然后將它們輸入多個網路,以提取不同表示,
- 腦電信號可以從大腦對情緒刺激的反應中獲取情緒的頻帶、電沉積、時間等資訊,因此腦電信號在情緒分析中得到了廣泛的應用, 為了提取EEG情緒識別的鑒別特征,從頻帶或電沉積關系中提取微分熵特征是目前常用的方法, 除了手工制作特征外,我們還可以直接將CNN、RNN等端到端深度學習神經網路應用于原始腦電圖信號,獲得強大的深度特征[25], 受人類學習模式的啟發,我們成功地應用了面向空間的注意機制來提取更有分辨力的空間資訊, 此外,考慮到腦電圖信號包含多個通道,還可以在CNN中集成通道注意機制,利用特征圖之間的通道間關系,
2、 Feature Fusion of Different Affective Modalities(特征融合)
Model-free fusion(不直接依賴于特定的無模型融合)
- 早期融合,也稱為特征級融合,直接連接不同形式的特征表示作為一個單一的表示, 它是在早期利用不同模式之間的相互作用來融合不同表征的最直觀的方法,只需要訓練一個單一的模型, 但由于不同形式的表示形式可能存在顯著差異,我們必須考慮時間同步問題,以便在融合之前將這些表示轉換為相同的格式, 當一個或多個模式缺失時,這種早期融合就會失敗,
- 后期融合,又稱決策級融合,是對每個模態的預測結果進行集成, 一些流行的機制包括平均、投票和信號方差, 后期融合的優點包括:(1)靈活性和優越性——可以針對不同的模式選擇最優分類器; (2)穩健性——當某些模式缺失時,晚期融合仍然可以作業, 然而,在做決定之前,不同模式之間的相關性被忽略了,
- 混合融合將早期融合和晚期融合結合在一個統一的框架內發揮各自的優勢,但計算成本較高,
Model-based fusion(基于模型的融合)
基于模型的融合在構建學習模型的程序中進行了明確的融合,因此受到了更多的關注[7,9],近年來,基于神經網路的深度模型、基于注意力的深度模型和基于張量的深度模型被廣泛應用,
- Kernel-based fusion:基于核的融合是基于包含核的分類器的擴展,如支持向量機,對于不同的模式,使用不同的核,核選擇的靈活性和損失函式的凸性使得多核學習融合在包括MER在內的許多應用中很受歡迎,然而,在測驗程序中,這些融合方法依賴于訓練資料中的支持向量,導致存盤成本大,參考效率低,基于圖的融合為每個模態構造單獨的圖或超圖,將這些圖合并成一個融合圖,并通過基于圖的學習來學習不同邊和模態的權值,它可以很好地處理資料不完全性問題,簡單地根據可用資料構造圖,除了提取特征表示外,我們還可以通過相應的邊緣將人類先驗知識融合到模型中,然而,當有更多的訓練樣本時,計算成本將呈指數增長,
- Neural network-based fusion:基于神經網路的融合采用一種直接、直觀的策略,通過神經網路融合不同模式的特征表征或預測結果,基于注意的融合利用一些注意機制來獲得一組具有標量權的特征表示的加權和,這些特征表示由注意模塊動態學習,不同的注意機制對應于融合不同的組件,例如,空間影像注意力衡量的是不同影像區域的重要性,影像和文本共同注意采用對稱注意機制生成視覺和文本表征,平行共注意法和交替共注意法可分別對不同模態同時逐個產生注意,最近,多模態自適應門(Multimodal Adaptation Gate, MAG)被設計用于使基于Transformer的背景關系詞表示,如BERT和XLNet,接受多模態非語言資料[17],基于基于非語言行為的注意,MAG本質上可以將資訊的多種形式映射到一個具有軌跡和大小的向量上,基于張量的融合試圖通過一些特定的張量運算,如外積和多項式張量池,來挖掘不同表示的相關性,這些深度模型融合方法能夠從大量資料中以端到端方式學習,性能較好,但可解釋性較差,
- 上述特征融合方法的一個重要特性是是否支持視頻中MER的時間建模,很明顯,早期融合可以,而晚期融合和混合融合不能,因為在晚期融合之前,基于各模態的預測結果已經已知,對于基于模型的融合,除了基于核的融合,其他的都可以用于時間建模,如基于圖的融合方法可以使用隱馬爾可夫模型(HMM)和條件隨機場(CRF),基于神經網路的融合方法可以使用RNN和LSTM網路,
3、 Classifier Optimization for Multi-modal Emotion Recognition(分類器優化)
- 文本情感:對于以單詞嵌入序串列示的文本,最流行的利用單詞之間語意的方法是RNN和CNN,LSTM是一種典型的RNN,它包含一系列具有相同結構的單元,每個單元格以一個單詞嵌入和上一個單元格的隱藏狀態作為輸入,計算輸出,并更新下一個單元格的隱藏狀態,隱藏的狀態記錄了之前單詞的語意,CNN通過卷積運算計算連續單詞之間的區域背景關系特征,利用平均池層或最大池層進一步整合得到的特征,進行后續的情感分類,最近,研究人員開始使用基于Transformer的方法,如BERT和GPT-3,transformer是由一系列模塊組成的,其中包括一個多頭自注意層,然后是標準化層、前饋網路和另一個標準化層,文本中單詞的順序也由另一個位置嵌入層表示,與RNN相比,Transformer不需要對單詞進行順序處理,提高了并行性,與CNN相比,transformer可以模擬更長距離的單詞之間的關系,
- 音頻情感: 目前用于音頻情感識別的分類方法一般有傳統方法和基于深度學習的方法兩種,在傳統方法中,HMM具有捕獲序列資料動態特征的能力,是一種具有代表性的方法,支持向量機在音頻情感識別中也得到了廣泛的應用,基于深度學習的方法由于不受HMM模型經典獨立性假設的限制而越來越受歡迎,在這些方法中,有關注的序列到序列模型以端到端方式顯示了成功,最近,一些方法通過開發深度混合卷積和回圈模型[14]顯著地擴展了該領域的技術水平,
- 影像情感:早期將多個手工提取的影像特征集成并輸入到支持向量機中來訓練分類器,然后,基于深度學習,通過交叉熵損失[26]等相應的損失函式,對分類器和特征提取器進行端到端連接優化,此外,常用的度量損耗如三重損耗和n對損耗也參與到網路優化中,以獲得更多的鑒別特征,在上述學習范式下,每一幅影像都被預測為一個單一的主導情緒類別,然而,根據心理學的理論,一個影像可能會引起觀眾的多種情緒,從而導致一個模棱兩可的問題,為了解決這個問題,使用標簽分布學習來預測每個情緒類別的具體相對程度,其中Kullback-Leibler分歧是最流行的損失函式,影像中某些資訊豐富、吸引人的區域總是決定著影像的情感,因此,構建了一系列具有額外關注或檢測分支的體系結構,通過對包括注意和原始任務在內的多個任務進行優化,得到了一個更健壯、更具辨識性的模型,
- 視頻情感:現有的方法大多采用兩階段pipeline來識別視頻情感,即提取視覺/音頻特征并訓練分類器,對于分類器的訓練,研究了許多機器學習方法來建模視頻特征和離散情感類別之間的映射,包括SVM、GMM、HMM、動態貝葉斯網路(DBM)和條件隨機時(CRF),盡管上述方法對視頻情感識別的發展做出了貢獻,但基于深度神經網路的情感識別方法由于其卓越的能力[27]而被提出以端到端方式進行視頻情感識別,基于CNN的方法首先利用三維卷積神經網路提取包含情感資訊的高級時空特征,然后利用完全連接層對情感進行分類,最后,用損失函式對模型進行跟蹤,對整個網路進行優化,受人類感知情緒程序的啟發,cnn使用注意機制來強調每個視頻幀或片段中的情緒相關區域,此外,考慮到極性-情緒層次的約束,最近的方法提出極性一致交叉熵損失來指導注意力的生成,
- 步態情感:人的步態可以表示為步行視頻中每一幀的2D或3D關節坐標序列,為了利用關節坐標中固有的情感線索,許多分類器或結構被用來提取步態中的情感特征,LSTM網路包含許多特殊的單元,即記憶單元,可以存盤長時間資料序列中特定時間步長的聯合坐標資訊,因此,它被用于步態情緒識別的早期作業中,LSTM的隱藏特征可以進一步與手工制作的情感特征連接,然后送入分類器(如SVM或隨機森林(RF))來預測情感,近年來,另一種流行的用于步態情緒預測的網路是時空圖卷積網路(ST-GCN),ST-GCN最初被提出用于人體骨骼圖的動作識別,“空間”代表骨骼結構的空間邊緣,即連接身體關節的四肢,“顳邊”指的是顳邊,它們連接著不同框架中每個關節的位置,ST-GCN可以很容易地實作為空間卷積,然后是節奏卷積,類似于深度卷積網路,
- 腦電情感:基于EEG的情感識別在早期階段通常使用支持向量機、決策樹、k-最近鄰等多種分類器對手工特征進行分類,其次,由于CNN和RNN分別擅長提取腦電圖信號的空間資訊和時間資訊,因此采用級聯卷積遞回網路(將CNN和RNN結合起來)、LSTM-RNN、并成功地設計了并行卷積遞回神經網路,并將其應用于情緒識別任務,
4、Domain Adaptation for Multi-modal Emotion Recognition(自適應域)
域自適應的目的是從標記的源域學習一個可遷移的MER模型,該模型可以很好地應用于未標記的目標域[23],最近致力于深度無監督域自適應[23],它采用了兩流架構,一個流用于在標記的源域上訓練MER模型,而另一個流用于對齊源域和目標域,基于對齊策略,現有的單模態域自適應方法可分為基于差異、對抗判別、對抗生成和基于自我監督的方法[23],(更多請閱讀原文,沒翻譯完)
七、相關應用
從多種外顯線索和內隱刺激中識別情緒具有廣泛的現實應用意義,一般來說,情感是我們存在的質量和意義的最重要的方面,它使生活有價值,數字資料的情感影響在于它可以改善現有技術的用戶體驗,進而加強人與計算機之間的知識轉移[18],
1、情感挖掘
許多人傾向于在社交網路上發布文字、圖片和視頻來表達他們的日常生活感受,受此啟發,我們可以挖掘人們對現實世界中發生的話題和事件的看法和情感,例如,Facebook或Instagram上的用戶生成內容可以用來獲取來自不同國家和地區的人們在面對COVID-19[29]等流行病時的態度,研究人員還試圖檢測社交網路中的情緒,并將結果應用于預測政治選舉,注意,當個體的個性化情緒被發現時,我們可以進一步將這些情緒分組,這可能有助于預測社會趨勢,
2、消費者分析
多模態情感識別的另一個重要應用是商業智能,特別是營銷和消費者行為分析[30],如今,大多數服裝電子零售商都使用人體模型來展示產品,模型的面部呈現對消費者接近行為有顯著影響,具體來說,對于情緒接受度高的參與者,微笑的面部表情更容易導致最高接近行為,此外,研究人員在刺激-機體-反應框架的基礎上,考察了網上商店專業化如何影響消費者的愉悅和喚起,情緒識別也可以應用于呼叫中心,其目的是檢測呼叫者和接線員的情緒狀態,該系統通過語調和節奏識別相關的情緒,以及從相應的講話中翻譯出來的文本,在此基礎上,我們可以收到關于服務質量的反饋,
3、醫療/心理健康
同時,情感識別在醫療和心理健康領域具有重要作用,隨著社交媒體的普及,一些人更喜歡在互聯網上分享他們的情緒而不是與他人,如果用戶被觀察到頻繁且持續地分享負面資訊(如悲傷),就有必要跟蹤其心理狀態,防止心理疾病甚至自殺的發生,情緒狀態還可以用來監測和預測各種人的疲勞狀態,如司機、飛行員、裝配線上的工人和教室里的學生,這種方法既能防止危險情況的發生,又有利于作業/學習效率的評估,此外,情緒狀態可以被整合到各種安全應用中,例如監控公共空間(如公交/火車/地鐵站,足球場)的系統,以防范潛在的攻擊行為,最近,在兒童自閉癥譜系障礙(ASD)的診斷和治療程序中引入了一種有效的輔助系統,以輔助收集患兒的病理資訊,為了幫助專業臨床醫生更好、更快地對ASD患者進行診斷和治療,該系統將面部表情和眼睛注視注意力作為自閉癥早期篩查的顯著指標,
4、沉浸式體驗
采用多模態情感識別提高個人娛樂體驗,例如,最近的一項腦電波-音樂界面的研究將腦電圖特征映射到音樂結構(音符、強度和音高),同樣,人們也在努力理解不同模式之間以情感為中心的相關性,這對各種應用至關重要,情感影像-音樂匹配提供了一個很好的機會,將音樂序列附加到給定的影像,在那里它們可能喚起相同的情感,這有助于從移動設備上的個人相冊照片中生成能感知情感的音樂播放串列,
八、未來趨勢預測
現有的方法在視覺-音頻、面部-文本-語音和文本-視覺任務等各種MER設定上取得了很好的性能,然而,所有概括的挑戰都沒有得到充分處理,例如,如何提取與情緒關系更密切的鑒別特征,如何平衡普通情緒反應和個性化情緒反應,以及如何強調更重要的表現形式等,仍是開放的,為提高MER方法的性能,使其適應現實世界的特殊要求,本文提出了一些潛在的發展方向,
1、New Methodologies for MER
- 背景關系和先驗知識建模,用戶的體驗情緒會受到語境資訊(如會話環境和社會環境)的顯著影響,用戶的性格、年齡等先驗知識也有助于情感感知,例如,樂觀的用戶和悲觀的觀眾可能看到相同刺激的不同方面,綜合考慮這些重要的背景知識和先驗知識,有望提高MER績效,圖相關方法,如圖卷積網路,是建模因素和情緒之間關系的可能解決方案,
- 從未標記、不可靠和不匹配的情感信號中學習,在大資料時代,情感資料可能被稀疏標注甚至未標注,原始資料或標簽可能是可靠的,測驗和訓練資料可能是不匹配的,探索先進的機器學習技術,如無監督表示學習、動態資料選擇和平衡、領域適應,以及嵌入情感的特殊屬性,可以幫助解決這些挑戰,
- 可解釋、健壯和安全的MER深度學習,由于黑盒子的特性,很難理解為什么現有的深度神經網路在MER中表現良好,而經過訓練的深度網路容易受到對抗性攻擊和不可避免的噪聲的影響,這些噪聲可能會導致不穩定,從本質上解釋深度學習的決策程序可以幫助設計健壯和安全的MER系統,
- 顯性和隱性信號的結合,顯性和隱性信號都被證明對MER是有用的,但它們也有一些局限性,例如,明確的信號很容易被抑制或難以捕捉,而隱含的信號可能不會實時反映情緒,將它們聯合起來,在觀眾-多媒體互動程序中探索互補的資訊,可以提高MER的性能,
- 將情緒理論融入MER,心理學、生理學、神經學和認知科學都提出了不同的理論,這些理論可以幫助我們理解人類是如何產生情感的,但還沒有被應用于計算機的MER任務中,我們相信這樣的結合對識別情緒更有意義,
2、More Practical MER Settings
- MER in wild,目前的MER方法主要側重于整潔的實驗室設定,然而,現實世界中的MER問題要復雜得多,例如,收集的資料可能包含許多與情緒無關的噪音;測驗集中的用戶與訓練集中的用戶來自不同的文化和語言,導致了不同的情感表達方式;在不同的設定中使用不同的情感標簽空間;培訓資料逐漸可用,設計一個有效的可推廣到這些實際環境的MER模型是值得研究的,
- MER on the edge,在移動電話和安全攝像頭等邊緣設備上部署MER模型時,必須考慮計算限制和資料隱私問題,自動剪枝、神經結構搜索、可逆神經網路和軟硬體協同設計等技術被認為有助于設備上的有效訓練,
- Personalized and group MER,由于情感的主觀性,單純地認識不同個體的主導情感是不夠的,為每個人收集足夠的資料來訓練個性化的MER模型是理想的,但不切實際,一個可能的替代方案是,用少量標記資料將訓練有素的主要情緒的MER模型調整到每個個體,另一方面,如果一群人有著相似的品味、興趣和背景,那么預測他們的情緒就更有意義了,群體情感識別在推薦系統等許多應用中都是非常重要的,但如何將用戶劃分到不同的群體仍然是一個挑戰,
3、Real Applications Based on MER
- Implementation of MER in real-world applications:盡管幾十年來人們一直強調情緒識別的重要性,但由于其相對較低的表現,很少將其應用到真實場景中,隨著最近MER的快速發展,我們可以開始將情感融入到營銷、教育、醫療和服務領域的不同應用中,來自應用程式的反饋可以反過來促進MER的開發,伴隨著情感的產生,我們相信人工情感智能的時代正在到來,
- Wearable, simple, and accurate affective data collection:可穿戴、簡單、準確的情感資料采集,進行MER任務的第一步是收集準確的情感資料,開發可穿戴、簡單甚至非接觸式的傳感器來捕捉這些資料,將會讓用戶更容易接受,
- Security, privacy, ethics, and fairness of MER. During:MER的安全性、隱私性、倫理性和公平性,在資料收集程序中,可以提取用戶的機密資訊,如身份、年齡等,必須考慮到保護用戶的安全和隱私,避免任何濫用的機會,在實際應用中,情緒識別可能會對一個人產生負面甚至危險的影響,比如情緒壓力,消除這種影響的方法也應該從倫理和公平的角度考慮,
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/296781.html
標籤:其他
