前言
自然語言處理中一個重要的任務就是命名物體識別,自1991年開始,命名物體識別逐漸開始走進人們的視野,
隨著深度學習的發展,命名物體識別技術也得到了極大地進步,從最初的基于規則和字典的方法,到現在熱門的注意力機制、圖神經網路等方法,命名物體識別已經在各大資料集上已經取得了很高的準確率,但從自然語言處理實際應用的角度來看,命名物體識別技術依舊面臨著很大的挑戰,
一、命名物體識別概論
1.什么是命名物體識別
命名物體識別(Named Entity Recognition,簡稱NER),又稱作“專名識別”,是指識別文本中具有特定意義的物體,主要包括人名、地名、機構名、專有名詞等,簡單的講,就是識別自然文本中的物體指稱的邊界和類別,

其中產品名、組織、公司、人物就是我們提取出的命名物體,
2.命名物體識別的應用
命名物體識別可以落地到多個應用場景,包括聊天機器人、新聞關鍵資訊提取等等,
2.1 聊天機器人

以上是基于任務式的對話系統的大致流程,這種對話系統也稱之為基于填槽式的對話系統,簡單來講,為了能夠為用戶解決一個問題,AI機器需要獲得相關的資訊,所以整個對話程序實際上就是從用戶那里獲得這些資訊,一旦獲取完畢,就可以對資料庫做進一步查詢,
2.2 簡歷分析

一份簡歷中包含大量的資訊,如果通過HR一份份過,無疑會耗費大量的時間和精力,所以我們如何通過命名物體識別來進行簡歷的關鍵資訊提取呢?

首先這是一個垂直領域內的問題,我們需要構建NER來提取資訊,并且需要自己定義所需要的物體種類,并進行大量的資料標記,

當我們標記好大量資料后,實際上這就是一個分類問題,輸入文本詞語,輸出對應的種類就可以了,那么我們需要構造一個類別數為物體種類的分類器,
二、命名物體識別方法
1.物體識別方法
命名物體識別從早期基于詞典和規則的方法,到傳統機器學習的方法,后來采用基于深度學習的方法,一直到當下熱門的注意力機制、圖神經網路等研究方法,命名物體識別技術路線隨著時間在不斷發展,技術發展趨勢如下圖所示:

1.1 基于規則和字典的方法
基于規則和字典的方法是最初代的命名物體識別使用的方法,這些方法多采用由語言學家通過人工方式,依據資料集特征構建的特定規則模板或者特殊詞典,規則包括關鍵詞、位置詞、方位詞、中心詞、指示詞、統計資訊、標點符號等,詞典是由特征詞構成的詞典和外部詞典共同組成,外部詞典指已有的常識詞典,制定好規則和詞典后,通常使用匹配的方式對文本進行處理以實作命名物體識別,
基于規則的物體識別方法雖然簡單,實際上也比較實用,特別是對于一些垂直領域的應用,或者資料量比較少或者沒有標簽資料的時候,如果我們有一個足夠豐富的詞典庫,那么僅僅根據詞庫也能做到不錯的準確率,另外,基于規則的識別方法是一套非常有效的基準(baseline),
1.2 基于傳統機器學習的方法
在基于機器學習的方法中,命名物體識別被當作是序列標注問題,與分類問題相比,序列標注問題中當前的預測標簽不僅與當前的輸入特征相關,還與之前的預測標簽相關,即預測標簽序列之間是有強相互依賴關系的,采用的傳統機器學習方法主要包括:隱馬爾可夫模型、最大熵、最大熵馬爾可夫模型、支持向量機、條件隨機場 等,
在這 5 種學習方法中,ME結構緊湊,具有較好的通用性,其主要缺點是訓練時間復雜性非常高,甚至導致訓練代價難以承受,另外由于需要明確的歸一化計算,導致開銷比較大,HMM對轉移概率和表現概率直接建模,統計共現概率,ME和SVM在正確率上要 HMM高一些,但是HMM在訓練和識別時的速度要快一些,MEMM對轉移概率和表現概率建立聯合概率,統計條件概率,但由于只在區域做歸一化容易陷入區域最優,CRF模型統計全域概率,在歸一化時考慮資料在全域的分布,而不是僅僅在區域進行歸一化,因此解決了MEMM中標記偏置的問題,在傳統機器學習中,CRF被看作是命名物體識別的主流模型,優點在于在對一個位置進行標注的程序中CRF可以利用內部及背景關系特征資訊,
1.3 基于深度學習的方法
隨著深度學習的不斷發展,命名物體識別的研究重點已轉向深層神經網路,該技術幾乎不需要特征工程和領域知識,Collobert等學者首次提出基于神經網路的命名物體識別方法,該方法中每個單詞具有固定大小的視窗,但未能考慮長距離單詞之間的有效資訊,為了克服這一限制,Chiu和Nichols提出了一種雙向LSTM-CNNs架構,該架構可自動檢測單詞和字符級別的特征,Ma和Hovy進一步將其擴展到BiLSTM-CNNs-CRF體系結構,其中添加了CRF模塊以優化輸出標簽序列,Liu等提出了一種稱為LM-LSTM-CRF的任務感知型神經語言模型,將字符感知型神經語言模型合并到一個多任務框架下,以提取字符級向量化表示,這些端到端模型具備從資料中自動學習的功能,可以很好地識別新物體,
部分學者將輔助資訊和深度學習方法混合使用進行命名物體識別,Liu 等在混合半馬爾可夫條件隨機場的體系結構的基礎上加入了Gazetteers 地名詞典,利用物體在地名詞典的匹配結果作為命名物體識別的特征之一,一些研究嘗試在標簽級別跨資料集共享資訊,Greenberg等提出了一個單一的CRF模型,使用異構標簽集進行命名物體識別,此方法對平衡標簽分布的領域資料集有實用性,Augenstein 等使用標簽向量化表示在任務之間進一步播資訊,Beryozkin等建議使用給定的標簽層次結構共同學習一個在所有標簽集中共享其標簽層的神經網路,取得了非常優異的性能,
近年來,在基于神經網路的結構上加入注意力機制、圖神經網路、遷移學習、遠監督學習等熱門研究技術也是目前的主流研究方向,
總體來講,前兩種方法只是作為基準,一般不會作為生產環境下的方法,最常用的方法莫過于基于CRF的識別,
三、物體消歧
1.物體消歧概念
物體消歧的本質是在于一個詞很有可能有多個意思,也就是在不同的背景關系中所表示的含義不太一樣,

2.物體消歧解法
2.1 基于聚類的物體消歧方法
該方法主要是計算物體指稱項之間的相似度,采用某種聚類演算法對物體指稱項聚類,使得聚類結果中每一個類別都對應于一個目標物體上,主要包括基于表層特征的物體指稱項相似度計算、
基于擴展特征的物體指稱項相似度計算、基于社會化網路的物體指稱項相似度計算,
基于表層特征的物體指稱項相似度計算:
傳統方法多利用表層特征計算相似度,這些方法通常是詞袋模型(Bag of Words,BoW)模型的延伸,性能不好,
這類方法都是基于背景關系表層特征的關聯來計算它們之間的相似度,而沒有考慮到背景關系特征的內在關聯,因此影響聚類效果,
基于擴展特征的物體指稱項相似度計算:
利用知識資源提升物體消歧的性能,
最直接的方法:使用知識資源來擴展物體指稱項的特征表示,
基于社會化網路的物體指稱項相似度計算:
基于社會化網路的物體指稱項相似度通常使用基于圖的演算法,能夠充分利用社會化關系的傳遞性,從而考慮隱藏的關系知識,在某些情況下(特別是結構化資料,eg:論文記錄、電影記錄等)能夠更為準確的物體指稱項相似度計算結果,
缺點:只用到背景關系中的物體資訊,不能完全利用物體指稱項的其他背景關系資訊,因此不能在文本消歧領域取得有競爭力的性能,
2.2 基于物體鏈接的物體消歧方法
基于物體鏈接的物體消歧方法:將物體指稱項鏈接到知識庫中特定的物體,也稱物體鏈接(Entity Linking),
物體鏈接:將一個命名物體的文本指稱項(Textual Mention)鏈接到知識庫中對應物體的程序(若不存在對應物體,則將物體指稱項鏈接到空物體NIL)
物體鏈接的輸入包括兩部分:
- 目標物體知識庫:最常用Wikipedia,或特定領域知識庫,
- 知識庫通常包括:物體表、物體的文本描述、物體的結構化資訊(eg:屬性/屬性值對)、物體的輔助性資訊(eg:物體類別);也經常提供額外的結構化語意資訊,eg:物體之間的關聯
- 待消歧物體指稱項及其背景關系資訊
步驟:
- 鏈接候選過濾(Blocking):根據規則或知識過濾大部分指稱項不可能指向的物體,僅僅保留少量鏈接物體候選,
- 物體鏈接(Linking):給定指稱項及其鏈接候選,確定該物體指稱項最終指向的目標物體,(重點研究)
鏈接候選過濾方法:
大部分是基于物體指稱項詞典:通過在字典中記錄一個指稱項所有可能指向的目標物體來進行鏈接候選過濾,
傳統物體鏈接方法:使用Wikipedia等知識資源構建指稱項詞典,包括Wikipedia Entity Name、Wikipedia Redirection Page等,
為了匹配模糊或拼錯的指稱項,一些基于構詞法的模糊匹配也在TAC評測中使用,eg:Metaphone演算法和Soft TFIDF演算法
物體鏈接方法:
物體鏈接方法選擇與指稱項具有最高一致性打分的物體作為其目標物體,現有方法可分為:向量空間模型、主題一致模型、協同物體鏈接模型、基于神經網路的模型,
2.3 面向結構化文本的物體消歧方法
串列型資料沒有背景關系描述資訊,需要利用物體的類別資訊,物體的流行度和串列中的其他資訊進行消歧,
四、物體統一
1.物體統一概念
同一個物體有不同的表達方式,有時候需要把不同的表達方式統一為同一種表達方式,
例子:”中華人民共和國“,”中國“都表示同一個意思,如果把物體統一,可以減少一些NLP任務的難度,常見的應用場景是在構建知識圖譜中,需要對地名,公司名,專業術語等進行統一,
2.物體統一解法
第一種方法計算相似度方法:
計算兩個物體(字串)之間的相似度,一般使用編輯距離即可,設定閾值,判斷是否屬于一個物體,
第二種基于規則方法:
舉個例子:
- 騰訊有限公司
- 騰訊科技有限公司
我們通過人工的設計一些庫,或者說是一些詞典,這些庫包含相同物體的特點:
- 詞典1:公司、有限公司、分公司…
- 詞典2:北京,天津,上海…
- 詞典3:科技,技術…
如果物體中的詞出現在庫中將其刪掉
- 騰訊有限公司——作為原型,刪掉詞庫中的詞后為:騰訊
- 騰訊科技有限公司 —刪掉詞庫中的詞后為:騰訊
這時候判定為相同物體,但是以上兩種方法精度不高,人力成本比較高,
第三種基于有監督的學習方法:
還是上面的例子:
- 騰訊有限公司
- 騰訊科技有限公司
我們可以將1和2利用特征工程將其轉換為特征向量:比如考慮詞性,前后單詞,詞位置等等,
然后輸入到一個訓練好的分類模型去判斷兩個物體是否相似,
利用余弦相似度技術衡量相似程度,然后再輸入到邏輯回歸模型做二分類的計算,
第四種基于圖的物體統一方法:
其實每個物體都不是獨立的,他們與其他物體是包含一定的聯系,如下圖所以我們在做物體統一的時候我們考慮到了這種物體關系,也就是根據這種圖來做:

假如我們判斷A和B是否是同一個人我們在做特征向量時不僅加入他的個人資訊,還可以加入其他的關系,
然后我們再計算A和B兩者的相似度,設定閾值:判斷大于閾值相似以及小于閾值不相似,
總結
評判一個命名物體是否被正確識別,包括兩個方面:
- 物體的邊界是否正確
- 物體的型別是否標注正確
命名物體識別存在三個難點:
- 領域命名物體識別局限性
- 命名物體表述多樣性和歧義性
- 命名物體的復雜性和開放性
命名物體識別目前的兩個熱點:
- 匱乏資源命名物體識別
- 細粒度命名物體識別
本文是從零開始學NLP系列文章第十五篇,希望小伙伴們多多支持,互相交流,
今天我們就到這里,明天繼續努力!

如果該文章對您有所幫助,麻煩點贊,關注,收藏三連支持下!
創作不易,白嫖不好,各位的支持和認可,是我創作的最大動力!
如果本篇博客有任何錯誤,請批評指教,不勝感激 !!!
參考:
貪心科技學院nlp
一文了解命名物體識別
知識圖譜(五)——物體消歧
物體消歧、物體統一和指代消歧
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/297073.html
標籤:AI
