目錄
1.作業意義
2.作業難點
3.常見方法分類
4.論文分享
(1) Punctuation prediction for unsegmented transcript based on word vector?
(2) LSTM for Punctuation Restoration in Speech Transcripts
(3) Bidirectional Recurrent Neural Network with Attention Mechanism for PR
(4) Deep Recurrent Neural Networks with Layer-wise Multi-head Attentions for Punctuation Restoration
(5) Self-Attention Based Network for Punctuation Restoration
5.進一步探索
Transformer-based pre-trained language models
(6) Efficient Automatic Punctuation Restoration Using Bidirectional Transformers with Robust Inference
(7) Discriminative Self-training for Punctuation Prediction
何為ELECTRA?
(8) ELECTRA-pre-training text encoders as discriminators rather than generators
6.友情幫助
1.作業意義
- 大多數自動語音識別(ASR)系統輸出一個不間斷的單詞序列,PR可以提高ASR轉錄本的可讀性
- 提高下游自然語言處理應用程式的性能,like machine translation, summarization, question answering, sentiment analysis, syntactic parsing and information extraction.
2.作業難點
- 通常需要大量的標記的語音轉錄本(labeled speech transcripts),人工注釋口語資料是昂貴而費力的
- 基于純詞匯特征的模型不如基于混合特征的模型模型那么強大,然而,基于混合特征的模型的訓練資料很少,也難以獲得,因為它必須是標準化的ASR轉錄本
3.常見方法分類

4.論文分享
目前(大概2015-2021)很多文章提出不同的標點預測方法,我大體按照性能從低到高的順序進行講述
(1) Punctuation prediction for unsegmented transcript based on word vector
簡介
- 首先將文本轉換成一個長單詞序列,將分類問題看作是序列中的一個單詞后面是否跟著一個標點符號,
- 四類: O (means no punctuation mark followed), COMMA, PERIOD and QUESTION.
- 嘗試了三種模型:DNN,CNN-A,CNN-2A
模型輸入
- 單詞嵌入層可以通過隨機初始化從頭開始學習,也可以在訓練整個網路的程序中從預先訓練的詞向量進行微調(GloVe-50d),本文用的后者,輸入大小m*n(m=5個詞,每個詞n=50維)
- 預測每個標點時考慮前面三個單詞,后面兩個單詞,范圍小,所以對問號預測無能為力,

DNN模型
- 三層全連接,隱藏層sigmoid,輸出層softmax.
- 防止過擬合有權重衰減

CNN-A模型
- m×n特征矩陣作為m個完整的字向量,每個濾波器大小h*n,相當于垂直向下做卷積,

CNN-2A模型
- m×n特征矩陣不再作為m個完整的字向量,單詞向量中的數字可以作為獨立的特征,效果更好一些

結果
- 他們的方法較擅長預測標點位置,但進行符號型別區分時性能一般
- 句號恢復好于逗號,因為暫停的語法歧義通常高于句號,特別是在像TED談話的文字記錄這樣不那么正式的文本中


(2) LSTM for Punctuation Restoration in Speech Transcripts

簡介
- RNN-based LSTM,分為兩階段訓練,先在大型文本語料庫上學習文本特征(T-LSTM模型),第二階段時輸入文本特征和韻律特征中的暫停時間在小型語料庫上進行學習(T-LSTM-p模型) 預測每個標點時考慮前面的所有詞匯,后面的一個詞匯,范圍也不大,句號預測的不太好


(3) Bidirectional Recurrent Neural Network with Attention Mechanism for PR

簡介
- 具有注意機制的雙向遞回神經網路模型,LSTM換成GRU(更簡單),
- Estonian datase既有文本特征也有韻律特征,所以采用兩階段訓練(TA-BRNN,TA-BRNN-p)
- English dataset上只使用文本(IWSLT2011 benchmark dataset)(T-BRNN-pre)
- 預測每個標點時考慮前后所有背景關系,所以綜合性能比起前兩篇要好
- 第二階段的模型:將第一階段輸出層,代之為新的回圈GRU層,增加新的softmax輸出層 訓練時固定第一階段的引數,單獨訓練新加入的引數,



(4) Deep Recurrent Neural Networks with Layer-wise Multi-head Attentions for Punctuation Restoration

簡介
- 通過將多個雙向回圈層(GRU)堆疊在一起,使每個層從不同的角度學習不同的背景關系
- attention不僅應用于頂層,每層都有,可以 capture the layer-wise features
- 每個attention都是multi-head attentions, 采用scaled dot-product attention(對比是單頭的additive attention)
- 結果證明層數越多性能越好,最后的模型在n=4(層數),m=3(頭數)性能最佳
- 性能:相比T-BRNN-pre,DRNN-LWMA-pre achieved 4.2% and 3.6% better in F-measure and SER, respectively


(5) Self-Attention Based Network for Punctuation Restoration

簡介
- 將標點符號恢復視為翻譯任務,翻譯源端為無標點序列,目標端有兩個輸出序列:標點符號恢復的序列(它指導模型平均對待每個單詞和標點符號)和標簽序列(它會引導模型輸出標點符號或非標點符號),防止過擬合,提高性能,
- SAPR模型:基于self-attention的Transformer模型,完全基于self-attention,而不需要任何遞回神經網路(RNN)和卷積神經網路(CNN),
- 該模型與transformer之間最顯著的區別是,該模型在解碼器之后有兩個softmax層
- 該方法除了簡單的單標點,還可以恢復復雜標點以及聯合標點
- 性能:與T-BRNN-pre相比,模型取得了顯著的改進(F值在總體上增加了11%),特別是在句號方面,

![]()

5.進一步探索
Transformer-based pre-trained language models
問題1:
- 有些使用大量帶有標點符號的書面語言資料for self-supervised training for punctuation prediction,然而,書面語言資料與口語資料之間存在顯著差異,所以最好還是用 spoken language data(比如ASR輸出),但他們需要人工labeling,
方法:
- 無監督的預訓練大大減少了該任務要達到卓越性能所需的labeled data數量,利用預訓練可以減少訓練時間和提高準確性,Transformer-based pre-trained language models:如,BERT,RoBERTa,ELECTRA
問題2:
- 基于DNN、CNN的方法預測能力較小,基于RNN的方法,由于其遞回性,網路會有順序計算的缺點,
方法:
- 利用transformer模型,偏離回圈體系結構,允許所有輸入tokens之間的直接連接,這使得網路能夠更容對長距離依賴關系進行建模,還允許對每個層進行并行的計算,(并行預測任務比順序任務提供了更豐富的信號,從而更有效地利用每個example)
(6) Efficient Automatic Punctuation Restoration Using Bidirectional Transformers with Robust Inference

模型介紹
- 模型建立在預先訓練好的RoBERTa模型之上,BERT是一個具有多個transformer層和數億個可訓練引數的背景關系語言模型,在具有 masked language modeling目標的大型英語語料庫上訓練,RoBERT是BERT的一種改進模型,


性能總結
- 無監督的預訓練、多個背景關系集成預測、以及增加的并行性,可以在不增加運行時或成本的情況下獲得顯著的性能提高,與T-BRNN-pre比較,該方法要在CPU上快1.2倍,GPUS上78.8倍,

(7) Discriminative Self-training for Punctuation Prediction

簡介
- 也是序列標記任務,預測每個單詞后是否有一個特定的標點符號,
- 聚焦于pretraining-finetuning framework,基于BERT或ELECTRA無監督預訓練模型,探索了微調領域的self-train(ST),
- 提出Discriminative Self-Training (Disc-ST),可以利用未帶標點標記的語音記錄,并證明其在改進標點預測基線方面的有效性,

性能分析
- ELECTRA-large好于RoBERTa-base,更好于BERT-base
- 微調可以有效提升性能


何為ELECTRA?
(8) ELECTRA-pre-training text encoders as discriminators rather than generators

簡介
- 雖然BERT模型在一些NLP任務中性能不錯,但它們通常需要大量的計算才能有效,作者提出一種更簡單高效的訓練任務:replaced token detection,我們的方法不是mask輸入,而是用從小型generator network采樣的合理的替代品來破壞它,
- 任務不是訓練模型讓他恢復已經損壞的tokens的原來樣貌,而是訓練一個判別器,讓他判別被損壞的input中每個token是否是generator network生成的,
- because the task is defined over all input tokens rather than just the small subset that was masked out.所以在相同的模型大小、資料和計算條件下,該方法學習到的背景關系表示大大優于BERT學習到的表示,

6.友情幫助
- 讀者可以繼續調研,本文只是一部分
- 一些實作代碼,可以在GitHub上搜索下圖中關鍵詞,或者通過下面鏈接在筆者GitHub空間找到一部分,
- https://github.com/LJJ12?tab=repositories:
- 下面截圖是我找到的一些開源的標點預測實作代碼


- 下圖是我搜索的一些標點預測相關論文

希望本文對讀者有所幫助,祝您科研愉快,早日產出自己的成果,
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/297393.html
標籤:其他
