第五章——神經網路
5.1、神經元模型
神經網路中最基本的成分為神經元模型,用M-P神經元模型來表示,如下圖所示:

每個神經元接收到來自\(n\)個其他神經元傳遞過來的輸入信號,這些輸入信號通過帶權重的連接進行傳遞,神經元接收到的總輸入值將于神經元的閾值進行比較,然后通過激活函式處理以產生神經元的輸出,而理想的激活函式是階躍函式,但其數學特性不夠好,不方便我們計算,因此典型的激活函式為Sigmoid函式,如下圖:

那么功能神經元的輸出公式為\(f(\sum_{i}\omega_ix_i-\theta)\)
此處補充Sigmoid函式的一個知識點:\(y=Sigmoid(x)\)函式的取值可以理解為標記\(y\)取1的概率,這里需要引入指數族分布來進行解釋:
? 對于指數族分布來說,其概率密度函式可以寫成
\[P(y;\eta)=b(y)exp(\eta^TT(y)-\alpha(\eta)) \]其中\(b(y)\)用來進行歸一化從而可以表示成概率,其中\(T(y)\)為關于\(y\)的函式,\(y\)為標記,這一部分最關鍵,另外的\(\eta\)相關可以看成輸入項,
那么對于二項分布來說,有
\[f(y)= \begin{cases} p \quad y=1\\ 1-p \quad y=0 \end{cases} \]則可以寫成
\[p^y(1-p)^{1-y}=e^{ln[p^y(1-p)^{1-y}]}\\ =e^{yln\frac{p}{1-p}+ln(1-p)} \]令\(\eta=ln\frac{p}{1-p}\),則可以化簡出
\[p=\frac{e^{\eta}}{1+e^{\eta}}=\frac{1}{1+e^{-\eta}} \]因此Sigmoid函式可以看成為輸入\(x\)使得輸出取到1概率
5.2、感知機與多層網路
先從最簡單的神經網路模式感知機來認識神經網路,
感知機由兩層神經元組成,如下圖所示:

輸入層接受外界的輸入信號后傳遞給輸出層,注意在感知機中只有輸出層的神經元是M-P神經元,會對輸入進行非線性變化,而輸入層的神經元并不會進行非線性變化,只是將輸入接受并傳遞到下一層的神經元而已,而感知機模型由于只有輸出層進行了激活函式處理(即只擁有單層功能神經元),因此其學習能力非常有限,只能用來處理線性可分的問題,而對于非線性可分的問題則會陷入震蕩,難以收斂,
如果要處理非線性可分的問題,就需要用擁有多層功能神經元的神經網路模型,例如下圖的多層前饋神經網路模型

這種模型的特點在于隱含層和輸出層的神經元都是擁有激活函式的功能神經元,即會對總輸入進行線性變化后再進行輸出的神經元;同時每層神經元與下一層的神經元全互連,神經元之間不存在同層連接,也不存在跨層連接,這是前饋的特點,那么多層網路所需要學習的引數就包括連接神經元之間的各個權重,以及各功能神經元的閾值,
5.3、誤差逆傳播演算法
誤差逆傳播演算法(BP演算法)可用于訓練多層網路,也稱為反向傳播演算法,其具體程序如下:

各種引數的含義在圖中已表明,另外仍需補充:\(\theta_j\)為輸出層第\(j\)個神經元的閾值,而\(\gamma_h\)表示隱層第\(h\)個神經元的閾值,
誤差逆傳播演算法的思想遍歷所有實體(可多次遍歷),在于對每一個實體計算一次預測結果的均方誤差,再對引數進行一次修正,
對于訓練例子\((x_k,y_k)\),假設神經網路的輸出結果為\(\hat{y}_k=(\hat{y}_1^k,\hat{y}_2^k,...\hat{y}_l^k)\)
那么在訓練例子\((x_k,y_k)\)上的均方誤差為:
\[E_k=\frac{1}{2}\sum_{j=1}^{l}(\hat{y}_j^k-y_j^k)^2 \]BP演算法基于梯度下降策略,對目標的負梯度方向對引數進行調整,每個引數具體的更新公式如下:
任意引數的更新估計式為:
\[v\longleftarrow v+\Delta v \]那么每次遍歷一個樣本對每個引數的更新量為:
\[\Delta\omega_{hj}=\eta g_jb_h\\ \Delta \theta_j=-\eta g_j\\ \Delta v_{ih}=\eta e_h x_i\\ \Delta \gamma _h=-\eta e_h\\ \]其中 \(\quad e_h=b_h(1-b_h)\sum_{j=1}^l \omega_{hj}g_j\),而\(\eta \in (0,1)\)代表學習率,其控制著演算法每一輪迭代中的更新步長,若過大則容易陷入震蕩,若太小則收斂速度過慢,
下圖為標準BP演算法的學習程序,可文字表述為:對每一個訓練樣本,BP演算法先將該樣本提供給輸入層神經元,然后逐層將信號前傳直至產生輸出層的結果,然后計算輸出層的誤差,再將誤差反向傳播到隱層神經元,最后再根據隱層神經元的誤差來對連接權和閾值進行調整,遍歷所有樣本來重復以上程序,也可遍歷幾次樣本,直至達到某種停止條件為止,

但需要注意的是,BP演算法的目標實際上是最優化訓練集\(D\)上的累計誤差:
\[E=\frac{1}{m}\sum_{k=1}^mE_k \]但上文介紹的標準BP演算法每次僅針對一個訓練樣本來更新權重,因此會更新得非常頻繁,并在可能在不用樣本之間的引數更新出現“抵消”的情況,所以標準BP演算法往往需要進行多輪回圈的迭代才能夠達到要求,而如果是針對累計誤差的更新則稱為累計BP演算法,它在讀取整個訓練集\(D\)一遍之后計算出累計誤差才對引數進行更新,雖然這樣更新頻率降低但是計算量相對來說會大很多,并且在很多任務中累計誤差下降到一定程度后,進一步下降會非常緩慢,
對于神經網路來說,由于其強大的學習能力和表示能力,在學習程序中會經常出現過擬合的現象,對訓練樣本的學習程度過深,導致訓練誤差持續降低而測驗誤差反而上升,一般來說有兩種緩解BP網路的過擬合的策略:
- 早停:將資料集分為訓練集和驗證集(不是測驗集,測驗集需要用來計算其泛化誤差),訓練集用來計算梯度、更新引數,驗證集用來估計誤差,若訓練集誤差降低而驗證集誤差升高則停止訓練,回傳具有最小驗證集誤差時的各引數值,
- 正則化:其思想就是在誤差目標函式中加入一個用于表示模型復雜度的部分,這就可以在最小化誤差函式的時候同時限制模型的復雜度,
5.4、全域最小與區域最小
對于BP網路來說,由于其是依靠梯度來進行更新的,因此在學習程序中有可能會陷入區域最優(區域最優處梯度也為0)的問題中,為了解決該問題也有以下幾種策略:
- 以多組不同引數值初始化多個神經網路,并按照標準BP演算法訓練后選取其中誤差最小的神經網路的引數做為最終引數,這就相當于從多個不用的初始點開始搜索,更有機會可以找到全域最優,
- 使用模擬退火技術:模擬退火的思想是在每一步都以一定的概率接受比當前解更差的結果,例如在誤差函式下降的程序中有可能會出現接受一個新的引數使得誤差函式值增加,因此這有利于跳出區域最優解,而且隨著迭代程序的深入,接受次優解的概率也會逐漸下降,因此可以保證演算法的穩定性,但這也有可能使演算法跳出全域最優解,
- 使用隨機梯度下降:其實標準BP演算法的思想就是隨機梯度下降的思想,因為標準BP演算法每次進行更新的都是單個樣本的誤差,而不是全部樣本的誤差,這樣由于不同樣本的誤差而導致的引數更新之間可能存在相互抵消的可能性,也就是說遍歷了所有樣本完成了一次回圈的更新,與累計BP演算法對累計誤差所進行的一次更新,可能是不一樣的,因此這就具有一定的隨機性,就算陷入區域最小點,也可能在該點計算某個樣本的誤差梯度時不為0,因此跳出了區域最小點,
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/538547.html
標籤:其他
