1、正則化的理解
? ? 當模型的復雜度>>資料的復雜度時,會出現過擬合現象,即模型過度擬合了訓練資料,其泛化能力變差,為此,會通過資料增強、降維、正則化等方法防止模型過擬合,
??式子里面,前者為損失函式,后者為正則化項,
??從數學角度理解,以線性回歸為例,其損失函式為:
? ?可以得到:
\[W = (X^TX)^{-1}X^TY \]? ?需要對\(X^TX\)求逆,才能得到解,
? ?對于$X_{N \times P}$,$x_i \in \mathbb{R}^P$,其中$N$為樣本數,$P$為樣本維度,當$P>>N$時,在數學上,表現為$X^TX$不可逆,在現象上,即為模型過擬合,? ?若以\(L2\)正則化方法進行約束,則有:
\[\begin{aligned} J(\omega) &=\sum^{N}_{i=1}||\omega^T -y_i||^2 +\lambda W^TW \\ &=(W^TX^T-Y^T)(XW-Y) + \lambda W^TW \\ &=W^TX^TXW -W^TX^TY-Y^TXW+YY^T+\lambda W^TW \\ &=W^TX^TXW-2W^TX^TY+Y^TY+\lambda W^TW \\ &=W^T(X^TX+\lambda I)W - 2W^TX^TY+Y^TY \end{aligned}\]? ?求導:
\[\begin{aligned} \frac{\partial J(\omega)}{\partial \omega} = 2(X^TX+\lambda I)W -2X^TY \end{aligned} \]? ?解得:
\[\begin{aligned} W = (X^TX+\lambda I)^{-1}X^TY \end{aligned}\]? ? \(X^TX\) 為半正定矩陣,\(\lambda I\) 為半角矩陣,故 \((X^TX+\lambda I)\) 一定可逆,這從數學上解釋了正則化的原因,
2、\(L2\)正則化(嶺回歸,Ridge Regression )
? ?神經網路中,引數 \(\theta\) 包括每一層的權重 \(\omega\) 和偏置 \(b\),通常情況下,只對權重 \(\theta\) 進行懲罰,因為其關聯兩個變數之間的相互作用,而 \(b\) 僅控制一個引數,不進行正則化也不會導致太大方差,為了減小空間,所有層使用共同的權重衰減,
TODO.......
3、\(L1\)正則化(Lasso)
4、Dropout
5、多任務學習(Multi-task)
6、資料增強、添加噪聲等
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/549318.html
標籤:其他
