主頁 >  其他 > 深度學習-第三章概率與資訊論

深度學習-第三章概率與資訊論

2022-12-01 06:56:33 其他

  • 前言
    • 概率論學科定義
    • 概率與資訊論在人工智能領域的應用
  • 3.1,為什么要使用概率論
  • 3.2,隨機變數
  • 3.3,概率分布
    • 3.3.1,離散型變數和概率質量函式
    • 3.3.2,連續型變數和概率密度分布函式
  • 3.4,邊緣概率
  • 3.5,條件概率
    • 3.5.1,條件概率的鏈式法則
    • 3.6,獨立性和條件獨立性
  • 3.7,條件概率、聯合概率和邊緣概率總結
  • 3.8,期望、方差和協方差
    • 3.8.1,期望
      • 期望數學定義
      • 期望應用
    • 3.8.2,方差
      • 方引數學定義
      • 總體方引數學定義
    • 3.8.3,期望與方差的運算性質
    • 3.8.4,協方差
      • 協方引數學定義
  • 3.9,常用概率分布
    • 3.9.1,伯努利分布
    • 3.9.2,Multinoulli 分布
    • 3.9.3,高斯分布
    • 3.9.4,指數分布和 Laplace 分布
  • 3.10,常用函式的有用性質
  • 3.11,貝葉斯定理
    • 3.11.1,貝葉斯定理公式
    • 3.11.2,貝葉斯理論與概率密度函式
  • 3.12,連續型變數的技術細節
  • 3.13,資訊論-相對熵和交叉熵
  • 3.14,結構化概率模型
  • 參考資料

本文首發于 github,最新版以 github 為主,如果看完文章有所識訓,一定要先點贊后收藏,畢竟,贈人玫瑰,手有余香,
本文內容大多來自《深度學習》(花書)第三章概率與資訊論,目錄的生成是參考此篇 文章,

前言

概率論學科定義

概率論是用于表示不確定性宣告的數學框架,它不僅提供了量化不確定性的方法,也提供了用于匯出新的不確定性宣告statement)的公理,概率論的知識在機器學習和深度學習領域都有廣泛應用,是學習這兩門學科的基礎,

概率與資訊論在人工智能領域的應用

在人工智能領域,概率論主要有兩種用途,

  • 首先,概率定律告訴我們 AI 系統應該如何推理,基于此我們設計一些演算法來計算或者估算由概率論匯出的運算式,
  • 其次,我們可以用概率和統計從理論上分析我們提出的 AI 系統的行為,

雖然概率論允許我們在存在不確定性的情況下做出不確定的陳述和推理,但資訊論允許我們量化概率分布中不確定性的數量,

3.1,為什么要使用概率論

這是因為機器學習必須始終處理不確定的量,有時可能還需要處理隨機(非確定性)的量,這里的不確定性和隨機性可能來自多個方面,而使用使用概率論來量化不確定性的論據,是來源于 20 世紀 80 年代的 Pearl (1988) 的作業,

不確定性有三種可能的來源:

  1. 被建模系統內在的隨機性,
  2. 不完全觀測,
  3. 不完全建模:使用了一些必須舍棄某些觀測資訊的模型,

3.2,隨機變數

隨機變數random variable)是可以隨機地取不同值的變數,它可以是離散或者連續的,

離散隨機變數擁有有限或者可數無限多的狀態,注意這些狀態不一定非要是整數; 它們也可能只是一些被命名的狀態而沒有數值,連續隨機變數伴隨著實數值,注意,隨機變數只是對可能狀態的描述;它必須與指定這些狀態中的每一個的可能性的概率分布相結合,

我們通常用無格式字體 (plain typeface) 中的小寫字母來表示隨機變數本身,而用手寫體中的小寫字母來表示隨機變數能夠取到的值,例如, \(x_1\)\(x_2\) 都是隨機變數 \(\textrm{x}\) 可能的取值,對于向量值變數,我們會將隨機變數寫成 \(\mathbf{x}\),它的一個可能取值為 \(\boldsymbol{x}\)

中文維基百科用 \(X\) 表示隨機變數,用 \(f_{X}(x)\) 表示概率密度函式,本文筆記,不同小節內容兩者混用,

3.3,概率分布

概率分布probability distribution)是用來描述隨機變數或一簇隨機變數在每一個可能取到的狀態的可能性大小,

如果狹義地講,它是指隨機變數的概率分布函式,具有相同概率分布函式的隨機變數一定是相同分布的,連續型和離散型隨機變數的概率分布描述方式是不同的,

3.3.1,離散型變數和概率質量函式

離散型變數的概率分布可以用概率質量函式probability mass function, PMF,也稱概率密度函式)來描述,我們通常用大寫字母 \(P\) 來表示概率質量函式,用 \(\textrm{x} \sim P(\textrm{x})\) 表示隨機變數 \(\textrm{x}\) 遵循的分布

雖然通常每一個隨機變數都會有一個不同的概率質量函式,但是概率質量函式也可以同時作用于多個隨機變數,這種多個變數的概率分布被稱為聯合概率分布joint probability distribution), \(P(\textrm{x} = x, \textrm{y} = y)\) 表示 \(\textrm{x} = x\)\(\textrm{y} = y\) 同時發生的概率,有時也可簡寫為 \(P(x,y)\)

如果一個函式 \(P\) 是隨機變數 \(\textrm{x}\)PMF,必須滿足以下條件:

  • \(P\) 的定義域必須是 \(\textrm{x}\) 所有可能狀態的集合,
  • \(\forall x \in \textrm{x}, 0 \leq P(x)\leq 1\),不可能發生的事件概率為 0,能夠確保一定發生的事件概率為 1
  • \(\sum_{x \in \textrm{x}}P(x)=1\)歸一化normalized),

常見的離散概率分布族有

  • 伯努利分布
  • 二項分布:一般用二項分布來計算概率的前提是,每次抽出樣品后再放回去,并且只能有兩種試驗結果,比如黑球或紅球,正品或次品等,
  • 幾何分布
  • Poisson 分布(泊松分布):Poisson 近似是二項分布的一種極限形式,
  • 離散均勻分布:即對于隨機變數 \(\textrm{x}\),因為其是均勻分布(uniform distribution),所以它的 PMF\(P(\textrm{x}=x_{i}) = \frac{1}{k}\),同時 \(\sum_{i}P(\textrm{x} = x_{i}) = \sum_{i}\frac{1}{k} = \frac{k}{k} = 1\)

3.3.2,連續型變數和概率密度分布函式

連續型隨機變數的概率分布可以用概率密度函式probability desity function, PDF)來描述,

通常用小寫字母 \(p\) 來表示隨機變數 \(\textrm{x}\) 的概率密度函式 PDF,其必須滿足以下條件:

  • \(p\) 的定義域必須是 \(\textrm{x}\) 所有可能狀態的集合,
  • \(\forall x \in \textrm{x}, p(x)\geq 0\),注意,并不要求 \(p(x)\leq 1\)
  • \(\int p(x)dx=1\)

概率密度函式 \(p(x)\) 給出的是落在面積為 \(\delta x\) 的無限小的區域內的概率為 \(p(x)\delta x\)

因此,我們可以對概率密度函式求積分來獲得點集的真實概率質量,特別地,\(x\) 落在集合 \(\mathbb{S}\) 中的概率可以通過 \(p(x)\) 對這個集合求積分來得到,在單變數的例子中,\(x\) 落在區間 \([a,b]\) 的概率是 \(\int_{[a,b]}p(x)dx\)

常見的連續概率分布族有

  • 均勻分布
  • 正態分布:連續型隨機變數的概率密度函式如下所示,其密度函式的曲線呈對稱鐘形,因此又被稱之為鐘形曲線,其中\(\mu\) 是平均值,\(\sigma\) 是標準差,正態分布是一種理想分布,$${f(x)={\frac {1}{\sigma {\sqrt {2\pi }}}}e^{\left(-{\frac {1}{2}}\left({\frac {x-\mu }{\sigma }}\right)^{2}\right)}}$$
  • 伽瑪分布
  • 指數分布

3.4,邊緣概率

邊緣概率好像應用并不多,所以這里理解定義和概念即可,
邊緣概率的通俗理解描述,來源于 數學篇 - 概率之聯合概率、條件概率、邊緣概率和貝葉斯法則(筆記),

有時候,我們知道了一組變數的聯合概率分布,但想要了解其中一個子集的概率分布,這種定義在子集上的概率分布被稱為邊緣概率分布(marginal probability distribution),

對于離散型隨機變數 \(\textrm{x}\)\(\textrm{y}\),知道 \(P(\textrm{x}, \textrm{y})\),可以依據下面的求和法則sum rule)來計算邊緣概率 \(P(\textrm{x})\)

\[\forall x \in \textrm{x},P(\textrm{x}=x)=\sum_{y}P(\textrm{x}=x, \textrm{y}=y) \]

“邊緣概率”的名稱來源于手算邊緣概率的計算程序,當 \(P(x,y)\) 的每個值被寫在由每行表示不同的 \(x\) 值,每串列示不同的 \(y\) 值形成的網格中時,對網格中的每行求和是很自然的事情,然后將求和的結果 \(P(x)\) 寫在每行右邊的紙的邊緣處,

連續性變數的邊緣概率則用積分代替求和:

\[p(x) = \int p(x,y)dy \]

3.5,條件概率

條件概率(conditional probability)就是事件 A 在事件 B 發生的條件下發生的概率,表示為 \(P(A|B)\)

\(A\)\(B\) 為樣本空間 Ω 中的兩個事件,其中 \(P(B) > 0\),那么在事件 \(B\) 發生的條件下,事件 \(A\) 發生的條件概率為:

\[P(A|B)={\frac {P(A\cap B)}{P(B)}} \]

花書中期望的條件概率定義(運算式不一樣,但意義是一樣的,維基百科的定義更容易理解名字意義,花書中的公式更多的是從數學中表達):

將給定 \(\textrm{x} = x\) 時, \(\textrm{y} = y\) 發生的條件概率記為 \(P(\textrm{y} = y|\textrm{x} = x)\),這個條件概率的計算公式如下:

\[P(\textrm{y}=y|\textrm{x}=x)=\frac{P(\textrm{y}=y, \textrm{x}=x)}{P(\textrm{x}=x)} \]

條件概率只在 \(P(\textrm{x}=x)\geq 0\) 時有定義,即不能計算以從未發生的事件為條件的條件概率,

3.5.1,條件概率的鏈式法則

任何多維隨機變數的聯合概率分布,都可以分解成只有一個變數的條件概率相乘的形式,這個規則被稱為概率的鏈式法則chain rule),條件概率的鏈式法則如下:

\[\begin{aligned} P(a,b,c) = P(a|b,c)P(b,c) \\ P(b,c) = P(b|c)P(c) \\ P(a,b,c) = P(s|b,c)P(b|c)P(c) \end{aligned} \]

3.6,獨立性和條件獨立性

兩個隨機變數 \(\textrm{x}\)\(\textrm{y}\),如果它們的概率分布可以表示成兩個因子的乘積形式,并且一個因子只包含 \(\textrm{x}\) 另一個因子只包含 \(\textrm{y}\),我們就稱這兩個隨機變數是相互獨立的(independent):

\[\forall x \in \textrm{x},y \in \textrm{y},p(\textrm{x}=x, \textrm{y}=y)=p(\textrm{x}=x)\cdot p(\textrm{y}=y) \]

兩個相互獨立的隨機變數同時發生的概率可以通過各自發生的概率的乘積得到,

如果關于 \(x\)\(y\) 的條件概率分布對于 \(z\) 的每一個值都可以寫成乘積的形式,那么這兩個隨機變數 \(x\)\(y\) 在給定隨機變數 \(z\) 時是條件獨立的(conditionally independent):

\[\forall x \in ,y \in \textrm{y},z \in \textrm{z}, p(\textrm{x}=x, \textrm{y}=y|z \in \textrm{z})= p(\textrm{x}=x|z \in \textrm{z})\cdot p(\textrm{y}=y|z \in \textrm{z}) \]

采用一種簡化形式來表示獨立性和條件獨立性: \(\textrm{x}\perp \textrm{y}\) 表示 \(\textrm{x}\)\(\textrm{y}\) 相互獨立,\(\textrm{x}\perp \textrm{y}|\textrm{z}\) 表示 \(\textrm{x}\)\(\textrm{y}\) 在給定 \(\textrm{z}\) 時條件獨立,

3.7,條件概率、聯合概率和邊緣概率總結

  1. 條件概率(conditional probability)就是事件 A 在事件 B 發生的條件下發生的概率,條件概率表示為 \(P(A|B)\),讀作“A 在 B 發生的條件下發生的概率”,
  2. 聯合概率表示兩個事件共同發生的概率,AB 的聯合概率表示為 \(P(A\cap B)\) 或者 \(P(A,B)\) 或者 \(P(AB)\)
  3. 僅與單個隨機變數有關的概率稱為邊緣概率,

3.8,期望、方差和協方差

為了便于理解,本章中的數學公式描述采用中文維基百科中的定義,

在概率分布中,期望值和方差或標準差是一種分布的重要特征,期望、數學期望、均值都是一個意思,統計中的方差(樣本方差)是每個樣本值與全體樣本值的平均數之差的平方值的平均數,其意義和概率分布中的方差是不一樣的,

3.8.1,期望

在概率論和統計學中,一個離散性隨機變數的期望值(或數學期望,亦簡稱期望,物理學中稱為期待值)是試驗中每次可能的結果乘以其結果概率的總和,換句話說,期望值像是隨機試驗在同樣的機會下重復多次,所有那些可能狀態平均的結果,也可理解為該變數輸出值的加權平均

期望數學定義

如果 \(X\) 是在概率空間 \((\Omega ,F,P)\) 中的隨機變數,那么它的期望值 \(\operatorname{E}(X)\) 的定義是:

\[\operatorname {E}(X)=\int_{\Omega }X {d}P \]

并不是每一個隨機變數都有期望值的,因為有的時候上述積分不存在,如果兩個隨機變數的分布相同,則它們的期望值也相同

1,如果 \(X\)離散的隨機變數,輸出值為 \(x_{1},x_{2},\ldots x_{1},x_{2},\ldots\),和輸出值相應的概率為 \({\displaystyle p_{1},p_{2},\ldots }p_{1},p_{2},\ldots\)(概率和為 1),

若級數 \(\sum_{i}p_{i}x_{i}\) 絕對收斂,那么期望值 \(\operatorname {E}(X)\) 是一個無限數列的和,

\[\operatorname {E}(X)=\sum_{i}p_{i}x_{i} \]

2,如果 \(X\)連續的隨機變數,且存在一個相應的概率密度函式 \(f(x)\),若積分 \(\int _{-\infty }^{\infty }xf(x)\,\mathrm {d} x\) 絕對收斂,那么 \(X\) 的期望值可以計算為:

\[\operatorname {E} (X)=\int _{-\infty }^{\infty }xf(x)\,\mathrm {d} x \]

雖然是針對于連續的隨機變數的,但與離散隨機變數的期望值的計算演算法卻同出一轍,由于輸出值是連續的,所以只是把求和改成了積分

期望值 \(E\) 是線性函式:

\[\operatorname {E}(aX+bY)=a\operatorname {E}(X)+b\operatorname {E}(Y) \]

\(X\)\(Y\)在同一概率空間的兩個隨機變數(可以獨立或者非獨立),\(a\)\(b\) 為任意實數,

花書中期望的數學定義(運算式不一樣,但意義是一樣的):

1,某個函式 \(f(x)\) 相對于概率分布 \(P(x)\) 的期望或期望值是當從 \(P\) 中抽取 \(x\)\(f\) 所取的平均或平均值,對于離散型隨機變數,期望可以通過求和得到:

\[\mathbb{E}_{\textrm{x}\sim P}[f(x)] = \sum_{x} P(x)f(x) \]

2,對于連續型隨機變數可以通過求積分得到:

\[\mathbb {E}_{\textrm{x}\sim p}[f(x)] = \int p(x)f(x)dx \]

期望應用

  1. 統計學中,估算變數的期望值時,經常用到的方法是重復測量此變數的值,再用所得資料的平均值來估計此變數的期望值,
  2. 概率分布中,期望值和方差或標準差是一種分布的重要特征,

3.8.2,方差

在概率論和統計學中,方差(英語:variance)又稱變異數、變方,描述的是一個隨機變數的離散程度,即該變數離其期望值的距離,是隨機變數與其總體均值或樣本均值的離差的平方的期望值,

方差差是標準差的平方、分布的二階矩,以及隨機變數與其自身的協方差,其常用的符號表示有 \(\sigma^2\)\(s^2\)\(\operatorname {Var} (X)\)\(\displaystyle V(X)\),以及 \(\displaystyle \mathbb {V} (X)\)

方差作為離散度量的優點是,它比其他離散度量(如平均差)更易于代數運算,但缺點是它與隨機變數的單位不同,而標準差則單位相同,這就是計算完成后通常采用標準差來衡量離散程度的原因,

方差的正平方根稱為該隨機變數的標準差,

有兩個不同的概念都被稱為“方差”,一種如上所述,是理論概率分布的方差,而另一種方差是一組觀測值的特征,分別是總體方差(所有可能的觀測)和樣本方差(總體的一個子集),

方引數學定義

\(X\) 為服從分布 \(F\) 的隨機變數,如果 \(\operatorname{E}[X]\) 是隨機變數 \(X\) 的期望值(均值 \(\mu=\operatorname{E}[X]\)),則隨機變數 \(X\) 或者分布 \(F\)方差\(X\)離差平方的期望值:

\[\operatorname{E}(X) = \operatorname{E}[(X - \mu)]^2 = \operatorname{E}[X - \operatorname{E}(X)]^2 \]

方差的運算式可展開如下:

\[{\begin{aligned}\operatorname {Var} (X) &=\operatorname {E} \left[(X-\operatorname {E} [X])^{2}\right]\\[4pt] &=\operatorname {E} \left[X^{2}-2X\operatorname {E} [X]+\operatorname {E} [X]^{2}\right]\\[4pt] &=\operatorname {E} \left[X^{2}\right]-2\operatorname {E} [X]\operatorname {E} [X]+\operatorname {E} [X]^{2}\\[4pt] &=\operatorname {E} \left[X^{2}\right]-\operatorname {E} [X]^{2}\end{aligned}} \]

也就是說,\(X\) 的方差等于 \(X\) 平方的均值減去 \(X\) 均值的平方,

總體方引數學定義

一般而言,一個有限的容量為 \(N\)、元素的值為 \(x_{i}\) 的總體的總體方差為:

\[{\begin{aligned} \sigma ^{2}&={\frac {1}{N}}\sum _{i=1}^{N}\left(x_{i}-\mu \right)^{2} \end{aligned}} \]

花書中方差的定義: 方差variance)衡量的是當我們對 \(x\) 依據它的概率分布進行采樣時,隨機變數 \(\textrm{x}\) 的函式值會呈現多大的差異,或者說一個隨機變數的方差描述的是它的離散程度,也就是該變數離其期望值的距離,方差定義如下:

\[Var(f(x)) = \mathbb{E}[(f(x) - \mathbb{E}[f(x)])^2] \]

3.8.3,期望與方差的運算性質

期望與方差運算性質如下:

期望運算性質

方差運算性質

來源: 知乎文章-【AP統計】期望E(X)與方差Var(X),

3.8.4,協方差

協方差也叫共變異數(英語:Covariance),在概率論與統計學中用于衡量兩個隨機變數的聯合變化程度

協方引數學定義

期望值分別為 \(\operatorname E(X)=\mu\)\(\operatorname E(Y)=\nu\) 的兩個具有有限二階矩的實數隨機變數 \(X\)\(Y\) 之間的協方差定義為:

\[\operatorname {cov} (X,Y)=\operatorname {E} ((X-\mu )(Y-\nu ))=\operatorname {E} (X\cdot Y)-\mu \nu \]

協方差表示的是兩個變數的總體的誤差,這與只表示一個變數誤差的方差不同,

協方差的絕對值如果很大則意味著變數值變化很大并且它們同時距離各自的均值很 遠,如果協方差是正的,那么兩個變數都傾向于同時取得相對較大的值,如果協方 差是負的,那么其中一個變數傾向于取得相對較大的值的同時,另一個變數傾向于 取得相對較小的值,反之亦然,其他的衡量指標如 相關系數(correlation)將每個變 量的貢獻歸一化,為了只衡量變數的相關性而不受各個變數尺度大小的影響,

3.9,常用概率分布

下表列出了一些常用概率分布的方差,

probability_distributions

3.9.1,伯努利分布

伯努利分布(英語:Bernoulli distribution),又名兩點分布或者 0-1 分布,是一個離散型概率分布,為紀念瑞士科學家雅各布·伯努利而命名,若伯努利試驗成功,則伯努利隨機變數取值為 1,若伯努利試驗失敗,則伯努利隨機變數取值為 0,記其成功概率為 \(0\leq p\leq 1\),失敗概率為 \(q = 1-p\),其有如下性質:

  1. 概率質量函式為:

\[f_{X}(x) = p^{x}(1-p)^{1-x} = \left\{\begin{matrix} p \quad if \;x = 1 \\ 1-p \quad if \; x = 0 \end{matrix}\right.\]

  1. 期望值為:

\[\operatorname {E} [X] = \sum_{i=0}^{1} x_{i}f_X(x) = 0 + p = p \]

  1. 方差為:

\[\begin{aligned} Var[X] &= \sum_{i=0}^{1} (x_{i}-\operatorname {E} [X])^2f_{X}(x) \\ &= (0-P)^2(1-P) + (1-P)^2P \\ &= p(1-p) \\ &= p\cdot q \\ \end{aligned}\]

3.9.2,Multinoulli 分布

Multinoulli 分布(多項式分布,也叫范疇分布 categorical dis- tribution)是一種離散概率分布,它描述了隨機變數的可能結果,該隨機變數可以采用 \(k\) 個可能類別之一,概率為每個類別分別指定,其中 \(k\) 是一個有限值,

3.9.3,高斯分布

有幾種不同的方法用來說明一個隨機變數,最直觀的方法是概率密度函式,這種方法能夠表示隨機變數每個取值有多大的可能性,

高斯分布 Gaussian distribution(也稱正態分布 Normal distribution)是一個非常常見的連續概率分布,高斯分布在統計學上十分重要,經常用在自然和社會科學來代表一個不確定的隨機變數,

若隨機變數 \(X\) 服從一個位置引數為 \(\mu\) 、尺度引數為 \(\sigma\) 的正態分布,記為:

\[X \sim N(\mu,\sigma^2) \]

則其概率密度函式為 $$f(x;\mu, \sigma) = \frac {1}{\sigma {\sqrt {2\pi }}};e^{-{\frac {\left(x-\mu \right)^{2}}{2\sigma ^{2}}}}$$

正態分布的數學期望值 \(\mu\) 等于位置引數,決定了分布的位置;其方差 \(\sigma^2\) 的開平方或標準差 \(\sigma\) 等于尺度引數,決定了分布的幅度

正態分布概率密度函式曲線呈鐘形,也稱之為鐘形曲線(類似于寺廟里的大鐘,因此得名),我們通常所說的標準常態分布是位置引數 \(\mu = 0\),尺度引數 \(\sigma ^{2} = 1\) 的正態分布(見右圖中紅色曲線),

四個不同引數集的概率密度函式(紅色線代表標準正態分布)

采用正態分布在很多應用中都是一個明智的選擇,當我們由于缺乏關于某個實 數上分布的先驗知識而不知道該選擇怎樣的形式時,正態分布是默認的比較好的選擇,其中有兩個原因,

  1. 第一,我們想要建模的很多分布的真實情況是比較接近正態分布的,
  2. 第二,在具有相同方差的所有可能的概率分布中,正態分布在實數上具有最 的不確定性,因此,我們可以認為正態分布是對模型加入的先驗知識量最少的分布,

3.9.4,指數分布和 Laplace 分布

在概率論和統計學中,指數分布Exponential distribution)是一種連續概率分布,表示一個在 \(x = 0\) 點處取得邊界點 (sharp point) 的分布,其使用指示函式(indicator function) \(1_{x\geq0}\) 來使得當 \(x\) 取負值時的概率為零,指數分布可以等同于形狀母數 \(\alpha\)\(1\)伽瑪分布

指數分布可以用來表示獨立隨機事件發生的時間間隔,比如旅客進入機場的時間間隔、電話打進客服中心的時間間隔等,

若隨機變數 \(X\) 服從母數為 \(\lambda\)\(\beta\) 的指數分布,則記作

\(X\sim {\text{Exp}}(\lambda )\)\(X\sim {\text{Exp}}(\beta )\)

兩者意義相同,只是 \(\lambda\)\(\beta\) 互為倒數關系,指數分布的概率密度函式為:

\[f(x;{\color {Red}\lambda })=\left\{{\begin{matrix}{\color {Red}\lambda }e^{-{\color {Red}\lambda }x}&x\geq 0,\\0&,\;x<0.\end{matrix}}\right. \]

指數分配概率密度函式曲線如下所示,

指數分配概率密度函式

3.10,常用函式的有用性質

深度學習中的概率分布有一些經常出現的函式,比如 logistic sigmoid 函式:

\[\sigma(x) = \frac{1}{1+exp(-x)} \]

logistic sigmoid 函式通常用來產生伯努利分布的引數 \(p\),因為它的范圍是 \((0, 1)\),位于 \(p\) 引數值的有效范圍內,下圖 3.3 給出了 sigmoid 函式的圖示,從圖中可以明顯看出,sigmoid 函式在變數取絕對值非常大的正值或負值時會出現飽和(saturate)現象,意味著函式會變得很平,并且對輸入的微小改變會變得不敏感

sigmoid函式示意圖

sigmoid 函式的一些性質在后續學習 BP 演算法等內容時會很有用,我們需要牢記:

\[\begin{align} \sigma(x) &= \frac{exp(x)}{exp(x)+exp(0)} \nonumber \\ \frac{d}{dx}\sigma(x) &= \sigma(x)(1 - \sigma(x)) \nonumber \\ 1 - \sigma(x) &= \sigma(-x) \nonumber \\ \end{align} \]

3.11,貝葉斯定理

本小節只是簡單介紹基本概念和公式,更全面和深入的理解建議看《機器學習》書籍,

貝葉斯定理(英語:Bayes' theorem)是概率論中的一個定理,描述在已知一些條件下,某事件的發生概率,比如,如果已知某種健康問題與壽命有關,使用貝葉斯定理則可以通過得知某人年齡,來更加準確地計算出某人有某種健康問題的概率,

通常,事件 A 在事件 B 已發生的條件下發生的概率,與事件 B 在事件 A 已發生的條件下發生的概率是不一樣的,但是,這兩者是有確定的關系的,貝葉斯定理就是這種關系的陳述,貝葉斯公式的一個用途,即透過已知的三個概率而推出第四個概率,貝葉斯定理跟隨機變數的條件概率以及邊際概率分布有關,

作為一個普遍的原理,貝葉斯定理對于所有概率的解釋是有效的,這一定理的主要應用為貝葉斯推斷,是推論統計學中的一種推斷法,這一定理名稱來自于托馬斯·貝葉斯,

來源中文維基百科-貝葉斯定理

3.11.1,貝葉斯定理公式

貝葉斯定理是關于隨機事件 A 和 B 的條件概率的一則定理,

\[P(A\mid B)={\frac {P(A)P(B\mid A)}{P(B)}} \]

其中 A 以及 B 為隨機事件,且 \(P(B)\) 不為零,\(P(A\mid B)\) 是指在事件 B 發生的情況下事件 A 發生的概率,

在貝葉斯定理中,每個名詞都有約定俗成的名稱:

  • \(P(A\mid B)\) 是已知 B 發生后,A 的條件概率,也稱作 A 的事后概率,
  • \(P(A)\) 是 A 的先驗概率(或邊緣概率),其不考慮任何 B 方面的因素,
  • \(P(B\mid A)\) 是已知 A 發生后,B 的條件概率,也可稱為 B 的后驗概率,某些文獻又稱其為在特定 B 時,A 的似然性,因為 \(P(B\mid A)=L(A\mid B)\)
  • \(P(B)\)是 B 的先驗概率

3.11.2,貝葉斯理論與概率密度函式

貝葉斯理論亦可用于概率分布,貝葉斯理論與概率密度的關系是由求極限的方式建立:

\[P(\textrm{x}|\textrm{y}) = \frac{P(\textrm{x})P(\textrm{y}|\textrm{x})}{P(\textrm{y})} \]

注意到 \(P(y)\) 出現在上面的公式中,它通常使用 \(P(\textrm{y}) = \sum_{x} P(\textrm{y}|x)P(x)\) 來計算所以我們并不需要事先知道 \(P(\textrm{y})\) 的資訊,

中文維基百科中貝葉斯理論與概率密度關系定義:

\[f(x|y)={\frac {f(x,y)}{f(y)}}={\frac {f(y|x)\,f(x)}{f(y)}} \]

3.12,連續型變數的技術細節

連續型隨機變數和概率密度函式的深入理解需要用到數學分支測度論(measure theory)的相關內容來擴展概率論,測度論超出了本書范疇,

原書中有測度論的簡要介紹,本筆記不做記錄和摘抄,感興趣的可以閱讀原書,

3.13,資訊論-相對熵和交叉熵

資訊論是應用數學、電子學和計算機科學的一個分支,早期備用在無線通信領域,在深度學習中,主要是使用資訊論的一些關鍵思想來表征(characterize)概率分布或者量化概率分布之間的相似性

資訊論的基本想法是一個不太可能的事件居然發生了,要比一個非常可能的事件發生,能提供更多的資訊,

自資訊只處理單個的輸出,我們可以用香農熵(Shannon entropy)來對整個概率分布中的不確定性總量進行量化:

\[H(P) = H(\textrm{x}) = E_{x~P}[I(x)] = ?E_{x~P}[log P(x)] \]

換句話說,一個概率分布的香農熵是指遵循這個分布的事件所產生的期望資訊總量,

如果我們對于同一個隨機變數 \(\textrm{x}\) 有兩個單獨的概率分布 \(P(x)\)\(Q(x)\),則可以用 KL 散度Kullback-Leibler (KL) divergence,也叫相對熵)來衡量這兩個概率分布的差異

\[D_{KL}(P\parallel Q) = \mathbb{E}_{\textrm{x}\sim p}\begin{bmatrix} log \frac{P(x)}{Q(x)} \end{bmatrix} = \mathbb{E}_{\textrm{x}\sim p}[log P(x) - log Q(x)]\]

KL 散度有很多有用的性質,最重要的是它是非負的,KL 散度為 0 當且僅當 \(P\)\(Q\) 在離散型變數的情況下是相同的概率分布,或者在連續型變數的情況下是 “幾乎處處” 相同的,

一個和 KL 散度密切聯系的量是交叉熵(cross-entropy)\(H(P, Q) = H(P) + D_{KL}(P||Q)\),其計算公式如下:

\[H(P, Q) = -\mathbb{E}_{\textrm{x}\sim p}log Q(x) \]

和 KL 散度相比,少了左邊一項,即熵 \(H(P)\),可以看出,最小化 KL 散度(交叉熵)其實就是在最小化分布之間的交叉熵(KL 散度),

上式的寫法是在前面所學內容數學期望的基礎上給出的,還有一個寫法是《機器學習-周志華》書中附錄 C 中給出的公式,更為直觀理解:

\[KL(P\parallel Q) = \int_{-\infty }^{+\infty} p(x)log \frac{p(x)}{q(x)} dx \]

其中 \(p(x)\)\(q(x)\) 分別為 \(P\)\(Q\) 的概率密度函式,
這里假設兩個分布均為連續型概率分布,對于離散型概率分布,只需要將積分替換為對所有離散值遍歷求和,

KL 散度滿足非負性和不滿足對稱性,將上式展開可得:

\[\text{KL 散度} KL(P\parallel Q) = \int_{-\infty }^{+\infty}p(x)logp(x)dx - \int_{-\infty }^{+\infty}p(x) logq(x)dx = -H(P) + H(P,Q) \]

\[\text{交叉熵} H(P,Q) = \mathbb{E}_{\textrm{x}\sim p} log Q(x) = - \int_{-\infty }^{+\infty} p(x) logq(x)dx \]

其中,\(H(P)\) 為熵(entropy),\(H(P,Q)\) 為交叉熵(cross entropy),

在資訊論中,熵 \(H(P)\) 表示對來自 \(P\) 的隨機遍歷進行編碼所需的最小位元組數,而交叉熵 \(H(P,Q)\) 表示使用 \(Q\) 的編碼對來自 \(P\) 的變數進行編碼所需的位元組數,因此 KL 散度可認為是使用基于 \(Q\) 的編碼對來自 \(P\) 的變數進行編碼所需的“額外位元組數”;顯然,額外位元組數非負,當且僅當 \(P=Q\) 時額外位元組數為 0

3.14,結構化概率模型

參考資料

  • https://zh.m.wikipedia.org/zh-hans/方差#
  • 《深度學習》
  • 《機器學習》

轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/538840.html

標籤:其他

上一篇:NLP實踐!文本語法糾錯模型實戰,搭建你的貼身語法修改小助手 ?

下一篇:圖解來啦!機器學習工業部署最佳實踐!10分鐘上手機器學習部署與大規模擴展 ?

標籤雲
其他(157675) Python(38076) JavaScript(25376) Java(17977) C(15215) 區塊鏈(8255) C#(7972) AI(7469) 爪哇(7425) MySQL(7132) html(6777) 基礎類(6313) sql(6102) 熊猫(6058) PHP(5869) 数组(5741) R(5409) Linux(5327) 反应(5209) 腳本語言(PerlPython)(5129) 非技術區(4971) Android(4554) 数据框(4311) css(4259) 节点.js(4032) C語言(3288) json(3245) 列表(3129) 扑(3119) C++語言(3117) 安卓(2998) 打字稿(2995) VBA(2789) Java相關(2746) 疑難問題(2699) 细绳(2522) 單片機工控(2479) iOS(2429) ASP.NET(2402) MongoDB(2323) 麻木的(2285) 正则表达式(2254) 字典(2211) 循环(2198) 迅速(2185) 擅长(2169) 镖(2155) 功能(1967) .NET技术(1958) Web開發(1951) python-3.x(1918) HtmlCss(1915) 弹簧靴(1913) C++(1909) xml(1889) PostgreSQL(1872) .NETCore(1853) 谷歌表格(1846) Unity3D(1843) for循环(1842)

熱門瀏覽
  • 網閘典型架構簡述

    網閘架構一般分為兩種:三主機的三系統架構網閘和雙主機的2+1架構網閘。 三主機架構分別為內端機、外端機和仲裁機。三機無論從軟體和硬體上均各自獨立。首先從硬體上來看,三機都用各自獨立的主板、記憶體及存盤設備。從軟體上來看,三機有各自獨立的作業系統。這樣能達到完全的三機獨立。對于“2+1”系統,“2”分為 ......

    uj5u.com 2020-09-10 02:00:44 more
  • 如何從xshell上傳檔案到centos linux虛擬機里

    如何從xshell上傳檔案到centos linux虛擬機里及:虛擬機CentOs下執行 yum -y install lrzsz命令,出現錯誤:鏡像無法找到軟體包 前言 一、安裝lrzsz步驟 二、上傳檔案 三、遇到的問題及解決方案 總結 前言 提示:其實很簡單,往虛擬機上安裝一個上傳檔案的工具 ......

    uj5u.com 2020-09-10 02:00:47 more
  • 一、SQLMAP入門

    一、SQLMAP入門 1、判斷是否存在注入 sqlmap.py -u 網址/id=1 id=1不可缺少。當注入點后面的引數大于兩個時。需要加雙引號, sqlmap.py -u "網址/id=1&uid=1" 2、判斷文本中的請求是否存在注入 從文本中加載http請求,SQLMAP可以從一個文本檔案中 ......

    uj5u.com 2020-09-10 02:00:50 more
  • Metasploit 簡單使用教程

    metasploit 簡單使用教程 浩先生, 2020-08-28 16:18:25 分類專欄: kail 網路安全 linux 文章標簽: linux資訊安全 編輯 著作權 metasploit 使用教程 前言 一、Metasploit是什么? 二、準備作業 三、具體步驟 前言 Msfconsole ......

    uj5u.com 2020-09-10 02:00:53 more
  • 游戲逆向之驅動層與用戶層通訊

    驅動層代碼: #pragma once #include <ntifs.h> #define add_code CTL_CODE(FILE_DEVICE_UNKNOWN,0x800,METHOD_BUFFERED,FILE_ANY_ACCESS) /* 更多游戲逆向視頻www.yxfzedu.com ......

    uj5u.com 2020-09-10 02:00:56 more
  • 北斗電力時鐘(北斗授時服務器)讓網路資料更精準

    北斗電力時鐘(北斗授時服務器)讓網路資料更精準 北斗電力時鐘(北斗授時服務器)讓網路資料更精準 京準電子科技官微——ahjzsz 近幾年,資訊技術的得了快速發展,互聯網在逐漸普及,其在人們生活和生產中都得到了廣泛應用,并且取得了不錯的應用效果。計算機網路資訊在電力系統中的應用,一方面使電力系統的運行 ......

    uj5u.com 2020-09-10 02:01:03 more
  • 【CTF】CTFHub 技能樹 彩蛋 writeup

    ?碎碎念 CTFHub:https://www.ctfhub.com/ 筆者入門CTF時時剛開始刷的是bugku的舊平臺,后來才有了CTFHub。 感覺不論是網頁UI設計,還是題目質量,賽事跟蹤,工具軟體都做得很不錯。 而且因為獨到的金幣制度的確讓人有一種想去刷題賺金幣的感覺。 個人還是非常喜歡這個 ......

    uj5u.com 2020-09-10 02:04:05 more
  • 02windows基礎操作

    我學到了一下幾點 Windows系統目錄結構與滲透的作用 常見Windows的服務詳解 Windows埠詳解 常用的Windows注冊表詳解 hacker DOS命令詳解(net user / type /md /rd/ dir /cd /net use copy、批處理 等) 利用dos命令制作 ......

    uj5u.com 2020-09-10 02:04:18 more
  • 03.Linux基礎操作

    我學到了以下幾點 01Linux系統介紹02系統安裝,密碼啊破解03Linux常用命令04LAMP 01LINUX windows: win03 8 12 16 19 配置不繁瑣 Linux:redhat,centos(紅帽社區版),Ubuntu server,suse unix:金融機構,證券,銀 ......

    uj5u.com 2020-09-10 02:04:30 more
  • 05HTML

    01HTML介紹 02頭部標簽講解03基礎標簽講解04表單標簽講解 HTML前段語言 js1.了解代碼2.根據代碼 懂得挖掘漏洞 (POST注入/XSS漏洞上傳)3.黑帽seo 白帽seo 客戶網站被黑帽植入劫持代碼如何處理4.熟悉html表單 <html><head><title>TDK標題,描述 ......

    uj5u.com 2020-09-10 02:04:36 more
最新发布
  • 2023年最新微信小程式抓包教程

    01 開門見山 隔一個月發一篇文章,不過分。 首先回顧一下《微信系結手機號資料庫被脫庫事件》,我也是第一時間得知了這個訊息,然后跟蹤了整件事情的經過。下面是這起事件的相關截圖以及近日流出的一萬條資料樣本: 個人認為這件事也沒什么,還不如關注一下之前45億快遞資料查詢渠道疑似在近日復活的訊息。 訊息是 ......

    uj5u.com 2023-04-20 08:48:24 more
  • web3 產品介紹:metamask 錢包 使用最多的瀏覽器插件錢包

    Metamask錢包是一種基于區塊鏈技術的數字貨幣錢包,它允許用戶在安全、便捷的環境下管理自己的加密資產。Metamask錢包是以太坊生態系統中最流行的錢包之一,它具有易于使用、安全性高和功能強大等優點。 本文將詳細介紹Metamask錢包的功能和使用方法。 一、 Metamask錢包的功能 數字資 ......

    uj5u.com 2023-04-20 08:47:46 more
  • vulnhub_Earth

    前言 靶機地址->>>vulnhub_Earth 攻擊機ip:192.168.20.121 靶機ip:192.168.20.122 參考文章 https://www.cnblogs.com/Jing-X/archive/2022/04/03/16097695.html https://www.cnb ......

    uj5u.com 2023-04-20 07:46:20 more
  • 從4k到42k,軟體測驗工程師的漲薪史,給我看哭了

    清明節一過,盲猜大家已經無心上班,在數著日子準備過五一,但一想到銀行卡里的余額……瞬間心情就不美麗了。最近,2023年高校畢業生就業調查顯示,本科畢業月平均起薪為5825元。調查一出,便有很多同學表示自己又被平均了。看著這一資料,不免讓人想到前不久中國青年報的一項調查:近六成大學生認為畢業10年內會 ......

    uj5u.com 2023-04-20 07:44:00 more
  • 最新版本 Stable Diffusion 開源 AI 繪畫工具之中文自動提詞篇

    🎈 標簽生成器 由于輸入正向提示詞 prompt 和反向提示詞 negative prompt 都是使用英文,所以對學習母語的我們非常不友好 使用網址:https://tinygeeker.github.io/p/ai-prompt-generator 這個網址是為了讓大家在使用 AI 繪畫的時候 ......

    uj5u.com 2023-04-20 07:43:36 more
  • 漫談前端自動化測驗演進之路及測驗工具分析

    隨著前端技術的不斷發展和應用程式的日益復雜,前端自動化測驗也在不斷演進。隨著 Web 應用程式變得越來越復雜,自動化測驗的需求也越來越高。如今,自動化測驗已經成為 Web 應用程式開發程序中不可或缺的一部分,它們可以幫助開發人員更快地發現和修復錯誤,提高應用程式的性能和可靠性。 ......

    uj5u.com 2023-04-20 07:43:16 more
  • CANN開發實踐:4個DVPP記憶體問題的典型案例解讀

    摘要:由于DVPP媒體資料處理功能對存放輸入、輸出資料的記憶體有更高的要求(例如,記憶體首地址128位元組對齊),因此需呼叫專用的記憶體申請介面,那么本期就分享幾個關于DVPP記憶體問題的典型案例,并給出原因分析及解決方法。 本文分享自華為云社區《FAQ_DVPP記憶體問題案例》,作者:昇騰CANN。 DVPP ......

    uj5u.com 2023-04-20 07:43:03 more
  • msf學習

    msf學習 以kali自帶的msf為例 一、msf核心模塊與功能 msf模塊都放在/usr/share/metasploit-framework/modules目錄下 1、auxiliary 輔助模塊,輔助滲透(埠掃描、登錄密碼爆破、漏洞驗證等) 2、encoders 編碼器模塊,主要包含各種編碼 ......

    uj5u.com 2023-04-20 07:42:59 more
  • Halcon軟體安裝與界面簡介

    1. 下載Halcon17版本到到本地 2. 雙擊安裝包后 3. 步驟如下 1.2 Halcon軟體安裝 界面分為四大塊 1. Halcon的五個助手 1) 影像采集助手:與相機連接,設定相機引數,采集影像 2) 標定助手:九點標定或是其它的標定,生成標定檔案及內參外參,可以將像素單位轉換為長度單位 ......

    uj5u.com 2023-04-20 07:42:17 more
  • 在MacOS下使用Unity3D開發游戲

    第一次發博客,先發一下我的游戲開發環境吧。 去年2月份買了一臺MacBookPro2021 M1pro(以下簡稱mbp),這一年來一直在用mbp開發游戲。我大致分享一下我的開發工具以及使用體驗。 1、Unity 官網鏈接: https://unity.cn/releases 我一般使用的Apple ......

    uj5u.com 2023-04-20 07:40:19 more