主頁 > 軟體設計 > ??機器學習入門??(四) PCA 和 LDA 降維演算法 | 附加小練習(文末送書)

??機器學習入門??(四) PCA 和 LDA 降維演算法 | 附加小練習(文末送書)

2021-09-18 15:00:48 軟體設計

  • 🎉粉絲福利送書:《人工智能數學基礎》
  • 🎉點贊 👍 收藏 ?留言 📝 即可參與抽獎送書
  • 🎉下周三(9月22日)晚上20:00將會在【點贊區和評論區】抽一位粉絲送這本書~🙉
  • 🎉詳情請看第三點的介紹嗷~?

請添加圖片描述

目錄

  • 1. PCA 主成分分析
    • 1.1 演算法簡介
    • 1.2 實作思路
    • 1.3 公式推算
      • 1.3.1 PCA順序排序
      • 1.3.2 樣本協方差矩陣
    • 1.4 小練習
  • 2. LDA 線性判斷分析
    • 2.1 演算法簡介
    • 2.2 實作思路
    • 2.3 小練習
  • 3. 福利送書
  • 最后

1. PCA 主成分分析

1.1 演算法簡介

資料樣本雖然是高維的,但是與學習任務緊密相關的或許僅僅是一個低維嵌入,因此可以對資料進行有效的降維

在這里插入圖片描述

主成分分析是一種統計分析簡化資料集的方法,


它利用正交變換來對一系列可能相關的變數的觀測值進行線性變換,從而投影為一系列線性不相關變數的值,這些不相關變數稱為主成分

1.2 實作思路

一般來說,欲獲得低維子空間,最簡單的是對原始高維空間進行線性變換

給定𝒎維空間中的資料點,將其投影到低維空間中,同時盡可能多地保留資訊,

  • 資料在低維線性空間的正交投影

最大化投影資料的方差(紫色線), 最小化資料點與投影之間的均方距離(藍色線之和),

在這里插入圖片描述

  • 主成分概念:

    1. 主成分分析(PCA)的思想是將𝒎維特征映射到𝒌維上(𝒌<𝒎),這𝒌維是全新的正交特征,
    2. 𝒌維特征稱為主成分(PC),是重新構造出來的𝒌維特征
  • 主成分特點:

    1. 源于質心的矢量,
    2. 主成分#1指向最大方差的方向,
    3. 各后續主成分與前一主成分正交,且指向殘差子空間最大方差的方向

1.3 公式推算

1.3.1 PCA順序排序

給定中心化的資料{𝒙_𝟏,𝒙_𝟐,?,𝒙_𝒎},計算主向量:
在這里插入圖片描述
我們最大化𝒙的投影方差
在這里插入圖片描述

我們使殘差子空間中投影的方差最大
在這里插入圖片描述

1.3.2 樣本協方差矩陣

給定資料{𝒙_𝟏,𝒙_𝟐,?,𝒙_𝒎}, 計算協方差矩陣?

在這里插入圖片描述
在這里插入圖片描述

在這里插入圖片描述
在這里插入圖片描述

在這里插入圖片描述

證明不寫了,太多公式了,自行百度吧,

1.4 小練習

給定的影像資料集,探討pca降維后特征個數與聚類性能的關系,

在這里插入圖片描述

from PIL import Image
import numpy as np
import os
from ex1.clustering_performance import clusteringMetrics
from sklearn.cluster import KMeans
from sklearn.decomposition import PCA
import matplotlib.pyplot as plt

plt.rcParams['font.sans-serif'] = 'SimHei'
plt.rcParams['axes.unicode_minus'] = False

def getImage(path):
    images = []
    for root, dirs, files in os.walk(path):
        if len(dirs) == 0:
            images.append([root + "\\" + x for x in files])
    return images

# 加載圖片
images_files = getImage('face_images')
y = []
all_imgs = []
for i in range(len(images_files)):
    y.append(i)
    imgs = []
    for j in range(len(images_files[i])):
        img = np.array(Image.open(images_files[i][j]).convert("L"))  # 灰度
        # img = np.array(Image.open(images_files[i][j])) #RGB
        imgs.append(img)
    all_imgs.append(imgs)

# 可視化圖片
w, h = 180, 200
pic_all = np.zeros((h * 10, w * 10))  # gray
for i in range(10):
    for j in range(10):
        pic_all[i * h:(i + 1) * h, j * w:(j + 1) * w] = all_imgs[i][j]
pic_all = np.uint8(pic_all)
pic_all = Image.fromarray(pic_all)
pic_all.show()

# 構造輸入X
label = []
X = []
for i in range(len(all_imgs)):
    for j in all_imgs[i]:
        label.append(i)
        # temp = j.reshape(h * w, 3) #RGB
        temp = j.reshape(h * w)  # GRAY
        X.append(temp)

def keams_in(X_Data, k):
    kMeans1 = KMeans(k)
    y_p = kMeans1.fit_predict(X_Data)
    ACC, NMI, ARI = clusteringMetrics(label, y_p)
    t = "ACC:{},NMI:{:.4f},ARI:{:.4f}".format(ACC, NMI, ARI)
    print(t)
    return ACC, NMI, ARI

# PCA
def pca(X_Data, n_component, height, weight):
    X_Data = np.array(X_Data)
    pca1 = PCA(n_component)
    pca1.fit(X_Data)
    faces = pca1.components_
    faces = faces.reshape(n_component, height, weight)
    X_t = pca1.transform(X_Data)
    return faces, X_t

def draw(n_component, faces):
    plt.figure(figsize=(10, 4))
    plt.subplots_adjust(hspace=0, wspace=0)
    for i in range(n_component):
        plt.subplot(2, 5, i + 1)
        plt.imshow(faces[i], cmap='gray')
        plt.title(i + 1)
        plt.xticks(())
        plt.yticks(())
    plt.show()

score = []
for i in range(10):
    _, X_trans = pca(X, i + 1, h, w)
    acc, nmi, ari = keams_in(X_trans, 10)
    score.append([acc, nmi, ari])

score = np.array(score)
bar_width = 0.25
x = np.arange(1, 11)
plt.bar(x, score[:, 0], bar_width, align="center", color="orange", label="ACC", alpha=0.5)
plt.bar(x + bar_width, score[:, 1], bar_width, color="blue", align="center", label="NMI", alpha=0.5)
plt.bar(x + bar_width*2, score[:, 2], bar_width, color="red", align="center", label="ARI", alpha=0.5)
plt.xlabel("n_component")
plt.ylabel("精度")
plt.legend()
plt.show()

2. LDA 線性判斷分析

2.1 演算法簡介

當我們映射的時候,由于映射的位置不同,所以我們會有不同的降維后的結果,對于下面兩個,我們可以看出方法2的分類更明顯,方法2是更好的,

在這里插入圖片描述PCA的映射對比,
在這里插入圖片描述

2.2 實作思路

投影后類內方差最小,類間方差最大

就像是上面的那個三維映射例子一樣,我們可以看到,方法2之所以更好,就是因為類內方差最小,類間方差最大,

資料映射到Rk(從d維降到k維),且希望該變換將屬于同一類的樣本映射得越近越好(即最小的類內距離),而將不同類的樣本映射得越遠越好 (即最大的類間距離),同時還能盡能多地保留樣本資料的判別資訊,

在這里插入圖片描述

記𝒁_𝒊={𝑻(𝒙)|𝒙?𝑿_𝒊},從而根據線性判別分析的基本思想,我們希望:

(𝒛_𝟏 ) ?和(𝒛_2 ) ?離的越遠越好

類間離散度
在這里插入圖片描述
𝒁_𝒊 中的元素集中在(𝒛_𝒊 ) ?附近越好

類內離散度
在這里插入圖片描述

在這里插入圖片描述
在這里插入圖片描述輸入:訓練樣本〖{𝒙_𝒊,𝒚_𝒊}〗_(𝒊=𝟏)^𝒏,降維后的維數(特征個數)k.

輸出:𝑿=[𝒙_𝟏, …,𝒙_𝒏 ]的低維度表示𝒁=[𝐳_𝟏, …,𝐳_𝒏 ].

步驟
1.計算類內散度矩陣 Sw;
2.計算類間散度矩陣 Sb;
3.計算矩陣S的負一次方wSb;
4.計算S的負一次方wSb的最大的k個特征值和對應的k個特征向量(w1, w2, …, wk),得到投影矩陣W
5.對樣本集中的每一個樣本特征xi轉化為新的樣本zi=WTxi
6.得到輸出樣本集〖{𝒛_𝒊,𝒚_𝒊}〗_(𝒊=𝟏)^𝒏.

2.3 小練習

給定的影像資料集,探討LDA的降維效果
在這里插入圖片描述

from sklearn import datasets#引入資料集
from sklearn.neighbors import KNeighborsClassifier #KNN
from sklearn.decomposition import PCA
from sklearn.discriminant_analysis import LinearDiscriminantAnalysis
from sklearn.model_selection import train_test_split
import numpy as np
import matplotlib.pyplot as plt #plt用于顯示圖片
from matplotlib import offsetbox

def calLDA(k):
    # LDA
    lda = LinearDiscriminantAnalysis(n_components=k).fit(data,label) # n_components設定降維到n維度
    dataLDA = lda.transform(data)  # 將規則應用于訓練集
    return dataLDA

def calPCA(k):
    # PCA
    pca = PCA(n_components=k).fit(data)
    # 回傳測驗集和訓練集降維后的資料集
    dataPCA = pca.transform(data)
    return dataPCA

def draw():
    # matplotlib畫圖中中文顯示會有問題,需要這兩行設定默認字體

    fig = plt.figure('example', figsize=(11, 6))
    # plt.xlabel('X')
    # plt.ylabel('Y')
    # plt.xlim(xmax=9, xmin=-9)
    # plt.ylim(ymax=9, ymin=-9)
    color = ["red","yellow","blue","green","black","purple","pink","brown","gray","Orange"]
    colors = []
    for target in label:
        colors.append(color[target])
    plt.subplot(121)
    plt.title("LDA 降維可視化")
    plt.scatter(dataLDA.T[0], dataLDA.T[1], s=10,c=colors)
    plt.subplot(122)
    plt.title("PCA 降維可視化")
    plt.scatter(dataPCA.T[0], dataPCA.T[1], s=10, c=colors)

    #plt.legend()
    plt.show()

def plot_embedding(X,title=None):
    x_min, x_max = np.min(X, 0), np.max(X, 0)
    X = (X - x_min) / (x_max - x_min)  # 對每一個維度進行0-1歸一化,注意此時X只有兩個維度
    colors = ['#5dbe80', '#2d9ed8', '#a290c4', '#efab40', '#eb4e4f', '#929591','#ababab','#eeeeee','#aaaaaa','#213832']

    ax = plt.subplot()

    # 畫出樣本點
    for i in range(X.shape[0]):  # 每一行代表一個樣本
        plt.text(X[i, 0], X[i, 1], str(label[i]),
                 # color=plt.cm.Set1(y[i] / 10.),
                 color=colors[label[i]],
                 fontdict={'weight': 'bold', 'size': 9})  # 在樣本點所在位置畫出樣本點的數字標簽

    # 在樣本點上畫出縮略圖,并保證縮略圖夠稀疏不至于相互覆寫
    if hasattr(offsetbox, 'AnnotationBbox'):
        shown_images = np.array([[1., 1.]])  # 假設最開始出現的縮略圖在(1,1)位置上
        for i in range(data.shape[0]):
            dist = np.sum((X[i] - shown_images) ** 2, 1)  # 算出樣本點與所有展示過的圖片(shown_images)的距離
            if np.min(dist) < 4e-3:  # 若最小的距離小于4e-3,即存在有兩個樣本點靠的很近的情況,則通過continue跳過展示該數字圖片縮略圖
                continue
            shown_images = np.r_[shown_images, [X[i]]]  # 展示縮略圖的樣本點通過縱向拼接加入到shown_images矩陣中

            imagebox = offsetbox.AnnotationBbox(
                offsetbox.OffsetImage(datasets.load_digits().images[i], cmap=plt.cm.gray_r),
                X[i])
            ax.add_artist(imagebox)

    #plt.xticks([]), plt.yticks([])  # 不顯示橫縱坐標刻度
    if title is not None:
        plt.title(title)

    plt.show()

data = datasets.load_digits().data#一個數64維,1797個數
label = datasets.load_digits().target
dataLDA = calLDA(2)
dataPCA = calPCA(2)

#draw() #普通圖


plt.rcParams['font.sans-serif'] = ['SimHei']
plt.rcParams['axes.unicode_minus'] = False

plot_embedding(dataLDA,"LDA 降維可視化")
plot_embedding(dataPCA,"PCA 降維可視化")

3. 福利送書

點贊評論即可在參與評論區的抽獎活動,抽一位小伙伴送書~

  • 零基礎也能快速入門,本書從最基礎的高等數學基礎講起,由淺入深,層層遞進,在鞏固固有知識的同時深入講解人工智能的演算法原理,無論讀者是否從事計算機相關行業,是否接觸過人工智能,都能通過本書實作快速入門,
  • 全新視角介紹數學知識,采用計算機程式模擬數學推論的介紹方法,使數學知識更為清晰易懂,更容易讓初學者深入理解數學定理、公式的意義,從而激發起讀者的學習興趣,
  • 理論實踐相結合,每章最后提供根據所在章的理論知識點精心設計的“綜合性實體”,讀者可以通過綜合案例進行實踐操作,為以后的演算法學習奠定基礎,
  • 大量范例原始碼+習題答案,為學習排憂解難,本書所有示例都有清晰完整的原始碼,每章之后設有習題并配套題目答案,講解清晰,解決讀者在學習中的所有困惑,

在這里插入圖片描述

【作者簡介】

  • 唐宇迪,計算機專業博士,網易云課堂人工智能認證行家,51CTO學院講師,CSDN博客專家,
  • 李琳,河南工業大學副教授,在軟體工程、機器學習、人工智能和模式識別等領域有深入研究,
  • 侯惠芳,教授,解放軍資訊工程大學通信與資訊系統專業博士,擅長機器學習、大資料檢索、人工智能和模式識別等,
  • 王社偉,河南工業大學副教授,西北工業大學航空宇航制造專業博士,挪威科技大學訪問學者,對數字化制造、企業管理系統、機器學習、資料挖掘等有豐富的實戰經驗,

最后

小生凡一,期待你的關注,

轉載請註明出處,本文鏈接:https://www.uj5u.com/ruanti/301085.html

標籤:其他

上一篇:字串庫函式及模擬實作【上篇】--- strlen + strcpy + strcat + strcmp

下一篇:經典習題之哥德巴赫猜想,告別低效判斷,開啟高效回圈。附帶質數優化演算法

標籤雲
其他(157675) Python(38076) JavaScript(25376) Java(17977) C(15215) 區塊鏈(8255) C#(7972) AI(7469) 爪哇(7425) MySQL(7132) html(6777) 基礎類(6313) sql(6102) 熊猫(6058) PHP(5869) 数组(5741) R(5409) Linux(5327) 反应(5209) 腳本語言(PerlPython)(5129) 非技術區(4971) Android(4554) 数据框(4311) css(4259) 节点.js(4032) C語言(3288) json(3245) 列表(3129) 扑(3119) C++語言(3117) 安卓(2998) 打字稿(2995) VBA(2789) Java相關(2746) 疑難問題(2699) 细绳(2522) 單片機工控(2479) iOS(2429) ASP.NET(2402) MongoDB(2323) 麻木的(2285) 正则表达式(2254) 字典(2211) 循环(2198) 迅速(2185) 擅长(2169) 镖(2155) 功能(1967) .NET技术(1958) Web開發(1951) python-3.x(1918) HtmlCss(1915) 弹簧靴(1913) C++(1909) xml(1889) PostgreSQL(1872) .NETCore(1853) 谷歌表格(1846) Unity3D(1843) for循环(1842)

熱門瀏覽
  • 面試突擊第一季,第二季,第三季

    第一季必考 https://www.bilibili.com/video/BV1FE411y79Y?from=search&seid=15921726601957489746 第二季分布式 https://www.bilibili.com/video/BV13f4y127ee/?spm_id_fro ......

    uj5u.com 2020-09-10 05:35:24 more
  • 第三單元作業總結

    1.前言 這應該是本學期最后一次寫作業總結了吧。總體來說,對作業的節奏也差不多掌握了,作業做起來的效率也更高了。雖然和之前的作業一樣,作業中都要用到新的知識,但是相比之前,更加懂得了如何利用工具以及資料。雖然之間卡過殼,但總體而言,這幾次作業還算完成的比較好。 2.作業程序總結 相比前兩個單元,此單 ......

    uj5u.com 2020-09-10 05:35:41 more
  • 北航OO(2020)第四單元博客作業暨課程總結博客

    北航OO(2020)第四單元博客作業暨課程總結博客 本單元作業的架構設計 在本單元中,由于UML圖具有比較清晰的樹形結構,因此我對其中需要進行查詢操作的元素進行了包裝,在樹的父節點中存盤所有孩子的參考。考慮到性能問題,我采用了快取機制,一次查詢后盡可能快取已經遍歷過的資訊,以減少遍歷次數。 本單元我 ......

    uj5u.com 2020-09-10 05:35:48 more
  • BUAA_OO_第四單元

    一、UML決議器設計 ? 先看下題目:第四單元實作一個基于JDK 8帶有效性檢查的UML(Unified Modeling Language)類圖,順序圖,狀態圖分析器 MyUmlInteraction,實際上我們要建立一個有向圖模型,UML中的物件(元素)可能與同級元素連接,也可與低級元素相連形成 ......

    uj5u.com 2020-09-10 05:35:54 more
  • 6.1邏輯運算子

    邏輯運算子 1. && 短路與 運算式1 && 運算式2 01.運算式1為true并且運算式2也為true 整體回傳為true 02.運算式1為false,將不會執行運算式2 整體回傳為false 03.只要有一個運算式為false 整體回傳為false 2. || 短路或 運算式1 || 運算式2 ......

    uj5u.com 2020-09-10 05:35:56 more
  • BUAAOO 第四單元 & 課程總結

    1. 第四單元:StarUml檔案決議 本單元采用了圖模型決議UML。 UML檔案可以抽象為圖、子圖、邊的邏輯結構。 在實作中,圖的節點包括類、介面、屬性,子圖包括狀態圖、順序圖等。 采用了三次遍歷UML元素的方法建圖,第一遍遍歷建點,第二、三次遍歷設定屬性、連邊,實作圖物件的初始化。這里借鑒了一些 ......

    uj5u.com 2020-09-10 05:36:06 more
  • 談談我對C# 多型的理解

    面向物件三要素:封裝、繼承、多型。 封裝和繼承,這兩個比較好理解,但要理解多型的話,可就稍微有點難度了。今天,我們就來講講多型的理解。 我們應該經常會看到面試題目:請談談對多型的理解。 其實呢,多型非常簡單,就一句話:呼叫同一種方法產生了不同的結果。 具體實作方式有三種。 一、多載 多載很簡單。 p ......

    uj5u.com 2020-09-10 05:36:09 more
  • Python 資料驅動工具:DDT

    背景 python 的unittest 沒有自帶資料驅動功能。 所以如果使用unittest,同時又想使用資料驅動,那么就可以使用DDT來完成。 DDT是 “Data-Driven Tests”的縮寫。 資料:http://ddt.readthedocs.io/en/latest/ 使用方法 dd. ......

    uj5u.com 2020-09-10 05:36:13 more
  • Python里面的xlrd模塊詳解

    那我就一下面積個問題對xlrd模塊進行學習一下: 1.什么是xlrd模塊? 2.為什么使用xlrd模塊? 3.怎樣使用xlrd模塊? 1.什么是xlrd模塊? ?python操作excel主要用到xlrd和xlwt這兩個庫,即xlrd是讀excel,xlwt是寫excel的庫。 今天就先來說一下xl ......

    uj5u.com 2020-09-10 05:36:28 more
  • 當我們創建HashMap時,底層到底做了什么?

    jdk1.7中的底層實作程序(底層基于陣列+鏈表) 在我們new HashMap()時,底層創建了默認長度為16的一維陣列Entry[ ] table。當我們呼叫map.put(key1,value1)方法向HashMap里添加資料的時候: 首先,呼叫key1所在類的hashCode()計算key1 ......

    uj5u.com 2020-09-10 05:36:38 more
最新发布
  • 【中介者設計模式詳解】C/Java/JS/Go/Python/TS不同語言實作

    * 中介者模式是一種行為型設計模式,它可以用來減少類之間的直接依賴關系,
    * 將物件之間的通信封裝到一個中介者物件中,從而使得各個物件之間的關系更加松散。
    * 在中介者模式中,物件之間不再直接相互互動,而是通過中介者來中轉訊息。 ......

    uj5u.com 2023-04-20 08:20:47 more
  • 露天煤礦現場調研和交流案例分享

    他們集團的資訊化公司及研究院在一個礦區正在做智能礦山的統一平臺的 試點,專案投資大概1億,包括了礦山的各方面的內容,顯示得我們這次交流有點多余。他們2年前開始做智能礦山的規劃,有很多煤礦行業專家的加持,他們的描述是非常完美,但是去年底應該上線的平臺,現在還沒有看到影子。他們確實有很多場景需求,但是被... ......

    uj5u.com 2023-04-20 08:20:25 more
  • 《社區人員管理》實戰案例設計&個人案例分享

    設計是一個讓人夢想成真程序,開始編碼、測驗、除錯之前進行需求分析和架構設計,才能保證關鍵方面都做正確 ......

    uj5u.com 2023-04-20 08:20:17 more
  • 軟體架構生態化-多角色交付的探索實踐

    作為一個技術架構師,不僅僅要緊跟行業技術趨勢,還要結合研發團隊現狀及痛點,探索新的交付方案。在日常中,你是否遇到如下問題 “ 業務需求排期長研發是瓶頸;非研發角色感受不到研發技改提效的變化;引入ISV 團隊又擔心質量和安全,培訓周期長“等等,基于此我們探索了一種新的技術體系及交付方案來解決如上問題。 ......

    uj5u.com 2023-04-20 08:20:10 more
  • 【中介者設計模式詳解】C/Java/JS/Go/Python/TS不同語言實作

    * 中介者模式是一種行為型設計模式,它可以用來減少類之間的直接依賴關系,
    * 將物件之間的通信封裝到一個中介者物件中,從而使得各個物件之間的關系更加松散。
    * 在中介者模式中,物件之間不再直接相互互動,而是通過中介者來中轉訊息。 ......

    uj5u.com 2023-04-20 08:19:44 more
  • 露天煤礦現場調研和交流案例分享

    他們集團的資訊化公司及研究院在一個礦區正在做智能礦山的統一平臺的 試點,專案投資大概1億,包括了礦山的各方面的內容,顯示得我們這次交流有點多余。他們2年前開始做智能礦山的規劃,有很多煤礦行業專家的加持,他們的描述是非常完美,但是去年底應該上線的平臺,現在還沒有看到影子。他們確實有很多場景需求,但是被... ......

    uj5u.com 2023-04-20 08:19:07 more
  • 《社區人員管理》實戰案例設計&個人案例分享

    設計是一個讓人夢想成真程序,開始編碼、測驗、除錯之前進行需求分析和架構設計,才能保證關鍵方面都做正確 ......

    uj5u.com 2023-04-20 08:18:57 more
  • 軟體架構生態化-多角色交付的探索實踐

    作為一個技術架構師,不僅僅要緊跟行業技術趨勢,還要結合研發團隊現狀及痛點,探索新的交付方案。在日常中,你是否遇到如下問題 “ 業務需求排期長研發是瓶頸;非研發角色感受不到研發技改提效的變化;引入ISV 團隊又擔心質量和安全,培訓周期長“等等,基于此我們探索了一種新的技術體系及交付方案來解決如上問題。 ......

    uj5u.com 2023-04-20 08:18:49 more
  • 05單件模式

    #經典的單件模式 public class Singleton { private static Singleton uniqueInstance; //一個靜態變數持有Singleton類的唯一實體。 // 其他有用的實體變數寫在這里 //構造器宣告為私有,只有Singleton可以實體化這個類! ......

    uj5u.com 2023-04-19 08:42:51 more
  • 【架構與設計】常見微服務分層架構的區別和落地實踐

    軟體工程的方方面面都遵循一個最基本的道理:沒有銀彈,架構分層模型更是如此,每一種都有各自優缺點,所以請根據不同的業務場景,并遵循簡單、可演進這兩個重要的架構原則選擇合適的架構分層模型即可。 ......

    uj5u.com 2023-04-19 08:42:41 more