入門聯邦學習(FL),在導師的建議下,我決定從客戶端資料異構這一方向出發開展學習,這里就先開個坑,開始記錄自己的學習心得,歡迎各位批評指正,共同學習,
為什么需要聯邦學習
許多資料集本質上是分散的,分布在不同用戶擁有的多個設備上,傳統的機器學習將這些用戶的資料樣本聚集到一個中央存盤器中,并在其上訓練機器學習模型,將資料從本地設備移動到中央存盤器帶來了兩個關鍵挑戰,
首先,它損害了資料的隱私和安全,《General Data Protection Regulation》(GDPR)和 Health Insurance Portability and Accountability Act (HIPAA)等政策規定了相關條款,使得實作這類資料遷移并非易事,
其次,它增加了通信開銷,大量資料的遷移可能帶來非常昂貴的通信開銷,
聯邦學習是什么
聯邦學習(FL)是一個框架,它允許多個用戶(即客戶端)協作訓練一個共享全域模型,并且不需要從他們的本地設備移動資料,中央服務器協調由多個輪次組成的FL程序,在每一輪開始時,服務器將當前的全域模型發送給參與的客戶端,每個客戶都用本地資料對該模型進行訓練,并且只將模型得引數更新發送回服務器,服務器從所有客戶端收集這些更新,并對全域模型進行一次更新,從而完成一輪更新,
通過消除在單個設備上聚合所有資料的需要,聯邦學習克服了上述隱私和通信方面的挑戰,并允許機器學習模型在去中心化資料上進行訓練,
聯邦學習中的異構性問題
在現有的 FL 系統中,參與每一輪更新的客戶端數量通常是固定的,最初的 FL 系統假設全部客戶端都完全參與,即所有客戶端都參與了每一輪的訓練,而在實際應用中,受限于客戶端狀態、網路條件等,FL 的實施方案在每輪訓練中只是隨機選擇一小部分客戶端參與(如FedAVG),但是,由于在 FL 環境中存在大量的異構客戶端(Heterogeneous client),這種隨機選擇客戶端的方式會加劇資料異質性帶來的不利影響 ,
FL 中的異構性主要包括:
(1)各個客戶端設備在存盤、計算和通信能力方面存在異構性;
(2) 各個客戶端設備中本地資料的非獨立同分布(Non-Idependently and Identically Distributed,Non-IID)所導致的資料異構性問題;
(3)各個客戶端設備根據其應用場景所需要的模型異構性問題,
Non-IID
來吧,開始吧,首先FL中的Non-IID是指“參與訓練的客戶端的資料獨立分布但不服從同一采樣方法”,具體分為幾種情況,
以下是《Advances and Open Problems in Federated Learning》對Non-IID的分類
Feature distribution skew (covariate shift): 同一類別,有不同的表現形式,如同樣的數字,不同人的寫法不一樣,
Label distribution skew (prior probability shift): 同樣的標簽,有不同的表現形式,當客戶被系結到特定的地理區域時,標簽的分布因客戶而異,如標簽同樣是動物,但袋鼠大多只在澳大利亞或動物園,
Same label, different features (concept shift): 對于不同的客戶,相同的標簽 y 可以有不同的特征 ,如不同地區的建筑物存在很大差別,
Same features, different label (concept shift): 由于個人喜好,訓練資料中相同的特征向量可以有不同的標簽,例如,反映情緒或next word predictors的標簽具有個人和區域差異,
Quantity skew or unbalancedness: 不同的客戶的資料量不同,
不管是哪種情況的Non-IID,每個設備中的資料分布不能代表全域資料分布,即每個設備中的資料類別都是不完備的,此外,每個類別的樣本數量也會影響Non-IID程度,但數量上的不同一般描述為unbalanced,
Non-IID帶來的不利影響
聯邦學習最初的標準是所有客戶端共享一個全域模型,但對于許多應用程式來說,資料在客戶端之間的分布是Non-IID的,這種資料上的異質性使得很難訓練出一個適合所有客戶的全域模型,
客戶端所帶有資料異構性問題往往會影響全域模型的訓練效率和預測精度,客戶參與聯邦學習主要是希望獲得更好的模型,沒有足夠的私有資料來開發精確的本地模型的客戶將從協作學習中獲得性能更佳得模型,然而,對于那些擁有足夠私有資料來訓練精確的本地模型的客戶來說,在許多任務中全域共享模型不如他們自己訓練的區域模型準確,這種情況下要他們參與訓練全域模型他們自然就不干了,
《Survey of Personalization Techniques for Federated Learning》調查了關于在聯邦學習中為客戶構建個性化模型的最新研究,這些模型預期比全域共享模型或區域個體模型作業得更好,
如何緩解non-iid給FL帶來的影響
這便是我接下來一段時間所要學習和研究的具體方向,后面我將從個性化聯邦學習入手,歡迎類似方向的旁友多多交流!
參考
[1] McMahan B, Moore E, Ramage D, et al. Communication-efficient learning of deep networks from decentralized data[C]//Artificial Intelligence and Statistics. PMLR, 2017: 1273-1282.
[2] Zhao Y, Li M, Lai L, et al. Federated learning with non-iid data[J]. arXiv preprint arXiv:1806.00582, 2018.
[3] Kairouz P, McMahan H B, Avent B, et al. Advances and open problems in federated learning[J]. arXiv preprint arXiv:1912.04977, 2019.
[4] Yang, Q. , et al. “Federated Machine Learning: Concept and Applications.” ACM Transactions on Intelligent Systems and Technology 10.2(2019):1-19.
[5] Kulkarni V , Kulkarni M , Pant A . Survey of Personalization Techniques for Federated Learning[J]. 2020.
轉載請註明出處,本文鏈接:https://www.uj5u.com/qukuanlian/287658.html
標籤:區塊鏈
上一篇:使用 openssl DH_compute_key() 函式計算 DH 密鑰長度不對的問題
下一篇:goland的環境搭建
