一、GlusterFS 概述
1.1GlusterFS簡介
GlusterFS 是一個開源的分布式檔案系統,
由存盤服務器、客戶端以及NFS/Samba 存盤網關(可選,根據需要選擇使用)組成,
沒有元資料服務器組件,這有助于提升整個系統的性能、可靠性和穩定性,
傳統的分布式檔案系統大多通過元服務器來存盤元資料,元資料包含存盤節點上的目錄資訊、目錄結構等,這樣的設計在瀏覽目錄時效率高,但是也存在一些缺陷,例如單點故障,一旦元資料服務器出現故障,即使節點具備再高的冗余性,整個存盤系統也將崩潰,而 GlusterFS 分布式檔案系統是基于無元服務器的設計,資料橫向擴展能力強,具備較高的可靠性及存盤效率,
GlusterFS同時也是Scale-Out(橫向擴展)存盤解決方案Gluster的核心,在存盤資料方面具有強大的橫向擴展能力,通過擴展能夠支持數PB存盤容量和處理數千客戶端,
GlusterFS支持借助TCP/IP或InfiniBandRDMA網路(一種支持多并發鏈接的技術,具有高帶寬、低時延、高擴展性的特點)將物理分散分布的存盤資源匯聚在一起,統一提供存盤服務,并使用統一全域命名空間來管理資料,
1.2GlusterFS特點
●擴展性和高性能
GlusterFS利用雙重特性來提供高容量存盤解決方案,
(1)Scale-Out架構允許通過簡單地增加存盤節點的方式來提高存盤容量和性能(磁盤、計算和I/O資源都可以獨立增加),支持10GbE和 InfiniBand等高速網路互聯,
(2)Gluster彈性哈希(ElasticHash)解決了GlusterFS對元資料服務器的依賴,改善了單點故障和性能瓶頸,真正實作了并行化資料訪問,GlusterFS采用彈性哈希演算法在存盤池中可以智能地定位任意資料分片(將資料分片存盤在不同節點上),不需要查看索引或者向元資料服務器查詢,
●高可用性
GlusterFS可以對檔案進行自動復制,如鏡像或多次復制,從而確保資料總是可以訪問,甚至是在硬體故障的情況下也能正常訪問,
當資料出現不一致時,自我修復功能能夠把資料恢復到正確的狀態,資料的修復是以增量的方式在后臺執行,幾乎不會產生性能負載,
GlusterFS可以支持所有的存盤,因為它沒有設計自己的私有資料檔案格式,而是采用作業系統中主流標準的磁盤檔案系統(如EXT3、XFS等)來存盤檔案,因此資料可以使用傳統訪問磁盤的方式被訪問,
●全域統一命名空間
分布式存盤中,將所有節點的命名空間整合為統一命名空間,將整個系統的所有節點的存盤容量組成一個大的虛擬存盤池,供前端主機訪問這些節點完成資料讀寫操作,
●彈性卷管理
GlusterFS通過將資料儲存在邏輯卷中,邏輯卷從邏輯存盤池進行獨立邏輯劃分而得到,
邏輯存盤池可以在線進行增加和移除,不會導致業務中斷,邏輯卷可以根據需求在線增長和縮減,并可以在多個節點中實作負載均衡,
檔案系統配置也可以實時在線進行更改并應用,從而可以適應作業負載條件變化或在線性能調優,
●基于標準協議
Gluster 存盤服務支持 NFS、CIFS、HTTP、FTP、SMB 及 Gluster原生協議,完全與 POSIX 標準(可移植作業系統介面)兼容,
現有應用程式不需要做任何修改就可以對Gluster 中的資料進行訪問,也可以使用專用 API 進行訪問,
1.3GlusterFS 術語
●Brick(存盤塊):
指可信主機池中由主機提供的用于物理存盤的專用磁區,是GlusterFS中的基本存盤單元,同時也是可信存盤池中服務器上對外提供的存盤目錄,
存盤目錄的格式由服務器和目錄的絕對路徑構成,表示方法為 SERVER:EXPORT,如 192.168.80.10:/data/mydir/,
●Volume(邏輯卷):
一個邏輯卷是一組 Brick 的集合,卷是資料存盤的邏輯設備,類似于 LVM 中的邏輯卷,大部分 Gluster 管理操作是在卷上進行的,
●FUSE:
是一個內核模塊,允許用戶創建自己的檔案系統,無須修改內核代碼,
●VFS:
內核空間對用戶空間提供的訪問磁盤的介面,
●Glusterd(后臺管理行程):
在存盤群集中的每個節點上都要運行,
1.4模塊化堆疊式架構
GlusterFS 采用模塊化、堆疊式的架構,
通過對模塊進行各種組合,即可實作復雜的功能,例如 Replicate 模塊可實作 RAID1,Stripe 模塊可實作 RAID0, 通過兩者的組合可實作 RAID10 和 RAID01,同時獲得更高的性能及可靠性,
1.5GlusterFS 的作業流程
(1)客戶端或應用程式通過 GlusterFS 的掛載點訪問資料,
(2)linux系統內核通過 VFS API 收到請求并處理,
(3)VFS 將資料遞交給 FUSE 內核檔案系統,并向系統注冊一個實際的檔案系統 FUSE,而 FUSE 檔案系統則是將資料通過 /dev/fuse 設備檔案遞交給了 GlusterFS client 端,可以將 FUSE 檔案系統理解為一個代理,
(4)GlusterFS client 收到資料后,client 根據組態檔的配置對資料進行處理,
(5)經過 GlusterFS client 處理后,通過網路將資料傳遞至遠端的 GlusterFS Server,并且將資料寫入到服務器存盤設備上,
1.6彈性 HASH 演算法
彈性 HASH 演算法是 Davies-Meyer 演算法的具體實作,通過 HASH 演算法可以得到一個 32 位的整數范圍的 hash 值,
假設邏輯卷中有 N 個存盤單位 Brick,則 32 位的整數范圍將被劃分為 N 個連續的子空間,每個空間對應一個 Brick,
當用戶或應用程式訪問某一個命名空間時,通過對該命名空間計算 HASH 值,根據該 HASH 值所對應的 32 位整數空間定位資料所在的 Brick,
#彈性 HASH 演算法的優點:
保證資料平均分布在每一個 Brick 中,
解決了對元資料服務器的依賴,進而解決了單點故障以及訪問瓶頸,
二、GlusterFS的卷型別
GlusterFS 支持七種卷,即分布式卷、條帶卷、復制卷、分布式條帶卷、分布式復制卷、條帶復制卷和分布式條帶復制卷,
2.1分布式卷(Distribute volume)
檔案通過 HASH 演算法分布到所有 Brick Server 上,這種卷是 GlusterFS 的默認卷;以檔案為單位根據 HASH 演算法散列到不同的 Brick,其實只是擴大了磁盤空間,如果有一塊磁盤損壞,資料也將丟失,屬于檔案級的 RAID0, 不具有容錯能力,
在該模式下,并沒有對檔案進行分塊處理,檔案直接存盤在某個 Server 節點上, 由于直接使用本地檔案系統進行檔案存盤,所以存取效率并沒有提高,反而會因為網路通信的原因而有所降低,
(1)示例原理:File1 和 File2 存放在 Server1,而 File3 存放在 Server2,檔案都是隨機存盤,一個檔案(如 File1)要么在 Server1 上,要么在 Server2 上,不能分塊同時存放在 Server1和 Server2 上,
(2)分布式卷具有如下特點:
- 檔案分布在不同的服務器,不具備冗余性,
- 更容易和廉價地擴展卷的大小,
- 單點故障會造成資料丟失,
- 依賴底層的資料保護,
#創建一個名為dis-volume的分布式卷,檔案將根據HASH分布在server1:/dir1、server2:/dir2和server3:/dir3中
gluster volume create dis-volume server1:/dir1 server2:/dir2 server3:/dir3
2.2條帶卷(Stripe volume)
類似 RAID0,檔案被分成資料塊并以輪詢的方式分布到多個 Brick Server 上,檔案存盤以資料塊為單位,支持大檔案存盤, 檔案越大,讀取效率越高,但是不具備冗余性,
(1)示例原理:File 被分割為 6 段,1、3、5 放在 Server1,2、4、6 放在 Server2,
(2)條帶卷特點:
- 資料被分割成更小塊分布到塊服務器群中的不同條帶區,
- 分布減少了負載且更小的檔案加速了存取的速度,
- 沒有資料冗余,
#創建了一個名為stripe-volume的條帶卷,檔案將被分塊輪詢的存盤在Server1:/dir1和Server2:/dir2兩個Brick中
gluster volume create stripe-volume stripe 2 transport tcp server1:/dir1 server2:/dir2
2.3復制卷(Replica volume)
將檔案同步到多個 Brick 上,使其具備多個檔案副本,屬于檔案級 RAID 1,具有容錯能力,因為資料分散在多個 Brick 中,所以讀性能得到很大提升,但寫性能下降,
復制卷具備冗余性,即使一個節點損壞,也不影響資料的正常使用,但因為要保存副本,所以磁盤利用率較低,
(1)示例原理:File1 同時存在 Server1 和 Server2,File2 也是如此,相當于 Server2 中的檔案是 Server1 中檔案的副本,
(2)復制卷特點:
- 卷中所有的服務器均保存一個完整的副本,
- 卷的副本數量可由客戶創建的時候決定,但復制數必須等于卷中 Brick 所包含的存盤服務器數,
- 至少由兩個塊服務器或更多服務器,
- 具備冗余性,
#創建名為rep-volume的復制卷,檔案將同時存盤兩個副本,分別在Server1:/dir1和Server2:/dir2兩個Brick中
gluster volume create rep-volume replica 2 transport tcp server1:/dir1 server2:/dir2
2.4分布式條帶卷(Distribute Stripe volume)
Brick Server 數量是條帶數(資料塊分布的 Brick 數量)的倍數,兼具分布式卷和條帶卷的特點, 主要用于大檔案訪問處理,創建一個分布式條帶卷最少需要 4 臺服務器,
(1)示例原理:
File1 和 File2 通過分布式卷的功能分別定位到Server1和 Server2,
在 Server1 中,File1 被分割成 4 段,其中 1、3 在 Server1 中的 exp1 目錄中,2、4 在 Server1 中的 exp2 目錄中,
在 Server2 中,File2 也被分割成 4 段,其中 1、3 在 Server2 中的 exp3 目錄中,2、4 在 Server2 中的 exp4 目錄中,
#創建一個名為dis-stripe的分布式條帶卷
配置分布式的條帶卷時,卷中Brick所包含的存盤服務器數必須是條帶數的倍數(>=2倍),Brick 的數量是 4(Server1:/dir1、Server2:/dir2、Server3:/dir3 和 Server4:/dir4),條帶數為 2(stripe 2)
gluster volume create dis-stripe stripe 2 transport tcp server1:/dir1 server2:/dir2 server3:/dir3 server4:/dir4
創建卷時,存盤服務器的數量如果等于條帶或復制數,那么創建的是條帶卷或者復制卷;如果存盤服務器的數量是條帶或復制數的 2 倍甚至更多,那么將創建的是分布式條帶卷或分布式復制卷,
2.5分布式復制卷(Distribute Replica volume)
Brick Server 數量是鏡像數(資料副本數量)的倍數,兼具分布式卷和復制卷的特點,主要用于需要冗余的情況下,
(1)示例原理:
File1 和 File2 通過分布式卷的功能分別定位到 Server1 和 Server2,
在存放 File1 時,File1 根據復制卷的特性,將存在兩個相同的副本,分別是 Server1 中的exp1 目錄和 Server2 中的 exp2 目錄,
在存放 File2 時,File2 根據復制卷的特性,也將存在兩個相同的副本,分別是 Server3 中的 exp3 目錄和 Server4 中的 exp4 目錄,
#創建一個名為dis-rep的分布式復制卷
配置分布式的復制卷時,卷中Brick所包含的存盤服務器數必須是復制數的倍數(>=2倍),Brick 的數量是 4(Server1:/dir1、Server2:/dir2、Server3:/dir3 和 Server4:/dir4),復制數為 2(replica 2)
gluster volume create dis-rep replica 2 transport tcp server1:/dir1 server2:/dir2 server3:/dir3 server4:/dir4
2.6條帶復制卷(Stripe Replica volume)
類似 RAID 10,同時具有條帶卷和復制卷的特點,
2.7分布式條帶復制卷(Distribute Stripe Replicavolume)
三種基本卷的復合卷,通常用于類 Map Reduce 應用,
三、部署GlusterFs 群集
環境準備:【準備環境(所有node節點上操作)】
3.1關閉防火墻
3.2磁盤磁區,并掛載
3.3修改主機名,配置/etc/hosts檔案
3.4安裝、啟動GlusterFS(所有node節點上操作)
3.5添加節點到存盤信任池中(在 node1 節點上操作)
3.6創建卷(在node3節點操作)
(1)創建分布式卷
(2)創建條帶卷
(3)創建復制卷
(4)創建分布式條帶卷
(5)創建分布式復制卷
部署 Gluster 客戶端
3.7安裝客戶端軟體
3.8創建掛載目錄
3.9配置 /etc/hosts 檔案
3.10掛載 Gluster 檔案系統
測驗 Gluster 檔案系統
3.11卷中寫入檔案,客戶端操作
3.12查看檔案分布
破壞性測驗
3.13掛起 node2 節點或者關閉glusterd服務來模擬故障
3.14在客戶端上查看檔案是否正常
3.15掛起 node2 和 node4 節點,在客戶端上查看檔案是否正常
四、其他的維護命令:
4.1查看GlusterFS卷
4.2查看所有卷的資訊
4.3查看所有卷的狀態
4.4停止一個卷
4.5洗掉一個卷,注意:洗掉卷時,需要先停止卷,且信任池中不能有主機處于宕機狀態,否則洗掉不成功
4.6設定卷的訪問控制
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/539642.html
標籤:其他
上一篇:rsync遠程同步
下一篇:論文閱讀:Zeno: Distributed Stochastic Gradient Descent with Suspicion-based Fault-tolerance
