介紹 Kafka
Kafka 是一款基于發布與訂閱的訊息系統,
用生產者客戶端 API 向 Kafka 生產訊息,用消費者客戶端 API 從 Kafka 讀取這些訊息,
Kafka 使用 Zookeeper 保存元資料資訊,
- Kafka 0.9 版本之前,除了 broker 之外, 消費者也會使用 Zookeeper 保存一些資訊,比如消費者群組的資訊、 主題資訊、消費磁區的偏移量(在消費者群組里發生失效轉移時會用到),
- 到了 0.9.0.0 版本, Kafka 引入了一個新的消費者介面,允許 broker 直接維護這些資訊,
Kafka 中的概念
訊息 & 批次
Kafka 的資料單元被稱為訊息,訊息就好比資料庫里的一個“資料行”或一條“記錄”,訊息由位元組陣列組成,所以對于 Kafka 來說,訊息里的資料沒有特別的格式或含義,
訊息可以有個可選的元資料,也就是鍵,鍵也是一個位元組陣列,與訊息一樣,對于 Kafka 來說也沒有特殊的含義,鍵有兩個用途:可以作為訊息的附加資訊,也可以用來決定訊息該被寫到主題的哪個磁區,最簡單的例子就是為鍵生成一個一致性散列值,然后使用散列值對主題的磁區數進行取模,為訊息選取磁區,
為了提高效率,訊息被分批次寫入 Kafka,批次就是一組訊息,這些訊息屬于同一主題和磁區,
如果每一個訊息都單獨串行于網路,會導致大量的網路開銷,把訊息分批次傳輸可以減少網路開銷,不過,這要在時間延遲和吞吐量之間作出權衡:批次越大,單位時間內處理的訊息就越多,單個訊息的傳輸時間就越長,
批次資料會被壓縮,這樣可以提升資料的傳輸和存盤能力,但要做更多的計算處理,
主題 & 磁區
Kafka 的訊息通過主題進行分類,主題就好比資料庫的表,或者檔案系統里的檔案夾,
主題可以被分為若干個磁區,一個磁區就是一個提交日志,訊息以追加的方式寫入磁區,然后以先進先出的順序讀取,要注意,由于一個主題一般包含幾個磁區,因此無法在整個主題范圍內保證訊息的順序,但可以保證訊息在單個磁區內的順序,
Kafka 通過磁區來實作資料冗余和伸縮性,磁區可以分布在不同的服務器上,也就是說, 一個主題可以橫跨多個服務器,以此來提供比個服務器更強大的性能,
Kafka 集群通過磁區對主題進行橫向擴展,所以當有新的 broker 加入集群時,可以通過磁區個數來實作集群的負載均衡,擁有大量訊息的主題如果要進行負載分散,就需要大量的磁區,

生產者 & 消費者
Kafka 的客戶端就是 Kafka 系統的用戶,Kafka 的客戶端被分為兩種基本型別生產者和消費者,除此之外,還有其他高級客戶端 API:用于資料集成的 Kafka Connect API 和用于流式處理的 Kafka Streams ,這些高級客戶端 API 使用生產者和消費者作為內部組件,提供了高級的功能,
生產者
生產者創建訊息,在其他基于發布與訂閱的訊息系統中,生產者可能被稱為發布者 或 寫入者,
一般情況下,一個訊息會被發布到一個特定的主題上,生產者在默認情況下把訊息均衡地分布到主題的所有磁區上,而并不關心特定訊息會被寫到哪個磁區,不過,在某些情況下,生產者會把訊息直接寫到指定的磁區,這通常是通過訊息鍵和磁區器來實作的,磁區器為鍵生成一個散列值,并將其映射到指定的磁區上,這樣可以保證包含同一個鍵的訊息會被寫到同一個磁區上,生產者也可以使用自定義的磁區器,根據不同的業務規則將訊息映射到磁區,
消費者
消費者讀取訊息,在其他基于發布與訂閱的訊息系統中,消費者可能被稱為訂閱者 或 讀者,
消費者訂閱一個或多個主題,并按照訊息生成的順序讀取它們,消費者通過檢查訊息的偏移量來區分已經讀取過的訊息,
偏移量是另一種元資料,它是一個不斷遞增的整數值,在創建訊息時, Kafka 會把偏移量添加到訊息里,在給定的磁區里,每個訊息的偏移量都是唯一的,消費者把每個磁區最后讀取的訊息的偏移量保存在 Zookeeper 或 Kafka 上,如果消費者關倍訓重啟,它的讀取狀態不會丟失,
消費者群組
消費者是消費者群組的一部分,一個群組里的消費者訂閱的是同一個主題,每個消費者接收主題一部分磁區的訊息,消費者群組保證每個磁區只能被一個消費者使用 ,消費者與磁區之間的映射通常被稱為消費者對磁區的所有權關系,
通過消費者群組的方式,消費者可以消費包含大量訊息的主題,而且,如果一個消費者失效,消費者群組里的其他消費者可以接管失效消費者的作業,

broker & 集群
一個獨立的 Kafka 服務器被稱為 broker,
- broker 接收來自生產者的訊息,為訊息設定偏移量,并提交訊息到磁盤保存,
- broker 為消費者提供服務,對讀取磁區的請求作出回應,回傳已經提交到磁盤上的訊息,
根據特定的硬體及其性能特征,單個 broker 可以輕松處理數千個磁區以及每秒百萬級的訊息量,
broker 是集群的組成部分,每個集群都有一個 broker 同時充當了集群控制器的角色(集群控制器自動從集群的活躍成員中選舉出來),集群控制器負責管理作業,包括將磁區分配給 broker 和監控 broker,在集群中,一個磁區從屬于一個 broker,該 broker 被稱為磁區的首領,一個磁區可以分配給多個 broker,這個時候會發生磁區復制,這種復制機制為磁區提供了訊息冗余,如果有一個 broker 失效,其他 broker 可以接管領導權,不過,相關的消費者和生產者都要重新連接到新的首領,

保留訊息(在一定期限內)是 Kafka 的一個重要特性,訊息被提交到磁盤,Kafka 根據設定的保留規則進行保存,主題可以配置自己的保留策略,將悄息保留到不再使用它們為止, Kafka 有兩種保留規則:
- 根據時間保留資料:根據時間保留資料是通過檢查磁盤上日志片段檔案的最后修改時間來實作的,一般來說,最后修改時間指的就是日志片段的關閉時間,也就是檔案里最后一個訊息的時間戳,當前時間超過磁盤上日志片段檔案的最后修改時間,超過的時間達到配置引數指定的值,那么舊訊息就會過期并被洗掉,
- 根據訊息的位元組數保留資料:當單個主題中所有訊息的位元組數達到配置引數指定的值,那么舊訊息就會過期并被洗掉,所以在任何時刻,可用訊息的總量都不會超過配置引數所指定的大小,
參考資料
《Kafka權威指南》第1章:初識Kafka
本文來自博客園,作者:真正的飛魚,轉載請注明原文鏈接:https://www.cnblogs.com/feiyu2/p/17246579.html
轉載請註明出處,本文鏈接:https://www.uj5u.com/shujuku/547978.html
標籤:大數據
上一篇:高性能 Flink SQL 優化
