課件獲取:關注公眾號 “數堆疊研習社”,后臺私信 “Taier” 獲得直播課件
視頻回放:點擊這里
ChunJun 開源專案地址:github 丨 gitee 喜歡我們的專案給我們點個__ STAR!STAR!!STAR!!!(重要的事情說三遍)__
技術交流釘釘 qun:30537511
前言
在分享之前,先為大家介紹一下任務和實體的關系,任務指的是我們在任務開發界面上去創建的任務,比如Spark任務、SparkSQL任務、資料同步任務等,這些任務在開發程序中是靜態的腳本,當被提交到計算節點去執行時,被執行的程序我們把它抽象成實體,舉一個簡單的例子來說明:比如我們寫完一個Java的類然后把它打包成Jar包,其實這個Jar包就是一個靜態類,當我們執行Jar包時,這個程序我們會把它抽象成一個實體,這就是任務與實體的關系,
Taier實體生成
1、Taier實體型別
首先我們來看一下Taier實體的型別,在Taier中實體主要有3種型別:
-
周期實體:T+1生成,完整依賴
-
補資料實體:立即生成,區域依賴
-
臨時運行實體:立即生成,無依賴
● 周期實體
周期實體是指在前一天生成的當天實體(T+1),擁有一個完整獨立的實體依賴體系,也就是任務和任務之間形成的完整的DAG圖,周期實體實際上指的是離線任務,因為實時任務并無上游依賴關系,

上圖就是配置任務之間依賴的地方,任務和任務之間會形成一個完整DAG(Direct Acyclic Graph)圖,中文名叫有向無環圖,從圖中任意一個節點出發,根據方向無法回到原節點的圖就叫做有向無環圖,
注意: 提交任務的時候回判斷是否成環,
而實體依賴可分為兩種:父子依賴關系和自依賴關系,
● 父子依賴關系
父子關系可以理解為不同的任務依賴:例如任務A運行需要任務B的運行結果,這個時候任務A就需要依賴任務B,那么B任務就是A任務父任務,
● 自依賴關系
自依賴關系可以理解為相同任務的不同周期依賴:例如 任務A是一個小時任務,0點開始執行,10點結束,每小時運行一次,那么任務A在0點合10點這個時間段上需要執行10次,如果說任務A每次執行都需要上一個周期執行結束,那么任務A就是一個自依賴任務,
除了上述兩種依賴任務,還有跨周期依賴,不同周期任務的父子依賴關系:子任務會找到父任務最近的執行的一個周期實體依賴,
● 補資料實體
補資料實體是用戶通過頁面或者呼叫介面觸發生成實體,僅有區域的依賴關系且和周期實體的依賴關系相互獨立互不影響,實體依賴關系和周期實體一致,
注意:補資料是生成區域的DAG圖,例如 1、2、3任務關系是 1->2->3,在頁面上選擇1和3任務進行補資料,那么1,2,3任務都會生成,但是最終結果只會運行1和3任務,2任務不運行,

● 臨時運行實體
臨時運行實體可以分成兩種離線和實時,
離線任務:用戶可以直接運行任務生成實體,實體沒有依賴關系,
實時任務:實時任務沒有周期,上下游依賴這一概念,所以所以的實時實體都是臨時運行的,
Taier周期實體生成
接下來我們來看一下Taier周期實體的生成,

上圖為Taier實體的整體生成圖,Taier主節點在啟動的時候會開啟一個定時器,定時器會不停的去判斷當日的實體是否已經生成,如果沒有生成就會觸發事件給CycleJobBuilder生成實體,再通過JobDependency封裝實體之間的依賴關系,
其中CycleJobBuilder是指用于生成周期實體,掃描資料
庫任務表并且獲取zk上所有的taier節點,把封裝后的實
例分配到每一臺Taier節點上;JobDependency是用于生成job之間的依賴關系,
接下來為大家介紹下Taier的主從選舉,
在application.properties檔案中配置zk:
nodeZkAddress=${ZK_HOST}??{ZK_PORT}/taier
● Taier服務注冊
每一臺Taier服務都會去把自己的地址注冊到zk上/taier/brokers下,在生成實體的時候,主節點就是從/taier/brokers獲取所有注冊在zk的Taier節點資訊,
每一臺Taier服務和zk會維持一個心跳,并保存在/taier/brokers/ip:port/heart節點下,

● 主節點選舉
Taier的主從選舉是基于LeaderLatch來實作的,在啟動Taier后,Taier會嘗試去搶占/taier/masterLatchLock這邊鎖,搶到鎖的節點就是主節點,沒有搶到鎖的節點就是從節點,

Taier實體調度
接下來為大家介紹下Taier實體調度,首先為大家介紹下調度流程,

上圖就是Taier實體調度的整體流程,在啟動Taier服務時,會啟動配置的所有調度器,并且開始掃描實體,并提交,
● 調度器
由于實體型別的不同,我們需要的調度器也會不同,但是他們都有一個父類(Scheduler),
例如CycleJobScheduler專門負責周期實體的調度,而FillDataJobScheduler是負責補資料實體的調度,
不同的調度器,提交的條件也不一定,例如CycleJobScheduler只會掃描2天內的周期實體,而RestartJobScheduler是沒有時間限制的,而且每一個調度器的攔截器鏈也會不一樣,

● 攔截器
攔截器是用于負責檢查實體是否到達提交條件,多個攔截器會形成攔截器鏈,當實體通過攔截器鏈時,說明實體到達提交狀態,所以實體會被放入到提交佇列中,等待提交,
默認提供的攔截器:
1.JobStatusSubmitInterceptor:用于判斷實體狀態,
2.JobUpStreamSubmitInterceptor:用于判斷實體上游是否運行完成,注意,該上游實體不僅僅是上游任務實體,還有可能是自依賴實體,
3.TaskStatusSubmitInterceptor:用于判斷任務狀態是否正常,
每個調度器內裝載的攔截器可以不同,

Taier實體提交
最后為大家介紹下Taier實體的提交,因為任務型別的不同,所以實體提交置計算節點的邏輯也不同,為了能有更好的擴展性,Taier實作類插件化的處理,


袋鼠云開源框架釘釘技術交流qun(30537511),歡迎對大資料開源專案有興趣的同學加入交流最新技術資訊,開源專案庫地址:https://github.com/DTStack
轉載請註明出處,本文鏈接:https://www.uj5u.com/shujuku/503323.html
標籤:其他
