摘要:本文將詳解ROMA集成關鍵技術-增量資料集成技術,
本文分享自華為云社區《ROMA集成關鍵技術(2)-增量資料集成技術》,作者:華為云PaaS服務小智 ,
1.概述
ROMA平臺的核心系統ROMA Connect源自華為流程IT的集成平臺,在華為內部有超過15年的企業業務集成經驗,依托ROMA Connect,可以將物聯網、大資料、視頻、統一通信、GIS等基礎平臺及各個應用的服務、訊息、資料統一集成適配以及編排,屏蔽各個平臺對上層業務的介面差異性,對上提供服務、訊息、資料集成使能服務,以支撐新業務的快速開發部署,提升應用開發效率,適用于平安園區、智慧城市、企業數字化轉型等場景,圖1展示了ROMA Connect的功能視圖,
圖1 ROMA Connect功能視圖
FDI(Fast Data Integration)通過應用間的資料交換從而達到集成,主要解決資料的分布性和異構性的問題,FDI應用場景如下:
- 跨異構資料源集成
- 跨應用間集成
- 跨云資料集成
- 跨網路資料集成(B2B、集團分子公司跨域集成)
FDI功能視圖如圖所示:
圖2 FDI功能視圖
本文將介紹FDI的關鍵技術-增量資料集成技術,
體驗ROMA Connect入門版
2.技術背景
在資料集成場景,將一個資料源中的資料定時或者實時方式同步到其他異構資料源,
資料源型別可以是API、MQ(Message queue)、DB、大資料、檔案存盤等,
當源端是DB,一個任務通常調度一個或幾個表的部分欄位資料,同時有幾百上千個任務需要調度,
3.常見技術
在介紹ROMA FDI增量資料集成技術之前,我們先了解下當前業界主要采用的資料集成技術,
常見技術一:
定時方式進行資料集成任務,根據時間周期進行調度,如根據年、月、日、小時、分等為周期進行調度,每周期執行一次,每個任務可以分別設定自己的任務調度周期策略,
針對增量的資料,一般通過時間戳或者增量ID進行過濾,每次執行只同步新產生的資料,針對洗掉資料的同步,通過時間戳一般無法支持同步,
另外也有通過觸發器記錄所有變化資料到一張輔助表,定時從輔助表拉取資料進行同步,
常見技術一缺點:
機械的調度執行,不管實際有沒有增量資料產生,會浪費調度資源,也會增加不必要的執行,對源資料源資源產生浪費,
調度針對每個任務調度進行調度,一般是一張資料庫表一個任務,如果表的數量特別多的話,調度的負擔比較大,且如果多個表之間有主外鍵關聯關系的話,無法保證同步時實際資料的先后依賴關系,容易產生沖突導致同步失敗,
采用時間戳或者增量ID同步增量資料要求表中必須有時間戳欄位或者增量ID欄位,用戶的表不一定能滿足這樣的要求,
針對源表中delete的資料,通過查詢方式無法獲取,導致無法同步到目標資料源,
采用觸發器記錄所有資料的方式,由于觸發器與用戶的sql執行是同步執行方式,會對系統性能造成比較大的影響,存盤也造成比較大的浪費,
常見技術二:
實時任務,主要面向對時延要求比較高的場景,一般調度調度一次,一直在后臺執行,有增量資料產生時,可以比較及時同步到目的資料源,
針對增量資料,通常通過決議資料庫的增量日志(如MySQL的binlog)來進行同步,
常見技術二缺點:
不同資料庫的增量日志格式和獲取介面均不同,如果需要支持多種資料庫難度會比較大,
由于資料庫的增量日志一般包括該資料庫實體下的所有庫表,不能在源端進行過濾和清洗,只能在任務執行時接收完全部資料后才能進行過濾清洗,所以會造成巨大的網路流量浪費,
4.ROMA FDI增量資料集成技術
我們再回顧總結一下前面提到的現有技術問題:
1、任務調度有很多非必須的調度,即無實際增量資料的任務調度
2、非必須的資料遷移造成的網路流量浪費
3、時間戳或者增量ID對用戶表結構的侵入性,無法同步delete資料,
4、對表的主外鍵約束關系的無法很好的支持
4.1增量資料集成技術思路
1、通過觸發器在元資料表記錄資料變化資訊,分割時間段記錄關鍵元資料資訊,并不記錄所有資料內容,有時間戳記錄時間戳,無時間戳記錄主鍵/ddl,
2、通過元資料表的資訊以及主外鍵關系來針對所有表進行統一任務調度排序
3、增量資料的高效獲取和寫入方式
4.2處理流程
在資料集成場景,將一個資料源中的資料定時或者實時方式同步到其他資料源,資料源型別可以是API、MQ、DB、大資料平臺、檔案等,
本方案主要面向源端資料源是資料庫型別,其他資料源型別可以根據本思路進行相應的適配,
總體步驟概述如下:
- 調度器在源端資料庫中創建本發明所需要的元資料表和觸發器,資料庫中的資料發生變化時,通過觸發器寫入關鍵元資料到元資料表中,
- 調度器從元資料表獲取所有表的變化元資料,進行依賴分析,然后調度排序
- 調度器根據策略下發任務到任務執行器進行實際任務的執行,
- 任務執行器從源端資料源中獲取資料
- 任務執行器講源端獲取到的資料寫入目標端資料源
4.3元資料表結構設計
在源端資料庫元資料表結構主要包括如下關鍵元素:
自增ID:代表元資料表的主鍵,主要用來在調度器中排序時使用,
表名:用來存盤實際業務表的名稱或者唯一標識,
Start時間戳:將所有時間進行分段,分的時間段的起始值,
End時間戳:將所有時間進行分段,分的時間段的結束值,
操作型別:用來標識對資料的操作型別,如insert、update或者對表結構的DDL操作,
主鍵/ddl:用來記錄主鍵或者ddl,主鍵值能按范圍則按照范圍來存,用以節省空間,
以下針對源表是否有時間戳欄位給出兩張場景下的資料的示例,
1.針對有時間戳欄位
2.針對無時間戳欄位
4.4觸發器邏輯
流程詳細描述如下,其中流程1負責觸發器和元資料表的創建,2到4流程主要描述觸發器的內部邏輯:
1、觸發器和元資料表的創建
調度器在首次連接源端資料源時,需要進行觸發器和元資料表的創建,可選的也可以調度器下發任務給執行器,由執行器去執行創建任務,
2、當源端資料庫的資料產生變化時,如新增資料、修改資料、洗掉資料、修改表結構等,觸發器會先獲取當前時間所屬的時間段,其中時間段是指根據一定的時間長度將所有時間切分成很多的段,
3、觸發器計算出當前時間段后,會在元資料表中根據時間段和表名查詢對應的記錄是否存在,是否存在決定了后續是要insert還是update資料入元資料表,
4、在觸發器中,寫入或更新變化資訊到元資料表,主要包括當前時間段、表名、操作型別、表名、主鍵、ddl陳述句等資訊,更新時需要帶上原有的主鍵/ddl等資訊保證資料不能丟失,
- 針對源表無時間戳欄位或delete型別需要記錄主鍵的值,
- 針對源表有時間戳且為insert 或update則不記錄主鍵值,若有記錄則無需更新,可以降低對源資料庫的影響,
- 針對ddl類操作則記錄ddl陳述句或者也可以根據需要自定義格式進行記錄,
其中主鍵屬于數字型別等能按范圍劃分時則按照范圍存盤記錄,不能按照范圍則直接拼接主鍵進行存盤,這樣可以最大可能降低對存盤空間的占用和對性能的影響,
注意不同型別操作間隔開的,不能合并到一個時間段里記錄里,只有同一種型別且連續在一個一個時間段內才可以合并為一條記錄,如果在同一個時間段內先執行表A的兩條insert,然后執行delete,之后再執行insert,那么這兩次的insert不能合并,
4.5調度遷移流程
流程詳細描述如下:
- 調度器定時訪問源端資料源中的元資料表,獲取關于所有表的源資料變化資訊,由于是針對所有表,通常實作的定時周期一般設定比較短,根據元資料表的時間戳欄位每次只取最新的未處理過的資料,針對已調度處理過的資料可以進行一定周期進行老化洗掉,
注意獲取資料需要嚴格排序,根據自增主鍵值進行排序,一般不能根據時間戳排序,除非時間戳可以保證前后順序, - 針對同一個表的連續的多個insert/update型別操作合并,時間段取并集,如有主鍵也同樣取并集,中間有其他型別如delete等間隔開的則不能做合并操作,
- 針對同一個表的連續的多個delete型別操作進行合并,同樣時間段取并集,主鍵也同樣取并集,有其他型別間隔開非連續的情況下則不能做合并,
ddl型別操作不做合并處理, - 針對上述步驟2、3中已經合并排序好的任務記錄之間插入屏障,確保最終的執行先后順序一定按排序好的執行,
- 從源資料源獲取表結構的資料,根據主外鍵依賴關系,將前述已經排序好的任務分配任務組,有主外鍵依賴分配在同一個任務組,一個任務組內根據主外鍵關系進行排序,針對insert/update類,主表排在子表前,針對delete則子表排在主表前,針對ddl則按原有順序,不另外排序,
- 調度器將排序好的任務下發到執行器進行執行,執行器執行任務時需要滿足任務屏障和依賴先后關系,在此前提基礎上,任務可分配在任意一個合適的執行器上執行,針對同一種任務如insert/update或delete可以根據策略適度并發執行,
- 執行器執行任務時,根據不同場景生成不同的獲取資料的sql陳述句,針對源表有時間戳欄位insert/update,生成查詢陳述句:select * from 表 where 時間戳 between 最早起始時間 and 最晚結束時間,無時間戳欄位則生成:
select * from 表 where 主鍵 in(主鍵值1,主鍵值2……) 或者 主鍵 between 最小主鍵值 and 最大主鍵值, - 執行器將查詢到資料通過生成特定陳述句寫入目標端資料源,insert/update資料生成類merge into陳述句,可以批量執行,當確定目標資料源中無此資料會由資料源自動做insert操作,有此資料則自動進行update,如此可以保證該任務是冪等執行,即可以重復執行,在任務執行失敗時可以安全的重試,此外該語法可以將insert和update兩類操作進行合并后批量執行,Oracle、SQL SERVER的語法是merge into,MySQL的類似語法是replace或 insert into on duplicate key update,PostgreSQL的語法是UPSERT,其他資料源可以參考此原理,若不支持該陳述句則用原生的insert或者update語法或者相對應的介面等,
- 如果是delete型別操作,執行器則無需到源端獲取資料,直接根據元資料表獲取到的主鍵來進行同步,目標端資料源如果是資料庫型別,則生成delete from 表 where 主鍵 in(主鍵值1,主鍵值2……) 或者 主鍵 between 最小主鍵值 and 最大主鍵值,如果目標端是其他型別則呼叫其洗掉介面傳入主鍵值,
體驗ROMA Connect入門版
點擊關注,第一時間了解華為云新鮮技術~
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/539929.html
標籤:其他
上一篇:資料結-線性表
下一篇:Zabbix監控系統
