有人可以讓我知道是否可以從 JDBC 源進行 Spark 結構化流式傳輸?例如 SQL DB 或任何 RDBMS。
我看過一些關于 SO 的類似問題,例如
Spark streaming jdbc 在資料到來時讀取流 - 資料源 jdbc 不支持流式讀取
jdbc 源和 spark 結構化流
但是,我想知道它是否在 Apache Spark 上得到官方支持?
如果有任何有用的示例代碼。
謝謝
uj5u.com熱心網友回復:
不,Spark Structured Streaming 中沒有這樣的內置支持。主要原因是大多數資料庫沒有提供統一的介面來獲取更改。
可以使用歸檔日志、預寫日志等從某些資料庫中獲取更改。但它是特定于資料庫的。對于許多資料庫來說,流行的選擇是Debezium,它可以讀取此類日志并將更改串列推送到 Kafka 或類似的東西中,Spark 可以從中使用它。
uj5u.com熱心網友回復:
我現在正在一個專案中使用來自 ORACLE 的 CDC Shareplex 并寫入 KAFKA,然后使用 Spark Structured Streaming 與 KAFKA 集成和 MERGE 在 HDFS 上的增量格式上構建這個專案。
也就是說,如果不使用 Debezium,那就是這樣做的方法。您可以使用基表或物化視圖的更改日志來提供 CDC。
所以直接 JDBC 是不可能的。
轉載請註明出處,本文鏈接:https://www.uj5u.com/yidong/434776.html
標籤:阿帕奇火花 pyspark 天蓝色数据块 火花结构化流
