我正在嘗試加載幾個帶有復雜分隔符的 csv 檔案(“~|~”)
當前代碼當前加載 csv 檔案,但未識別正確的列,因為正在使用分隔符(“,”)。
我在這里閱讀檔案https://docs.databricks.com/spark/latest/structured-streaming/auto-loader-csv.html但它沒有說明任何關于它的內容,或者至少我無法看見
spark.readStream.format("cloudFiles") \
.option("cloudFiles.format", "csv") \
# The schema location directory keeps track of your data schema over time
.option("cloudFiles.schemaLocation", "<path-to-checkpoint>") \
.load("<path-to-source-data>") \
.writeStream \
.option("mergeSchema", "true") \
.option("checkpointLocation", "<path-to-checkpoint>") \
.start("<path-to-target")
uj5u.com熱心網友回復:
檔案說:
使用 Auto Loader,您可以攝取 JSON、CSV、PARQUET、AVRO、TEXT、BINARYFILE 和 ORC 檔案。有關這些檔案格式的選項,請參閱格式選項。
所以你可以只對 CSV 檔案使用標準選項- 你需要delimiter(or sep) 選項:
df = spark.readStream.format("cloudFiles") \
.option("cloudFiles.format", "csv") \
.option("delimiter", "~|~") \
.schema(...) \
.load(...)
轉載請註明出處,本文鏈接:https://www.uj5u.com/net/319111.html
