我正在 azure databricks 中讀取 adls 中的一個檔案夾,該檔案夾具有包含鑲木地板檔案的子檔案夾。
路徑 - base_folder/檔案名/
filename 具有子檔案夾,如 2020、2021,這些檔案夾再次具有月和日的子檔案夾。
所以實際鑲木地板檔案的路徑就像 - base_folder/filename/2020/12/01/part11111.parquet。
如果我提供基本檔案夾路徑,則會出現以下錯誤。

我也嘗試過下面的命令,但它顯示了同樣的錯誤。

請幫助我讀取一個資料框中所有子檔案夾中的所有鑲木地板檔案。
uj5u.com熱心網友回復:
您的第一個錯誤:
Unable to infer schema for Parquet通常發生在您嘗試將空目錄讀取為鑲木地板時。您可以*在路徑中指定,它將通過子目錄,請看這里:從 Pyspark 中的多個目錄讀取鑲木地板檔案。第二個錯誤:您使用的是 Scala API,并且您提供的示例是在 Python 中撰寫的。
DataFrameReaderAPI 不同。參考:Scala - DataFrameReader - Python - DataFrameReader
嘗試:
spark.read.format("parquet").load(landingFolder)
如此處指定: 通用加載/保存功能
轉載請註明出處,本文鏈接:https://www.uj5u.com/qiye/353014.html
