主頁 > .NET開發 > 為什么加入結構相同的資料幀會產生不同的結果?

為什么加入結構相同的資料幀會產生不同的結果?

2021-10-15 11:02:39 .NET開發

兩次運行的輸入 df 結構相同,但輸出不同。只有第二次運行回傳所需的結果 ( df6)。我知道我可以為資料幀使用別名,這將回傳所需的結果。

問題。創建 的基礎 Spark 機制是df3什么?Spark 讀df1.c1 == df2.c2入了join'son子句,但很明顯它沒有注意提供的 dfs。引擎蓋下有什么?如何預測這種行為?

首次運行df3結果錯誤):

data = [
    (1, 'bad', 'A'),
    (4, 'ok', None)]
df1 = spark.createDataFrame(data, ['ID', 'Status', 'c1'])
df1 = df1.withColumn('c2', F.lit('A'))
df1.show()

# --- ------ ---- --- 
#| ID|Status|  c1| c2|
# --- ------ ---- --- 
#|  1|   bad|   A|  A|
#|  4|    ok|null|  A|
# --- ------ ---- --- 

df2 = df1.filter((F.col('Status') == 'ok'))
df2.show()

# --- ------ ---- --- 
#| ID|Status|  c1| c2|
# --- ------ ---- --- 
#|  4|    ok|null|  A|
# --- ------ ---- --- 

df3 = df2.join(df1, (df1.c1 == df2.c2), 'full')
df3.show()

# ---- ------ ---- ---- ---- ------ ---- ---- 
#|  ID|Status|  c1|  c2|  ID|Status|  c1|  c2|
# ---- ------ ---- ---- ---- ------ ---- ---- 
#|   4|    ok|null|   A|null|  null|null|null|
#|null|  null|null|null|   1|   bad|   A|   A|
#|null|  null|null|null|   4|    ok|null|   A|
# ---- ------ ---- ---- ---- ------ ---- ---- 

第二次運行(正確df6結果):

data = [
    (1, 'bad', 'A', 'A'),
    (4, 'ok', None, 'A')]
df4 = spark.createDataFrame(data, ['ID', 'Status', 'c1', 'c2'])
df4.show()

# --- ------ ---- --- 
#| ID|Status|  c1| c2|
# --- ------ ---- --- 
#|  1|   bad|   A|  A|
#|  4|    ok|null|  A|
# --- ------ ---- --- 

df5 = spark.createDataFrame(data, ['ID', 'Status', 'c1', 'c2']).filter((F.col('Status') == 'ok'))
df5.show()

# --- ------ ---- --- 
#| ID|Status|  c1| c2|
# --- ------ ---- --- 
#|  4|    ok|null|  A|
# --- ------ ---- --- 

df6 = df5.join(df4, (df4.c1 == df5.c2), 'full')
df6.show()

# ---- ------ ---- ---- --- ------ ---- --- 
#|  ID|Status|  c1|  c2| ID|Status|  c1| c2|
# ---- ------ ---- ---- --- ------ ---- --- 
#|null|  null|null|null|  4|    ok|null|  A|
#|   4|    ok|null|   A|  1|   bad|   A|  A|
# ---- ------ ---- ---- --- ------ ---- --- 

我可以看到物理計劃的不同之處在于內部使用了不同的連接(BroadcastNestedLoopJoinSortMergeJoin)。但這本身并不能解釋為什么結果不同,因為對于不同的內部連接型別,它們應該仍然相同。

df3.explain()

== Physical Plan ==
BroadcastNestedLoopJoin BuildRight, FullOuter, (c1#23335 = A)
:- *(1) Project [ID#23333L, Status#23334, c1#23335, A AS c2#23339]
:   - *(1) Filter (isnotnull(Status#23334) AND (Status#23334 = ok))
:      - *(1) Scan ExistingRDD[ID#23333L,Status#23334,c1#23335]
 - BroadcastExchange IdentityBroadcastMode, [id=#9250]
    - *(2) Project [ID#23379L, Status#23380, c1#23381, A AS c2#23378]
       - *(2) Scan ExistingRDD[ID#23379L,Status#23380,c1#23381]

df6.explain()

== Physical Plan ==
SortMergeJoin [c2#23459], [c1#23433], FullOuter
:- *(2) Sort [c2#23459 ASC NULLS FIRST], false, 0
:   - Exchange hashpartitioning(c2#23459, 200), ENSURE_REQUIREMENTS, [id=#9347]
:      - *(1) Filter (isnotnull(Status#23457) AND (Status#23457 = ok))
:         - *(1) Scan ExistingRDD[ID#23456L,Status#23457,c1#23458,c2#23459]
 - *(4) Sort [c1#23433 ASC NULLS FIRST], false, 0
    - Exchange hashpartitioning(c1#23433, 200), ENSURE_REQUIREMENTS, [id=#9352]
       - *(3) Scan ExistingRDD[ID#23431L,Status#23432,c1#23433,c2#23434]

uj5u.com熱心網友回復:

聯接取決于聯接資料幀的結構,但您構建這些資料幀的方式也會產生影響。如果您加入的兩個資料框共享相同的lineage,則您可能會在連接條件中遇到不明確的列問題,從而導致您在問題中描述的內容。

在您第一次運行時,當您df2構建df1,兩個資料幀共享相同的譜系。當您加入這兩個資料幀時,您實際上是在進行自聯接,Spark 選擇僅屬于已加入資料幀之一的錯誤列作為連接條件,導致笛卡爾積后跟始終為錯誤的過濾器。

在您的第二次運行中,由于兩個資料幀是獨立構建的,連接條件正確定義為兩列之間的相等性,每列屬于不同的資料幀。因此 Spark 執行經典連接。


詳細說明

正如pltc在他的回答中解釋的那樣,在您第一次運行時,Spark 不會為您的連接選擇正確的列。讓我們找出原因。

引擎蓋下是什么?

讓我們從獲取df1df2使用explain. 這是物理計劃df1

== Physical Plan ==
*(1) Project [ID#0L, Status#1, c1#2, A AS c2#6]
 - *(1) Scan ExistingRDD[ID#0L,Status#1,c1#2]

這是物理計劃df2

== Physical Plan ==
*(1) Project [ID#0L, Status#1, c1#2, A AS c2#6]
 - *(1) Filter (isnotnull(Status#1) AND (Status#1 = ok))
    - *(1) Scan ExistingRDD[ID#0L,Status#1,c1#2]

您可以通過在第一行開始看到(1) Project兩個dataframesdf1df2具有相同的列名和ID: [ID#0L, Status#1, c1#2, A AS c2#6]這并不奇怪,因為df2從創建的df1,所以你可以看到df2作為df1額外的轉換。所以我們有以下參考:

  • df1.c1<=> df2.c1<=>c1#2
  • df1.c2<=> df2.c2<=>A AS c2#6

當您加入df1and 時df2,意味著您進行了自加入。并且您的條件的以下所有組合都將被翻譯為c1#2 = A AS c2#6,這將為您留下簡化的連接條件c1#2 = A

  • df1.c1 = df2.c2
  • df1.c2 = df2.c1
  • df2.c1 = df1.c2
  • df2.c2 = df1.c1

當您在 Spark 中執行自聯接時,Spark 將重新生成正確資料幀的列 ID,以避免在最終資料幀中具有相同的列 ID。因此,在您的情況下,它將重寫df1. 所以列c1#2將參考列c1df2

現在您的條件不包含來自 的任何列df1,那么 Spark 將選擇執行笛卡爾積作為連接策略。由于兩個資料幀之一小到可以廣播,因此所選演算法將為BroadcastNestedLoopJoin這是df3節目的物理計劃

== Physical Plan ==
BroadcastNestedLoopJoin BuildRight, FullOuter, (c1#2 = A)
:- *(1) Project [ID#0L, Status#1, c1#2, A AS c2#6]
:   - *(1) Filter (isnotnull(Status#1) AND (Status#1 = ok))
:      - *(1) Scan ExistingRDD[ID#0L,Status#1,c1#2]
 - BroadcastExchange IdentityBroadcastMode, [id=#75]
    - *(2) Project [ID#46L, Status#47, c1#48, A AS c2#45]
       - *(2) Scan ExistingRDD[ID#46L,Status#47,c1#48]

請注意, 的四個新列 IDdf1現在是[ID#46L, Status#47, c1#48, A AS c2#45]

And when you execute this plan, as for the unique row of df2, the value of c1 is null which is different from A, thus join condition is always false. As you chose full outer join, you get the three rows (two from df1, one from df2) with null in columns coming from the other dataframe:

 ---- ------ ---- ---- ---- ------ ---- ---- 
|  ID|Status|  c1|  c2|  ID|Status|  c1|  c2|
 ---- ------ ---- ---- ---- ------ ---- ---- 
|   4|    ok|null|   A|null|  null|null|null|
|null|  null|null|null|   1|   bad|   A|   A|
|null|  null|null|null|   4|    ok|null|   A|
 ---- ------ ---- ---- ---- ------ ---- ---- 

Why for the second run I have the desired output?

For the second run, you create two independent dataframes. So if we look at the physical plan of df4 and df5, you can see that the column ids are different. Here is the physical plan of df4:

== Physical Plan ==
*(1) Scan ExistingRDD[ID#98L,Status#99,c1#100,c2#101]

And here is the physical plan of df5:

== Physical Plan ==
*(1) Filter (isnotnull(Status#124) AND (Status#124 = ok))
 - *(1) Scan ExistingRDD[ID#123L,Status#124,c1#125,c2#126]

Your join condition is c1#100 = c2#126, c1#100 is c1 column from df4 and c2#126 is c2 column from df5. Each end of equality in join condition is from different dataframes, so Spark can perform the join as you expected.

Why this is not detected as Ambiguous Self Join?

Since Spark 3.0, Spark checks that the columns you're using for join are not ambiguous. If you inverted the order of df2 and df1 when joining them as follows:

df3 = df1.join(df2, (df1.c1 == df2.c2), 'full')

you would get the following error:

pyspark.sql.utils.AnalysisException: Column c2#6 are ambiguous.

So why don't we have this error when executing df2.join(df1, ...)?

You have your answer in the file DetectAmbiguousSelfJoin in Spark's code:

// When self-join happens, the analyzer asks the right side plan to generate
// attributes with new exprIds. If a plan of a Dataset outputs an attribute which
// is referred by a column reference, and this attribute has different exprId than
// the attribute of column reference, then the column reference is ambiguous, as it
// refers to a column that gets regenerated by self-join.

It means that when doing df2.join(df1, ...), we will only check columns used in join condition against df1. As in our case we didn't perform any transformation on df1, contrary to df2 that was filtered, exprIds of df1 columns didn't change and thus no ambiguous columns error is raised.

我在 Spark Jira 上創建了一個關于此行為的問題,請參閱SPARK-36874

如何預測這種行為?

您必須非常小心您的聯接是否是自聯接。如果你從一個資料幀開始df1,對它執行一些轉換來獲取df2,然后加入df1df2你就有可能得到這種行為。為了減輕這一點,你應該始終把原來的資料幀的第一資料幀時做一個連接,所以有df1.join(df2, ...)代替df2.join(df1, ...)通過這樣做,您將得到一個Analysis Exception: Column x are ambiguousif Spark 無法選擇正確的列。

uj5u.com熱心網友回復:

由于某種原因,Spark 無法正確區分您的c1c2列。這是獲得df3預期結果的修復程式

df3 = df2.alias('df2').join(df1.alias('df1'), (F.col('df1.c1') == F.col('df2.c2')), 'full')
df3.show()

# Output
#  ---- ------ ---- ---- --- ------ ---- --- 
# |  ID|Status|  c1|  c2| ID|Status|  c1| c2|
#  ---- ------ ---- ---- --- ------ ---- --- 
# |   4|    ok|null|   A|  1|   bad|   A|  A|
# |null|  null|null|null|  4|    ok|null|  A|
#  ---- ------ ---- ---- --- ------ ---- --- 

轉載請註明出處,本文鏈接:https://www.uj5u.com/net/315258.html

標籤:阿帕奇火花 加入 火花 apache-spark-sql

上一篇:連接特定行值的列值

下一篇:連接2個表,其中一個表可能有也可能沒有條目

標籤雲
其他(157675) Python(38076) JavaScript(25376) Java(17977) C(15215) 區塊鏈(8255) C#(7972) AI(7469) 爪哇(7425) MySQL(7132) html(6777) 基礎類(6313) sql(6102) 熊猫(6058) PHP(5869) 数组(5741) R(5409) Linux(5327) 反应(5209) 腳本語言(PerlPython)(5129) 非技術區(4971) Android(4554) 数据框(4311) css(4259) 节点.js(4032) C語言(3288) json(3245) 列表(3129) 扑(3119) C++語言(3117) 安卓(2998) 打字稿(2995) VBA(2789) Java相關(2746) 疑難問題(2699) 细绳(2522) 單片機工控(2479) iOS(2429) ASP.NET(2402) MongoDB(2323) 麻木的(2285) 正则表达式(2254) 字典(2211) 循环(2198) 迅速(2185) 擅长(2169) 镖(2155) 功能(1967) .NET技术(1958) Web開發(1951) python-3.x(1918) HtmlCss(1915) 弹簧靴(1913) C++(1909) xml(1889) PostgreSQL(1872) .NETCore(1853) 谷歌表格(1846) Unity3D(1843) for循环(1842)

熱門瀏覽
  • WebAPI簡介

    Web體系結構: 有三個核心:資源(resource),URL(統一資源識別符號)和表示 他們的關系是這樣的:一個資源由一個URL進行標識,HTTP客戶端使用URL定位資源,表示是從資源回傳資料,媒體型別是資源回傳的資料格式。 接下來我們說下HTTP. HTTP協議的系統是一種無狀態的方式,使用請求/ ......

    uj5u.com 2020-09-09 22:07:47 more
  • asp.net core 3.1 入口:Program.cs中的Main函式

    本文分析Program.cs 中Main()函式中代碼的運行順序分析asp.net core程式的啟動,重點不是剖析原始碼,而是理清程式開始時執行的順序。到呼叫了哪些實體,哪些法方。asp.net core 3.1 的程式入口在專案Program.cs檔案里,如下。ususing System; us ......

    uj5u.com 2020-09-09 22:07:49 more
  • asp.net網站作為websocket服務端的應用該如何寫

    最近被websocket的一個問題困擾了很久,有一個需求是在web網站中搭建websocket服務。客戶端通過網頁與服務器建立連接,然后服務器根據ip給客戶端網頁發送資訊。 其實,這個需求并不難,只是剛開始對websocket的內容不太了解。上網搜索了一下,有通過asp.net core 實作的、有 ......

    uj5u.com 2020-09-09 22:08:02 more
  • ASP.NET 開源匯入匯出庫Magicodes.IE Docker中使用

    Magicodes.IE在Docker中使用 更新歷史 2019.02.13 【Nuget】版本更新到2.0.2 【匯入】修復單列匯入的Bug,單元測驗“OneColumnImporter_Test”。問題見(https://github.com/dotnetcore/Magicodes.IE/is ......

    uj5u.com 2020-09-09 22:08:05 more
  • 在webform中使用ajax

    如果你用過Asp.net webform, 說明你也算是.NET 開發的老兵了。WEBform應該是2011 2013左右,當時還用visual studio 2005、 visual studio 2008。后來基本都用的是MVC。 如果是新開發的專案,估計沒人會用webform技術。但是有些舊版 ......

    uj5u.com 2020-09-09 22:08:50 more
  • iis添加asp.net網站,訪問提示:由于擴展配置問題而無法提供您請求的

    今天在iis服務器配置asp.net網站,遇到一個問題,記錄一下: 問題:由于擴展配置問題而無法提供您請求的頁面。如果該頁面是腳本,請添加處理程式。如果應下載檔案,請添加 MIME 映射。 WindowServer2012服務器,添加角色安裝完.netframework和iis之后,運行aspx頁面 ......

    uj5u.com 2020-09-09 22:10:00 more
  • WebAPI-處理架構

    帶著問題去思考,大家好! 問題1:HTTP請求和回傳相應的HTTP回應資訊之間發生了什么? 1:首先是最底層,托管層,位于WebAPI和底層HTTP堆疊之間 2:其次是 訊息處理程式管道層,這里比如日志和快取。OWIN的參考是將訊息處理程式管道的一些功能下移到堆疊下端的OWIN中間件了。 3:控制器處理 ......

    uj5u.com 2020-09-09 22:11:13 more
  • 微信門戶開發框架-使用指導說明書

    微信門戶應用管理系統,采用基于 MVC + Bootstrap + Ajax + Enterprise Library的技術路線,界面層采用Boostrap + Metronic組合的前端框架,資料訪問層支持Oracle、SQLServer、MySQL、PostgreSQL等資料庫。框架以MVC5,... ......

    uj5u.com 2020-09-09 22:15:18 more
  • WebAPI-HTTP編程模型

    帶著問題去思考,大家好!它是什么?它包含什么?它能干什么? 訊息 HTTP編程模型的核心就是訊息抽象,表示為:HttPRequestMessage,HttpResponseMessage.用于客戶端和服務端之間交換請求和回應訊息。 HttpMethod類包含了一組靜態屬性: private stat ......

    uj5u.com 2020-09-09 22:15:23 more
  • 部署WebApi隨筆

    一、跨域 NuGet參考Microsoft.AspNet.WebApi.Cors WebApiConfig.cs中配置: // Web API 配置和服務 config.EnableCors(new EnableCorsAttribute("*", "*", "*")); 二、清除默認回傳XML格式 ......

    uj5u.com 2020-09-09 22:15:48 more
最新发布
  • C#多執行緒學習(二) 如何操縱一個執行緒

    <a href="https://www.cnblogs.com/x-zhi/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/2943582/20220801082530.png" alt="" /></...

    uj5u.com 2023-04-19 09:17:20 more
  • C#多執行緒學習(二) 如何操縱一個執行緒

    C#多執行緒學習(二) 如何操縱一個執行緒 執行緒學習第一篇:C#多執行緒學習(一) 多執行緒的相關概念 下面我們就動手來創建一個執行緒,使用Thread類創建執行緒時,只需提供執行緒入口即可。(執行緒入口使程式知道該讓這個執行緒干什么事) 在C#中,執行緒入口是通過ThreadStart代理(delegate)來提供的 ......

    uj5u.com 2023-04-19 09:16:49 more
  • 記一次 .NET某醫療器械清洗系統 卡死分析

    <a href="https://www.cnblogs.com/huangxincheng/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/214741/20200614104537.png" alt="" /&g...

    uj5u.com 2023-04-18 08:39:04 more
  • 記一次 .NET某醫療器械清洗系統 卡死分析

    一:背景 1. 講故事 前段時間協助訓練營里的一位朋友分析了一個程式卡死的問題,回過頭來看這個案例比較經典,這篇稍微整理一下供后來者少踩坑吧。 二:WinDbg 分析 1. 為什么會卡死 因為是表單程式,理所當然就是看主執行緒此時正在做什么? 可以用 ~0s ; k 看一下便知。 0:000> k # ......

    uj5u.com 2023-04-18 08:33:10 more
  • SignalR, No Connection with that ID,IIS

    <a href="https://www.cnblogs.com/smartstar/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/u36196.jpg" alt="" /></a>...

    uj5u.com 2023-03-30 17:21:52 more
  • 一次對pool的誤用導致的.net頻繁gc的診斷分析

    <a href="https://www.cnblogs.com/dotnet-diagnostic/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/3115652/20230225090434.png" alt=""...

    uj5u.com 2023-03-28 10:15:33 more
  • 一次對pool的誤用導致的.net頻繁gc的診斷分析

    <a href="https://www.cnblogs.com/dotnet-diagnostic/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/3115652/20230225090434.png" alt=""...

    uj5u.com 2023-03-28 10:13:31 more
  • C#遍歷指定檔案夾中所有檔案的3種方法

    <a href="https://www.cnblogs.com/xbhp/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/957602/20230310105611.png" alt="" /></a&...

    uj5u.com 2023-03-27 14:46:55 more
  • C#/VB.NET:如何將PDF轉為PDF/A

    <a href="https://www.cnblogs.com/Carina-baby/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/2859233/20220427162558.png" alt="" />...

    uj5u.com 2023-03-27 14:46:35 more
  • 武裝你的WEBAPI-OData聚合查詢

    <a href="https://www.cnblogs.com/podolski/" target="_blank"><img width="48" height="48" class="pfs" src="https://pic.cnblogs.com/face/616093/20140323000327.png" alt="" /><...

    uj5u.com 2023-03-27 14:46:16 more