為什么spark sql有些任務特別慢?基本同樣的input和shuffle資料量,大多數任務不到10幾分鐘就結束了,但有幾個任務要30分鐘以上,有個還要快1小時,GC時間都差不多。應該不是資料傾斜,因為任務的資料量都差不多。
我用的是spark 1.6,yarn-client模式,通過spark thrift server運行sql跑批。
請各位大神分析分析,在此謝過!





uj5u.com熱心網友回復:
查看一下CPU利用率job,有的特別慢,查看CPU利用率很低,我們就嘗試減少每個executor占用CPU core的數量,增加并行的executor數量,同時配合增加分片,整體上增加了CPU的利用率,加快資料處理速度。
推薦個文章,可以參考一下,可能會幫助你
http://blog.csdn.net/kaaosidao/article/details/78174413
uj5u.com熱心網友回復:
謝謝,現在是一個executor4個核,自動分配executor,磁區沒有設定。接下來,會試試一個executor一個核,看是否有改uj5u.com熱心網友回復:
改成一個executor一個核后,磁區沒有設定,情況還是一樣,見下圖,多數不到4分鐘完成,有一個30分鐘
uj5u.com熱心網友回復:
到最慢機器上查cpu很空閑,很奇怪轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/58949.html
標籤:Spark
上一篇:求教,如何把資料行列轉換?
