2022年2月28日,我將我改了4遍的簡歷上傳至boss上,還沒開始投遞,但收到來自百度的hr訊息,于是發了一下簡歷,沒過幾天便來自百度的面試邀請,直接上圖吧,

實習面試:
- 1. 一面問題
- 2. 二面問題
- 3. 總結
1. 一面問題
- 自我介紹
- 你博客的電商分析專案中,我看你用到了很多組件,你能說說這些組件都是在干什么嗎?
- 了解hadoop的組件嗎?說一說yarn在hadoop中的位置,以及執行作業時yarn的作用?
- 你剛才提到es,你使用過es嗎?了解es的原理嗎?
- 你會scala嗎?
- 說一下mapreduce的流程,以統計文本單詞數為例?
- 如果一份資料某個key值數量較多,我們應該怎么辦?
- 大表join小表你會怎么處理,小表join大表呢?
- 和別人相比,你覺得你你自己的優勢在哪里,或者說自己的優點?
- 這些博客都是你自己寫的嗎?
最后,面試官說:我應該是你二面的面試官,但是由于流程安排有問題,我成為了你一面的面試官,sql題和python題就不考你了,你等后續的安排吧,一面的面試官會考你題,
一面結束后,當晚就收到了來自百度的二面電話,通知第二天下午3點二面,
2. 二面問題
- 自我介紹
- SQL題:在兩張表,表中有3個欄位(id,label,date),ID代表的是用戶標識,label代表的是標識,date代表日期,我要尋找前后兩天id一樣,但label不一樣的用戶id和label
- SQL題:還是那兩張表,這次表的id不唯一,要求出同一id下今日最大的label和昨日最大的label,并進行比較,只取出相等label的id
- 會用scala嗎?
- spark的并發數了解嗎?怎么進行設定?
- 看你用過es,你會es的命令嗎?
- 你知道spark的repartition算子嗎?
- 我有一個這樣的場景,在用spark處理資料的時候,需要很大的并發量,而我寫入es時,并發量需要很小,否則容易崩潰,你覺得怎么實作這一程序?
- 回答一下:磁區數,并發和核心數的關系?
- 根據上述你回答的關系,你覺得在剛才的場景中,如何實作高并發處理,低并發寫入es?
- 根據你的回答,repartition算子應該如何運用在上述程序中?
- 除了repartition算子,你還能想到其他的算子能實作這個功能嗎?
- 你知道coalesce算子嗎?它合并磁區不需要進行shuffle
- 平時用rdd的情況多嗎?
- 說一下你的經歷吧,在滴滴實習的經歷
- 你能實習多久?
面試官從頭到尾都是很認真的態度,并且我從并發數那道題開始就回答不上來了,但程序中一直在引導我,后面支支吾吾完成了面試,看來自己在spark的運行機制上的理解還是很淺,有必要加強一下自己對spark整個流程的運作這方面的知識,
3. 總結
面試的要手撕的代碼倒不難,但是難在對大資料組件的基礎理解上,我原本以為作為一個資料開發人員不需要知道spark怎么配置,并行度是如何設定,計算資源是如何分配的,因為大資料開發人員有自己的配置規則,但二面的問題確實比較細,后續程序我會查找資料,將這些題的答案都公布在本博客,歡迎有知道以上問題的小伙伴給我丟鏈接、資料或者私信我呀!
轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/436410.html
標籤:其他
上一篇:幾分鐘明白Flink水位線
下一篇:【外行也能看懂的RabbitMQ系列(四)】—— RabbitMQ進階篇之通過插件實作延遲佇列(內含實作代碼及rabbitmq_delayed_message_exchange安裝)
