論文地址 @inproceedings{Wei2021CVPR, title = {Learning to Recover 3D Scene Shape from a Single Image}, author = {Wei Yin and Jianming Zhang and Oliver Wang and Simon Niklaus and Long Mai and Simon Chen and Chunhua Shen}, booktitle = {Proc. IEEE Conf. Comp. Vis. Patt. Recogn. (CVPR)}, year = {2021} }所有相關整理(論文研讀、PPT展示、代碼實踐)均以資源形式上傳啦,
時間寶貴,主要以圖片形式分享啦
目錄
Abstruct
Introduction
Related Work
Method
Experiments
Discussion
Conclusion
Abstruct
現象:盡管單眼深度估計在野外場景取得了重大突破,但是最新的方法不能夠用于準確恢復的3D場景形狀
原因:未知的深度位移;可能未知的相機焦距
根源:在混合資料深度預測訓練中使用的位移不變重構loss
本文提出:兩階段架構
First:預測影像深度(單眼影像未知比例及偏移)
Second:利用3D點云編碼器預測缺失的深度位移和焦距(幫助恢復一個真實的3D場景形狀)
本文提出:2個loss
影像級歸一化回歸損失
基于法線的幾何損失
增強在混合資料集上訓練的深度預測模型,
研究結果:
在9個看不見的資料集上測驗本文的深度模型,并在Zero-shot資料集泛化上展現了最先進的性能,
Introduction
3D場景重建是計算機視覺的基礎任務
傳統方法:SLAM SfM (基于連續幀或多視圖的特征點對應重建三維場景)
但是本文目標:從單張的野外影像重建密集的三維場景形狀
因此:在沒有多個視圖可用的情況下,作業依靠單目深度估計,
但是:現有的單目深度估計方法本身無法如實的恢復準確的三維點云,
RGB → Predicted Depth(correct)→ the 3D scene shape of the point cloud
現象:點云構成的三維場景形狀出現顯著的畸變
原因:未知的深度位移和焦距
方案:添加恢復的深度位移、恢復的深度轉換+焦距
與多視圖重建方法不同:
單目深度估計需要利用高水平的場景先驗,即實際解決方案-資料驅動方法,
Recent works:
在不同的野外場景資料集(如網路立體影像和立體視頻)中訓練深度神經網路的結果帶來了希望,
但是,不同的訓練集給模型訓練也帶來了挑戰:
因為不同攝像機捕捉到的訓練資料,其深度估計的影像先驗存在顯著差異,
因為未知的相機基線和立體后期處理,網路立體影像和視頻只能提供一個比例和位移的深度監督,
最新作業:最先進的野外單目深度模型使用各種損失實作尺度和位移不變再訓練,
未知的深度比例不會導致任何形狀失真(均勻縮放3D場景),但未知的深度位移會造成形狀失真,
在測驗時,影像的相機焦距可能無法獲得,導致3D場景形狀的更多失真,
影響:這種場景形狀失真是后續任務的關鍵問題(如三維視圖合成和三維攝影等),
Address these challenges:
提出一個新型的單眼場景形狀估計架構=深度預測模塊+點云重構模塊
深度預測模塊:
一個(在現有的混合資料集上訓練的)卷積神經網路,將預測深度映射到一個尺度和位移
點云重構模塊:
利用點云編碼器網路,從場景點云重建的初始猜測——預測位移和焦距調整因素
A key observation:
當操作(從深度圖中得到的)點云而不是影像本身時,可以訓練模型使用合成的3D資料或(三維激光掃描設備獲取的)資料來學習3D場景形狀先驗,
盡管這些資料源的多樣性明顯低于互聯網影像,但是與影像相比,點云的域差距問題要小得多,
實踐表明,點云編碼器能很好地推廣到看不見的資料集,
Robust model:
提出2個loss:為了在多源混合資料基礎上訓練一種魯棒的單目深度預測模型
影像級歸一化回歸損失(簡單有效)
將深度資料轉換為標準的尺度-位移-不變空間,以獲得更健壯的訓練,
成對的表面法線的幾何損失
改善預測的深度圖的幾何形狀,
本文貢獻總結:
? 一種新穎的野外單目三維場景形狀估計框架 ,據作者所知,這是該任務中第一個完全資料驅動的方法;
也是第一個利用3D點云神經網路來改進來自深度圖的點云結構的方法,
? 一種影像級歸一化回歸損失和一種成對表面法向回歸 損失用于改進在混合多源資料集上訓練的單目深度估計模型,
Related Work
Monocular depth estimation in the wild
這項任務最近取得了令人印象深刻的進展,
這些方法的關鍵特性是哪些資料可以用于訓練,以及哪些目標函式對這些資料有意義,
然而,獲取不同的資料集度量的地面真實深度是一個挑戰,
替代方案:
陳等人為互聯網圖片收集了不同相對深度注解,而其他方法則建議從互聯網上抓取立體影像或視頻,
這種不同的資料對于泛化是很重要的,但是由于度量深度是不可用的,所以不能使用直接深度回歸損失,
相反,這些方法要么依賴于評估相對深度的排列損失,要么依賴于尺度和位移不變損失的監督,
尺度和位移不變損失的監督:可以產生特別穩健的深度預測,但由于相機模型是未知的,且深度中存在未知的偏移,因此無法從預測的深度圖重建3D形狀,
本文旨在:從單張野外影像重建三維形狀,
3D reconstruction from a single image
一方面;
許多研究都致力于從單一影像中重建不同型別的物體,例如人類[33,汽車、飛機、桌子等,
主要的挑戰是如何最好地恢復物件的細節,以及如何在有限的記憶體中表示它們,
Pixel2Mesh:提出了從單個影像重建三維形狀,并用三角形網格表示,
PIFu:提出一種高效記憶的隱式函式來恢復人的高解析度表面,包括看不見的/被遮擋的區域,
但是,所有這些方法都依賴于特定物件類或實體的學習先驗,通常來自3D監督,因此不能用于完整的場景重建,
另一方面:
一些作業已經提出從單張圖片重建3D場景架構,
Saxena等人假設整個場景可以被分割成幾塊,每一塊都可以看作是一個小平面,他們預測平面的方向和位置,并將它們拼接在一起來代表場景,
其他作業提出提出利用陰影和輪廓邊緣等影像線索進行場景重建,
但是,這些方法使用手工設計的先驗和對場景幾何的限制性假設,
本文方法:全資料驅動,可應用于廣泛的場景,
Camera intrinsic parameter estimation
恢復相機的焦距是三維場景理解的重要組成部分,
傳統的方法:利用參考物件,如平面校準網格或消失點,然后使用它們來估計焦距,
其他方法:提出了一種資料驅動的方法,其中CNN從影像中直接恢復野外資料的焦距,
相對的,
本文的點云模塊直接在3D中估計焦距,作者認為這比直接在自然影像上操作更容易,
Method
Two-stage單張影像3D形狀估計 pipeline,由深度預測模塊(DPM)和點云模塊(PCM)組成
?DPM和PCM兩模塊不同資料源上分別訓練,在推理程序中相結合,
?DPM模塊:RGB影像→depth map (與真實的度量深度圖的比例和位移未知)
?PCM模塊:扭曲的點云 →利用預測的深度圖d和焦距的初始估計f計算 →輸出對深度圖和焦距的位移調整,以提高重建的3D場景形狀的幾何形狀,
注意:使用點云網路分別預測位移和焦距比例因子,
depth shift ?d focal length f? αf 精確的場景形狀重建
Experiments
Discussion
Limitations:
? 當場景沒有足夠的幾何線索時, PCM 模塊無法恢復準確的焦距和深度位移如:整張影像大部分為墻或天空
? 本文方法 的準確性也會隨著從非常見視角 ( 例如,自上而下 ) 或極端焦距拍攝的影像而降低 ,更加多樣化的3D訓練資料可以解決這些失敗案例,
? 本文方法 沒有對來自 相機徑向畸變 的影響進行建模,因此在嚴重的徑向畸變情況下,重建的場景形狀會發生畸變 ,研究如何利用PCM恢復徑向畸變引數將是一個未來研究方向,
Conclusion
在作者所知范圍內,其提出的方案:首例由全資料驅動的方法從單目影像重建三維場景形狀
作者提出使用點云網路在已知全域深度偏移和焦距的資料集上訓練,旨在恢復移動和焦距進而用于三維重建,
這種方法顯示出很強的泛化能力,作者認為它可能對基于深度的相關任務有幫助,
大量的實驗證明了作者的場景形狀重建方法的有效性和對未知資料的推廣能力,
筆者主要學習深度部分,因此僅對一階段深度 進行實踐探究啦,效果如圖

轉載請註明出處,本文鏈接:https://www.uj5u.com/qita/296783.html
標籤:其他












