Marigold V2:重訪擴散 Transformer 在單眼深度估計上的應用
為何重要
對於需要精細 3D 重建與機器人視覺的開發者而言,Marigold V2 突破了現有模型在邊緣解析度與分佈外泛化上的瓶頸,該技術路徑提供了將擴散模型應用於下游任務的新範例。從產業競爭看,這顯示出 AI 領先者(如研發團體)致力於挖掘基礎模型在傳統密集回歸任務中的潛力。這屬於高深度的技術突破,長期可能影響渲染軟體與自動駕駛輔助技術的發展。
Marigold V2 是一套利用 Diffusion Transformer (DiT) 架構與擴散模型技術來改進電腦視覺單眼深度估計能力的最新方案。研究團隊通過調整內部表示、引入新的損失函式,並在保留模型容量的情況下優化了單步推理流程。
- 多項改進包含對齊模型內部表示與真實語義特徵,以及採用基於 Sinkhorn 損失函式的 2 階段微調協議。
- 在 KITTI 和 ETH3D 基準測試中,該模型相比前代最佳在絕對相對誤差(AbsRel)上提升了 16% 至 26%。
- 模型不僅能在場景重構中產生更清晰的深度圖,還解決了先前難以辨識的毛髮、葉狀細節與薄邊緣問題,並可適用於表面法線與內在影像分解等任務。