ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

HARMONY:利用階層式代理推理實現單眼影像到場景合成

研究 1 個來源 · 2 小時前
為何重要

此研究解決了多模態 AI 進階應用在 3D 場景重建上的關鍵痛點:如何讓模型不僅「看懂」語意,還能精確鋪陳三維幾何關係。HARMONY 展示了「思考鏈」在中階影像處理的應用潛力,為 AR/VR 資產生成、室內設計工具的自動化以及數位孿生技術提供了具體可驗證的技術路徑。

從單一單眼影像重建完整的 3D 室內場景面臨語意理解與幾何精準度的雙重難題。本文提出的 HARMONY 回答這個挑戰,透過結合視覺語言模型與視覺幾何基礎模型的階層式框架,將影像中的語意資訊精確轉化為 3D 結構。

  • 採用階層式佈局策略:系統從空的地板平面圖開始,依序校準相機、概略重建空間框架,並透過代理 VLM 規劃物件放置順序(牆面固定裝置 → 獨立傢俱 → 傢俱裝飾)。
  • 採用深度優先遍歷與回饋迴圈:物體放置會條件變數引用先前解決的結構,並在每一步進行反思以避免錯誤累積。
  • 整合幾何精修:在 VLM 佈局後,即時使用點雲預測進行幾何修正,確保最終渲染影像與原始輸入高度對齊。
  • 對比標竿:在合成與真實影像的實驗中表現優於既有重建基準,且定性上與 GPT-6 Astra 相比更忠實地保留了場景細節。
HARMONY3D ReconstructionVLMChain-of-thoughtComputer Vision

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00