ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Spatial-Interactor:透過物理世界互動學習空間推理

研究 1 個來源 · 1 小時前
為何重要

這項研究將 VLM 的能力從「觀察」推向「互動」,解決了 Agent 在動態物理環境中維護狀態的關鍵技術難題。若模型能精準理解動態變化,將直接提升雲端無人商店 Agent 或具體行動機器人的決策精確度。 雖然通用性強,但理論突破為未來具體應用提供了高品質的底層推論依據,值得產學界與技術決策者追蹤。

視覺語言模型在日常動態環境中的空間推理能力往往不足,新研究提出框架透過與物理世界的互動來強化這項能力。

  • 建構了名為「LSI-108K」的資料集,由模擬與真實的互動軌跡組成,涵蓋 L1 到 L3 三層課程。
  • 採用兩階段訓練策略:先以 Supervised Fine-Tuning (SFT) 處理 L1 與 L2 的本地狀態轉換;再利用 On-Policy Distillation (OPD) 讓學生模型學習 L3 長期軌跡中的連續轉換。
  • 實驗顯示,引入受託監督的 Self-Distillation 能有效提升 VLMs 在狀態建模與長期整合上的表現。
Spatial-InteractorVLMOn-Policy DistillationLSI-108KAction-space Training

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00