ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

破解視覺-動作捷徑:通用機器人基礎模型的潛伏介面訓練

研究 1 個來源 · 9 天前
為何重要

機器人領域長期受制於環境相依性,研究顯示透過明確定義期望輸出(如終端位姿),能有效抑制模型對場景細節的過度擬合。這種將「空間推理」與「視覺觀察」解耦的技術路徑,為未來建立高泛化性、低範例需求的通用機器人系統提供了可信的訓練範例。

現有機器人基礎模型常利用與行動無關的視覺捷徑來預測動作,導致在環境變異時泛化能力崩潰。該研究提出 Latent Interface Training (LIT) 方法,透過分離視覺輸入與目標導向行動生成的邏輯,強制模型學習穩固的空間推理能力。

  • LIT 採用框架無關的兩階段策略:第一階段訓練行動專家以終端 SE(3) 端點位姿為目標;第二階段引入包含視覺與語義的潛伏介面,僅作為視覺條件通路。
  • 在 Pi0.5、MolmoAct2、FAST-WAM 和 ImageWAM 四個架構中,LIBERO-Plus 整體成功率高升 3.87 至 10.70 個百分點。
  • 在未見過的相機設定、光照變異及幹擾物的真實環境評估中,成功率高達 13.30 至 16.70 個百分點。
Latent Interface Training (LIT)RoboticsFoundation ModelsLIBERO-PlusGeneralizationVision-Language-Action

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00