破解視覺-動作捷徑:通用機器人基礎模型的潛伏介面訓練
為何重要
機器人領域長期受制於環境相依性,研究顯示透過明確定義期望輸出(如終端位姿),能有效抑制模型對場景細節的過度擬合。這種將「空間推理」與「視覺觀察」解耦的技術路徑,為未來建立高泛化性、低範例需求的通用機器人系統提供了可信的訓練範例。
現有機器人基礎模型常利用與行動無關的視覺捷徑來預測動作,導致在環境變異時泛化能力崩潰。該研究提出 Latent Interface Training (LIT) 方法,透過分離視覺輸入與目標導向行動生成的邏輯,強制模型學習穩固的空間推理能力。
- LIT 採用框架無關的兩階段策略:第一階段訓練行動專家以終端 SE(3) 端點位姿為目標;第二階段引入包含視覺與語義的潛伏介面,僅作為視覺條件通路。
- 在 Pi0.5、MolmoAct2、FAST-WAM 和 ImageWAM 四個架構中,LIBERO-Plus 整體成功率高升 3.87 至 10.70 個百分點。
- 在未見過的相機設定、光照變異及幹擾物的真實環境評估中,成功率高達 13.30 至 16.70 個百分點。