ST-WAM:因應視覺分佈偏移的語義-時間世界行動模型
為何重要
此研究表明,在具身智慧中混合通用語義理解(如 DINOv3)與特定動態模型(如 VAE)是解決機器人泛化能力痛點的有效路徑。對產業開發者而言,這意味著在不增加昂貴任務標註資料的情況下,就能提升機器人面對非結構化環境的可靠性,大幅降低開發與部署門檻。
為瞭解決現有世界動作模型(WAMs)在視覺環境變化時產生的「訓練分佈幻覺」問題,研究提出 ST-WAM 框架。該模型引入 DINOv3 做為穩定的語義表示,結合 VAE 動態建模,並利用雙空間未來專家(DSFE)與當前錨定意圖檢索(CAIR)技術,在不需額外資料標註及具身預訓練的情況下,提升機器人操縱的魯棒性。
- 在 LIBERO 基準測試達 98.7%,RoboTwin 2.0 基準達 92.8%
- 在零樣本 LIBERO-Plus 測試中,相比 Fast-WAM 表現提升 21.3 個百分點
- 真實世界中視覺分佈偏移下的操縱成功率從 25.8% 增至 61.5%(超過兩倍)