場景行為排程模型(GAM):以 3D 定位作為機器人基礎模型的基石
為何重要
這項研究證實,透過架構引入明確的 3D 定位能顯著提升機器人操縱任務的泛化能力與穩定性,尤其是對處理開放式場景與長時距規劃至關重要。對於從事機器人自動化的廠商與開發者而言,這代表未來訓練策略可能將從蒐集大量真實世界示範,轉向在少量乾淨資料上學習結構化幾何特徵,以降低資料採整合本。
現有機器人基礎模型多依賴示範進行隱式學習,難以掌握精確的幾何與度量資訊;研究提出「場景行為排程模型」,透過將提示轉換為共享的物件中心表示,讓模型直接掌握目標特徵與 3D 幾何,作為底層控制器驅動長時距操縱任務。
- 在 RoboTwin 2.0 上,儘管僅在乾淨場景示範中訓練,GAM 在場景隨機化條件下的成功率高達 47.6%,顯著超出現有方法的 30.4%。
- 在 LIBERO-PRO 的 16 種幹擾設定中,GAM 實現了 61% 的平均成功率,重新整理了 53% 的最佳紀錄。
- 在雙手機器人 YAM 的實體驗證中,遭遇視覺偏移時,GAM 保留了 17/20 的成功率,而對照模型僅為 4/20。