DyPES-VLA:學習共享動態先驗與實體特定控制的跨實體操作模型
為何重要
此研究解決了異構機器人開發的核心痛點,即不同實體間語義與物理約束的對齊難題。對開發者而言,提供了無需繁瑣格式轉換即可部署跨平臺策略的新架構;對產業而言,這標誌著 VLA 模型正朝著解決真實世界物理約束的關鍵能力邁進,有望加速機器人軟體層的互通與普及。
現有的視覺-Language-動作模型在訓練跨實體異構機器人的通用政策時仍面臨資料動態先驗利用率低與繁瑣預處理的瓶頸。新提出的 DyPES-VLA 模型透過在視覺-Language 模型上訓練未來預測目標來獲取共享動態先驗,並利用專屬於實體的混合專家動作頭生成控制指令。
- 該模型利用未來預測目標在共享視覺-Language 模型上學習共享動態先驗,涵蓋物體運動與接觸變化。
- 採用混合專家(MoE)架構,共用注意力層捕捉常見時間動作結構,專用前饋專家處理不同實體的運動學約束與語義。
- 在模擬與真機評估中達到最高效能,LIBERO 成功率為 98.0%,RoboCasa-GR1 為 59.25%,RoboTwin~2.0 為 89.02%。