BridgeVLA++:具記憶增強與資料效率的 3D 機器人視覺語言動作框架
為何重要
將視覺語言模型應用於機器人操作時,「記憶」與「資料效率」是從實驗室走向工業部署的根本門檻。BridgeVLA++ 解決了長期操作的上下文丟失問題,同時展現出在真實裝置與雙手操作場景的適應性。這類專注於 3D 感知與具備記憶機制的機器人框架,將進一步推動具體落地場景的通用操作可行性。
BridgeVLA++ 改良了既有的 3D 視覺語言動作模型,透過引入統一的空間時間記憶架構,解決了現有方法對資料需求大與缺乏過往觀察記憶的問題。
- 在保留原有資料效率與泛化能力的基礎上,新增了能夠推論觀察歷史的記憶機制。
- 在兩項具記憶依賴性的操控基準測試中,達到先程序度(SOTA)。
- 驗證於雙手操控與真實機器人平臺,展現任務與環境的可擴充性。