MemBodied:復現連結記憶與視覺語言行動模型的結合
為何重要
這項研究直接解決了 VLA 模型在長時間、複雜操作任務中的「上下文膨脹」痛點,透過高效記憶機制在減少推理延遲的狀況下顯著提升表現。對開發者而言,這是提升自主機器人完成歷史依賴任務可靠性的一種實用架構;對產業觀察者來說,此技術路徑顯示記憶機制是未來機器人從「靜態指令」邁向「動態操作」的關鍵細節。
現有的 Vision-Language-Action (VLA) 模型多無法有效保留長期狀態,導致歷史依賴型任務表現不佳。為解決此問題,文中提出 MemBodied 架構,使用緊湊的記憶元件取代翻譯機式的原始觀察記錄。
- 使用 associative state 與 episode anchor 元件,在不增加上下文維度的情況下捕捉回合級互動資訊。
- 在 5 個 RMBench 記憶型任務中,成功率相較無狀態策略提升 7.81 倍。
- 在 LIBERO-Long 完全可觀測套件中達到 90.6% 成功率,較無狀態 π_0 策略提升 5.4%。