ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

MemBodied:復現連結記憶與視覺語言行動模型的結合

研究 1 個來源 · 51 分鐘前
為何重要

這項研究直接解決了 VLA 模型在長時間、複雜操作任務中的「上下文膨脹」痛點,透過高效記憶機制在減少推理延遲的狀況下顯著提升表現。對開發者而言,這是提升自主機器人完成歷史依賴任務可靠性的一種實用架構;對產業觀察者來說,此技術路徑顯示記憶機制是未來機器人從「靜態指令」邁向「動態操作」的關鍵細節。

現有的 Vision-Language-Action (VLA) 模型多無法有效保留長期狀態,導致歷史依賴型任務表現不佳。為解決此問題,文中提出 MemBodied 架構,使用緊湊的記憶元件取代翻譯機式的原始觀察記錄。

  • 使用 associative state 與 episode anchor 元件,在不增加上下文維度的情況下捕捉回合級互動資訊。
  • 在 5 個 RMBench 記憶型任務中,成功率相較無狀態策略提升 7.81 倍。
  • 在 LIBERO-Long 完全可觀測套件中達到 90.6% 成功率,較無狀態 π_0 策略提升 5.4%。
MemBodiedVision-Language-ActionRMBenchLIBERO-Longepisodic memory

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00