SimpleMemVLA:視覺語言動作模型的高效原生視訊記憶機制
為何重要
傳統多模態模型在長期操作中常受限於記憶權衡,如「遺忘」或「壓縮損失」,而此研究證明保留原始歷史視訊資訊在現代網路架構下實際上更有效率,顛覆了為了效率犧牲精確度的工程直覺;同時,「預填充共用字首」的策略解決了長視窗推理影響延遲的痛點,為 Agent 落地應用提供了具體且架構更簡化的技術路徑。
針對長時間軸操作中過去資訊難以即時存取的問題,本研究提出 SimpleMemVLA,透過直接將原始歷史樣本以時間戳記的格式注入 backbone,解決了傳統壓縮與遞迴狀態機會遺忘重要資訊的痛點。
- 在維持 backbone 與訓練設定不變的前提下,SimpleMemVLA 在四項記憶基準測試上創下新紀錄,並在一般控制任務中未付出額外成本。
- 相較於現有的檢索、壓縮及遞迴狀態機制,該方法表現出大幅領先的優勢;因果乾預實驗進一步驗證,其策略確實依賴歷史記憶做決策。
- 該模型透過在執行動作時預填充共用的歷史字首,將延遲控制在僅略高於單幀 VLA 的水準。