DeltaWAM:利用 Delta 與記憶技術的雙手操作世界動作模型
為何重要
- 離線視訊預訓練轉向實機控制的架構創新:DeltaWAM 代表了 Robotic Manipulation 的最新範式轉變,從預測完整視訊切換為僅預測必要的世界動作變化,這對於神經網路做決策的先天優勢有利。 - 解決「視覺隨機化」與真實場域適應性:研究指出了模型在面對視覺幹擾與變異時的成功率大幅增益,顯示出 Delta 預測架構對非結構化環境具有更好的魯棒性。 - 計算資源與延遲的最佳化:透過 SDM 節省顯著的推理和訓練資源,這對於需要即時回饋與運算密集的雙手操作場景至關重要,有助於降低商業化部署成本。 - 為通用 기초 모델 (Foundation Models) 框架提供標準:該研究設定明確的基準與開源程式碼,可能加速類似 World Model 側向機器人領域的技術發散與應用。
- DeltaWAM 設計:提出透過聯合預測視覺差異與動作(Delta 與 Action stream),解決傳統 World-action Models 需預測大量密集未來幀的效率瓶頸與冗餘計算問題。
- 核心技術:引入 Streaming Delta Memory (SDM),運用緊湊的觀測 Delta 更新快取上下文,以減少重型視訊專家的處理負擔。
- 效能精進:在 RoboTwin 基準測試中,Fast-WAM 的平均成功率顯著提升(乾淨環境 81.3%→85.4%、視覺亂模環境 75.8%→83.9%)。
- 成本與效率:三種新架構將訓練計算量(FLOPs)減少 17.78% 至 23.77%,SDM 進一步將單步推理延遲與計算量分別降低 36.57% 與 31.55%。
- 成果驗證:真實世界評估結果顯示,其產出策略在整體成功率與歸一化進度上為所有參與評估者中表現最佳。