InternW0-Δ:結合預測動態與行動的通用機械人世界行動模型
為何重要
對於正推動機器人從單純「動作執行」邁向「世界模型理解」的產業而言,這類能預測視覺動態的模型是關鍵的能力底座。將龐大訓練資料與權重開源,大幅降低了此領域開發者的技術門檻,能加速機械人應用的部署週期。特別是「Causal Imprint」在無須即時計算未來動態狀態下即可提供預測表示,這點對不受限制的實機推論效率至關重要。
世界行動模型 旨在結合視覺動態預測與機械人行動生成,以實現通用操作能力。新出的 InternW0-Δ 透過異質資料集進行預訓練,架構在 Mixture-of-Transformers 機制上,將視覺動態、場景語義與幾何預測納入單一框架。
- 採用 Mixture-of-Transformers (MoT) 架構,整合預訓練影片與行動專家,並透過視覺語言模型 (VLM) 提供語義引導。
- 建構超過 20,000 小時的處理過訓練資料,並對齊於共同狀態-行動表示。
- 引入 "Causal Imprint" 機制,能從僅具未來監督的訓練資料中學習未來相關場景變化。