Dynin-Robotics:全方位多元統一擴散視覺語言動作模型
為何重要
該技術展示瞭如何在減少下游部署模組複雜度的同時,利用大規模統一預訓練提升 Robot Policy 的泛化能力,並成功緩解擴散模型常見的運算瓶頸。對產業而言,這意味著原本依賴高算力的擴散模型或許能透過更高效的推論實作(如 29.2 倍加速)加速邁向工業級硬體整合。
新研究提出了機器人策略學習的統一擴散架構,旨在同時處理視覺預測、目標導引與動作生成,透過共享軌跡模型解決傳統策略網路的模組碎片化問題。- 模型基於 Dynin-Omni,將語言、視覺、目標與動作統一表示為離散 token。 - 於 48 個 Open X-Embodiment 資料集中持續預訓練,涵蓋約 133 萬個軌跡。 - 在 Franka Research 3 機器人上,四種操作條件下的平均成功率達 78.4%。 - 最佳化後的區塊並行實現將模型端動作解碼加速最高達 29.2 倍。