ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Dynin-Robotics:全方位多元統一擴散視覺語言動作模型

研究 1 個來源 · 8 天前
為何重要

該技術展示瞭如何在減少下游部署模組複雜度的同時,利用大規模統一預訓練提升 Robot Policy 的泛化能力,並成功緩解擴散模型常見的運算瓶頸。對產業而言,這意味著原本依賴高算力的擴散模型或許能透過更高效的推論實作(如 29.2 倍加速)加速邁向工業級硬體整合。

新研究提出了機器人策略學習的統一擴散架構,旨在同時處理視覺預測、目標導引與動作生成,透過共享軌跡模型解決傳統策略網路的模組碎片化問題。- 模型基於 Dynin-Omni,將語言、視覺、目標與動作統一表示為離散 token。 - 於 48 個 Open X-Embodiment 資料集中持續預訓練,涵蓋約 133 萬個軌跡。 - 在 Franka Research 3 機器人上,四種操作條件下的平均成功率達 78.4%。 - 最佳化後的區塊並行實現將模型端動作解碼加速最高達 29.2 倍。

Dynin-RoboticsDiffusion Foundation ModelRoboticsOpen X-Embodiment

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00