超越 VLM:世界動作模型如何重塑機器人操控
為何重要
世界動作模型 (WAMs) 將機器人從單純模仿演示轉向理解物理互動動態,大幅降低了特定任務或機械臂的標註資料需求,賦予更強的開放世界泛化能力。對開發者而言,這提供了一條從開源世界基礎模型構建專用政策的路徑;對投資人而言,此技術若能成功壓縮部署成本,將顯著影響具身 AI 產業的商品化時程。
NVIDIA 發布的 Cosmos 3 世界模型架構挑戰傳統視覺-語言動作模型 (VLM),透過學習物理演化來讓機器人實現零樣本轉移。該模型多模態輸入與生成能力,為機器人指導構建了強大的物理先驗基礎。
- Cosmos 3 採用 mixture-of-transformers 架構,結合 autoregressive transformer 用於推論為 diffusion transformer 用於生成視覺、音訊與動作等連續模態。
- 訓練資料涵蓋約 7.67 億張圖片、3.48 億個現實動態影片以及 800 萬個來自主操作、自駕與相機運動的動作樣本。
- Cosmos3-Nano-Policy-DROID 模型為 160 億引數,在輸入語言指令與多攝像頭觀測下生成機器人動作軌跡。
- 該模型在 RoboLab 環境中將成功率高從 28.1% 提升至 36.8%;Edge 版本可在 NVIDIA Jetson 上以 15Hz 速率於 640×360 解析度下執行即時控制。