NVIDIA 發布 340 億引數 VLA 模型 Alpamayo 2 Super,結合 Cosmos 3 與 Action Expert
為何重要
過去自駕車開發需使用多個獨立模型處理軌跡、意圖與標註,導致工作流不一致且難以監控。Alpamayo 2 Super 透過單一 VLA 模型整合這些任務,為資料註標、策略教學與評估提供統一的基礎,顯著降低了技術整合與計算開銷。對產業而言,其商業友好的授權與 SOTA 基準有助於加速開發者驗證自駕決策邏輯,進而加速具體的商業化週期。
NVIDIA 發布了一個名為 Alpamayo 2 Super 的開源視覺語言動作(VLA)模型,旨在解決自駕車開發流程中模型割裂的問題。
- 模型總引數為 34 億,結合了 32B Cosmos 3 Super Reasoner 與 2B Action Expert,並透過強化學習進行後訓練。
- 能進行 360 度感知(最多七個相機)、生成未來軌跡、CoC(Chain-of-Causation)推理軌跡、高階 meta-actions,以及 VQA 2D grounding 與自動標籤。
- 在關鍵評測中達到 SOTA 表現,包括在 Physical AI AV Dataset 上 minADE_6 為 0.911m 的軌跡預測,以及 LingoQA 基準上 79.2 分(領先 Qwen2.5-VL、GPT-4o 等模型)。
- 採用 Linux Foundation 的 OpenMDW-1.1 授權,允許微調、衍生模型與商業重新分發,濃縮模型亦可商業部署。