MobileVLA-R1 2.0:增強式強化學習導向的機器人控制框架
為何重要
這項研究為 VLA(Vision-Language-Action)模型提供了從「觀察模仿」邁向「邏輯規劃」的高效範式,針對具身智慧 場景中的長距離推理軟殼問題提供了具體解法。 對產業而言,此技術的進展意味著 Unitree G1 及類似商用機器人邁向具備 SOP 執行能力的關鍵一步,透過軟硬體解耦與 RL 的結合,可大幅縮減商業部署後的調教成本與失敗率。 這同時也鞏固了 Hugging Face 作為具身 AI 技術堆疊核心的角色,影響未來開源與專有框架在工業自動化利基市場的競爭版圖。
行動機器人長期面臨高層次語義推論與低層次運動控制脫節的難題,MobileVLA-R1 2.0 透過結合結構化感知推理與強化學習(RL),將複雜的指令轉化為可靠且可執行的行動,解決了長時序決策的一致性問題。
- 採用監督式心流推論結合強化學習,在軌跡上學習多細緻度的推理能力,提升推理與行動的對齊。
- 引入「推理條件行動解碼器」,將多模態推理直接對映為任務目標,並由控制器轉換為機器人專屬指令。
- 在 VLN-CE 基準上平均成功率提升 1.6 點,Unitree G1 實務操作的完整任務成功率較上一代提升 10.0 點。
- 支援導航、四足及人形機器人,在多種平臺展現長時程封閉迴路執行能力。