WCM:視覺語言行為強化學習的世界評判模型
為何重要
WCM 針對強化學習中評判器無法捕捉部分可觀測性的核心痛點,透過引入世界模型目標大幅強化了 VLA 模型的跨時序推論能力。憑藉對主流 VLA 架構的相容性,該技術將顯著提升機器人在複雜現實環境中進行長期規劃的泛化與穩定性,為自動化機器人的效能帶來級數化的進步。
針對機器人視覺語言行為模型在強化學習後訓練中僅依賴單幀觀測的缺陷,研究提出 World Critic Model 來解決評判器在捕捉跨時序動態上的不足。
– 提案者構建了基於輕量級 LeJEPA 架構的 WCM,該模型聯合預測未來潛在狀態與價值,而非進行單純的數值回歸。
– WCM 完美相容於 Pi0、Pi0.5 和 OpenVLA-OFT 等頂尖 VLA 骨幹網路,並適用於離線與策略訓練流程。
– 在 149 個任務的跨四項基準測試中,WCM 在分佈內與分佈外情境下均取得最優效能,並在七項真實世界任務中驗證了其穩定性。