萃取世界模型的內在表示法,輕量化機器人 VLA 政策模型的訓練策略
為何重要
這項研究解決了當前 VLA 模型在正向因果與資料覆蓋之間的矛盾:將世界模型的「物理常識」儲存在輕量內部表示中,讓機器人政策模型直接繼承這種地面化能力,而不需依賴昂貴的即時模擬。對開發者而言,這提供了一種在不消耗額外算力情況下提升機器人泛化能力的範式;對產業而言,這意在推動演算法效率,讓執行於實體機器上的感知-決策迴路更加即時且穩健。
Vision-Language-Action (VLA) 模型缺乏對世界回應的理解,使其表現主要受資料覆蓋範疇限制。研究者提出將世界模型的內部表示(無需生成未來)與生成機制分離的方法:訓練時使用一個冷凍的世界模型先處理並快取幀特徵,輕量化的學生模型只負責去比對並模仿這些特徵快取,從而消除執行模擬所需的延遲,提升即時控制效能。
- 訓練效率:訓練過程中不會載入教師模型,且必須的投影器在訓練結束後會被丟棄,成功的表現歸因於表示法而非模型容量增加或測試時運算成本的提升。
- 模型規格:鑑定出的政策模型可在消費級 RTX 5090 上於 32 毫秒內運作,記憶體需求僅 1.86GB。
- 指標表現:0.8B 引數的學生模型在 LIBERO 任務中達到 97.9%;在 RoboCasa-GR1 人形機器人操縱任務中,精確度從 48.2% 提升至 50.5%。
- 適應性:表現增長在不同學生模型規模、架構及對齊層中皆一致,顯示出普遍的表示法先後件,並在單臂及雙臂實體平臺驗證有效。