RL$^2$-VLA:透過試驗時間擴充套件進行的適配 RL 潛在組合 Steering 以提升視覺-語言-動作模型
為何重要
這項研究揭示了試驗時間擴充套件並非只關乎規模,而是需依據輸入狀態動態調整策略。對於機器人與自主 Agent 發展而言,能以輕量級 RL 潛在空間調整取代繁重的遞迴訓練,對提升實際部署的穩健性與長期無人操作能力具有重大意義。
現有的試驗時間擴充套件技術常導致動作樣本聚集或策略僵化,RL$^2$ 框架引入了一種適配的 RL 潛在組合 Steering 機制,透過編排 VLA 動作專家的潛在向量來提升表現。
- 此框架訓練一種輕量級的離線 RL 策略,使其「流動速度」與凍結的 VLA 結合,從而啟用在模仿學習弱勢中無法實現的行為多樣性。
- 研究團隊發現成功與失敗狀態下的擴放定律截然不同,因此設計灑佈策略,即僅在預測失敗時啟用 Steering,以避免幹擾已正確的動作。
- 在 SIMPLER 和 PolaRiS 基準測試中,RL$^2$ 在領域外設定下的成功率提升了 17.3%,並透過真實世界實驗證實了其泛化能力。