從預訓練到精通:利用極少人工幹預進行長時序操作的真實世界子任務 RL
為何重要
這項研究精準解構了機器學習落地真實場景的最大痛點:如何在不使用大量資料與高成本人機互動下,修復預訓練模型的「微觀缺陷」。PARTS 的核心價值在於「區域性化修正」——讓稀疏的全域性獎勵能轉化為具體、密集的區域性成功訊號,這不僅解決了 RL 訓練難度,更為機器人自動化的資本支出(CAPEX)最佳化提供了新路徑。對開發者而言,這是從通用政策過渡到工業級助手的最重要範式轉移。對產業而言,這證明瞭「預訓練 + 特定領域精修」比耗時的全面重訓更有效率。
面對長時間序列的機器人操作任務,預訓練的政策往往僅能拿捏整體流程,卻在少數關鍵子步驟重複失敗;傳統監督式微調(SFT)無法解決此困境,現有 RL 亦因獎勵稀疏而難以有效最佳化。研究團隊提出 PARTS 框架,利用代理人生成選擇器與成功驗證器,對預訓練政策的殘差部分進行區域性獎勵指引的強化學習細緻調校。
- PARTS 在訓練中結合了線上 RL 與成功權重重訓,每一個重訓後的殘差政策都會被重新部署以累積經驗。
- 實測結果顯示,在雙手 YAM 任務上完整成功率高達 61%(原 32%),單臂 Franka 任務高達 95%(原 50%),平均僅需數十分鐘真實世界推演。
- 與既有真實世界 RL 微調方法相比,在相同機器人開放空間預算下,整體任務成功率提升超過 25%,且大幅減少人工幹預。