HuRo:利用機器人化人類影片進行可擴充套件 VLA 預訓練
為何重要
該研究解決了 VLA(視覺-動作)模型訓練中的關鍵資料瓶頸,透過機器人化人類影片來補充昂貴的真實機器人資料。顯著提升的 OOD 表現表明,此方法不僅大幅縮短了訓練時間,更強化了模型的泛化能力,這對於製造 reliable autonomous agent 至關重要。
- 研發了一套 HuRo pipeline,將五個來源的異構人類影片轉換為機器人對齊的觀測和動作軌跡。
- 構建了 HuRo dataset,包含約 630K episodes 和 142M 處理後的 frames。
- 在四個真實操作任務中,增加 robotized pretraining 資料使完成率從 51.5% 提升至 80.3%。
- 在空間和視覺偏移下的 OOD(未見分佈)完成率從 34.9% 提升到 72.2%。