ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

HuRo:利用機器人化人類影片進行可擴充套件 VLA 預訓練

研究 1 個來源 · 1 天前
為何重要

該研究解決了 VLA(視覺-動作)模型訓練中的關鍵資料瓶頸,透過機器人化人類影片來補充昂貴的真實機器人資料。顯著提升的 OOD 表現表明,此方法不僅大幅縮短了訓練時間,更強化了模型的泛化能力,這對於製造 reliable autonomous agent 至關重要。

  • 研發了一套 HuRo pipeline,將五個來源的異構人類影片轉換為機器人對齊的觀測和動作軌跡。
  • 構建了 HuRo dataset,包含約 630K episodes 和 142M 處理後的 frames。
  • 在四個真實操作任務中,增加 robotized pretraining 資料使完成率從 51.5% 提升至 80.3%。
  • 在空間和視覺偏移下的 OOD(未見分佈)完成率從 34.9% 提升到 72.2%。
HuRoVLARobot LearningPretraining

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00