ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

模態自迴歸 World-Action 模型 (ModAR):高效預測未來行為

研究 1 個來源 · 7 天前
為何重要

對於機器人自主學習與具身智慧 (Embodied AI) 開發者而言,該研究驗證了使用「幾何密集」的模態(如深度圖、網點軌跡)比單純 RGB 能更高效地捕捉動態與情境。相比於傳統預測 RGB 的做法,ModAR 所展現的順序生成優勢與 20 倍的訓練算力減少,暗示未來具身 AI 可能走向更輕量化的訓練管道。

世界行為模型 (WAMs) 旨在聯合預測未來觀測資料與執行動作,本文提出 ModAR 這型別的模型透過自迴歸去噪技術,在預測行為前先產生多種未來模態。

  • 評估顯示,ModAR 可提升網點軌跡與深度圖的表現,但額外預測未來 RGB 影像並非必要。
  • 在實際雙手任務中,ModAR 平均成功率達 75%,優於微調 Video-model-initialized WAM Flex-π72%
  • ModAR 僅需約 20倍 的訓練 FLOPs 即可達成同等效能且不需預訓練,大幅降低運算成本。
ModARWorld-action modelsEmbodied AIRoboticsDeep Learning

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00