ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

WorldDiT:用於世界與動作建模的統一擴散架構

研究 1 個來源 · 9 天前
為何重要

這項成果挑戰了機器人策略訓練必須依賴高昂龐大型號的既定印象,透過統一架構在保持高效能的同時大幅降低了模型規模門檻。對於物理機器人製造商與開發者而言,這是一個具有參考價值的基準,顯示出輕量級擴散模型在動作決策應用上的潛力,有助於降低部署成本的障礙。

針對目前依賴大型預訓練視覺語言模型作為動作背骨的機器人政策,研究提出 WorldDiT,這是一個統一的擴散 Transformer 架構,在不需使用大型預訓練 VLM Action Backbone 的情況下,將動態生成與視覺世界建模精確耦合。

  • 訓練時由單一的擴散 Transformer 生成連續動作區塊,並根據未來的鏡頭畫面預測標準化的 RGB 影像 Patch 目標。
  • 在四套 LIBERO 模擬套件中,該模型達成了總模型引數量與平均成功率之間的 Pareto 前沿位置。
  • 為未來的擴充套件研究提供了一個強大的 sub-billion-parameter 基準線。
WorldDiTDiffusionVLMRobotics ModelLIBEROPareto Frontier

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00