WorldDiT:用於世界與動作建模的統一擴散架構
為何重要
這項成果挑戰了機器人策略訓練必須依賴高昂龐大型號的既定印象,透過統一架構在保持高效能的同時大幅降低了模型規模門檻。對於物理機器人製造商與開發者而言,這是一個具有參考價值的基準,顯示出輕量級擴散模型在動作決策應用上的潛力,有助於降低部署成本的障礙。
針對目前依賴大型預訓練視覺語言模型作為動作背骨的機器人政策,研究提出 WorldDiT,這是一個統一的擴散 Transformer 架構,在不需使用大型預訓練 VLM Action Backbone 的情況下,將動態生成與視覺世界建模精確耦合。
- 訓練時由單一的擴散 Transformer 生成連續動作區塊,並根據未來的鏡頭畫面預測標準化的 RGB 影像 Patch 目標。
- 在四套 LIBERO 模擬套件中,該模型達成了總模型引數量與平均成功率之間的 Pareto 前沿位置。
- 為未來的擴充套件研究提供了一個強大的 sub-billion-parameter 基準線。