ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

MiniWorld:從頭訓練視訊世界模型的民主化框架

研究 1 個來源 · 1 天前
為何重要

透過將視訊世界模型的訓練門檻從複雜的調整管道下調至單一 8-GPU 伺服器,此框架能加速嵌入式 AI 與互動模擬相關的研究進展;開源釋出訓練與檢查點也有助於降低社群復現障礙,促進更多基礎模型的比較與最佳化。

MiniWorld 提供了一個輕量級且完全可重現的框架,旨在解決在受限計算資源下建立視訊世界模型的障礙,這類模型對於具身 AI 至關重要。

  • 其核心採用區塊因果 Video Diffusion Transformer,基於 Flow Matching 與 Diffusion Forcing 訓練,並在預訓練 Video VAE 的潛空間中運作。
  • 推理階段透過結合滾動 KV 快取與非同步去噪機制,在有限算力下優化了串流生成效率。
  • 研究者聲稱該框架可在單一 8-GPU 伺服器上於數天內完成訓練。
MiniWorldVideo World ModelsDiffusion TransformerFlow MatchingEmbodied AI

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00