ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

WorldCrafter:具隱含 3D 感知記憶的一致性視訊世界模型

研究 1 個來源 · 1 天前
為何重要

這項研究標誌著生成式 AI 正從單純 2D 視覺生成邁向「空間世界模型」的前沿。對開發者而言,這提供了一種從文字提示驅動流式 3D 場景探索的新技術路徑;對產業來說,長時間軸的一致性突破是虛擬建築、遊戲生成與具身智慧體落地的關鍵樞紐。

視訊世界模型雖能探索動態環境,但通常難以在長期遠景與跨視角下保留先前的觀察結果。WorldCrafter 透過引入一種可「相機查詢」的隱含 3D 感知記憶,解決了這一長期一致性的問題。

  • 核心機制:讓請求的視角決定如何將多視角證據壓縮至 video generator 的有限 token 預算中。
  • 架構設計:結合記憶編碼器與姿態條件讀取模組,在去噪前將歷史觀察整合為固定目標視角專屬 token。
  • 表現優勢:在靜態與動態場景中均顯著提升長距離一致性和相機控制精準度,並支援從單張圖片或文字提示開始的流式場景探索。
WorldCrafterVideo World ModelImplicit 3D MemoryTemporal ConsistencyVideo Generation

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00