AlayaVista:串流視訊世界模型——將全景狀態轉化為透視觀測
為何重要
這項工作為生成式 AI 應用在互動模擬與 VR/AR 場景提供了新的架構範式,將「世界狀態」與「取景」分離,避免單純擴大 context window 帶來的計算開銷,為具體執行的 Agent 提供了兼具全域性視野與低延遲的視覺輸出方案。
傳統互動式影片世界模型常在全域性場景視角與高擬真透視細節之間面臨取捨,新提出的 AlayaVista 旨在解決這一限制。
- AlayaVista 將全景世界演化與透視觀測合成解耦,透過單張透檢視片建構 360 度場景先驗,再經過渲染與精修產生影片。
- 為提升生成效率,該模型採用分塊自迴歸生成與知識蒸餾技術,將繁重的渲染壓縮成少步驟過程。
- 系統配備了自建的大型資料集 MUGEN,包含 1,318 小時的實際世界全景影片,解析度至少為 4K。