Wonder:更佳的影片世界模型
為何重要
Wonder 將 AI 從單一的內容產生者轉型為可互動的空間探索代理,打破了傳統視訊生成缺乏「長期記憶」與「空間永續性」的瓶頸。其提出的自強迫蒸餾修復技術與稀疏注意力解決方案,為效能與一致性的權衡提供了實具體技術路徑,暗示未來生成式 AI 將更重視情境感知與持久化模擬。
Wonder 是一套通用的 3D 視訊世界模型,使用者可根據圖片或條件影片,即時且長期地控制攝影機探索虛擬場景。技術團隊透過系統層級的設計,結合攝影機座標場、稀疏注意力記憶機制,改善學生模型對控制號誌的遵守程度。
- 稀疏注意力機制:模型在推論時能從少量語意 token 中選擇性提取關鍵回憶,而非受限於實際長度。
- 生成表現:在 16 FPS 下確保影片的幾何、外觀與動力學一致性,支援長期漫步。
- 相容性:支援圖片到影片、以及現有動態場景的即時重新拍攝。