可程式化世界模型
為何重要
此突破開啟了從「生成式隨機影片」走向「可程式化互動模擬」的關鍵路徑,解決了長期一致性這一製造業或具身智慧的難點。對投資人而言,這代表在通往通用 AI(AGI)的過程中,即時時空環境的邏輯控制與記憶維護將佔據核心地位,未來可能重塑遊戲開發與數位內容產業。
現有影片世界模型雖然能夠生成高模擬互動體驗,但在維持持久世界狀態與強制執行程式化規則方面存在不足。本研究提出了「可程式化世界模型」架構,核心在於將世界狀態演化與視覺觀察生成解耦。
- 代理將自然語言指令轉化為可執行的程式,指定實體狀態和狀態轉換規則,並透過輕量引擎維護明確且持久的全域性世界狀態(包含螢幕外實體與非視覺屬性)。
- 引入「狀態增強的 3D 方向性邊界框」作為中介表示,結合目標攝影機軌跡確定性編譯出畫素對齊的時空條件訊號,供預訓練影片模型作為生成式渲染器。
- 在新建立的評測領域「CombatStateBench」上,方法達到 94% 的計數準確率和 98% 的狀態準確率,顯著優於既有互動影片世界模型。