WorldCycle:用於長期影片世界模型的自我驗證式強化學習框架
為何重要
這項技術解決了世界模型在長期規劃與模擬中,「錯誤累積無法被監督修正」的根本難題。透過物理定律(迴圈回歸)作為內建的訊號來源,世界模型能更精確地學習狀態轉換的性質,而非僅是學會一條特定路徑。這為未來的機器人控制、複雜場景模擬等應用奠定了更穩固的基礎,也推動了評估世界模型能力的新指標。
針對長期影片世界模型在強化學習中面臨的驗證瓶頸,論文提出「WorldCycle」框架,利用可逆行動迴圈的物理特性來實現無標註監督。
- WorldCycle 從普通行動序列構造封閉迴圈並重複執行,讓理論上必須回到初始狀態的物理特性成為驗證依據,解決了「不知真實未來狀態」的難題。
- 框架引入了空間封閉獎勵與時間一致性獎勵兩種機制,強迫模型將行動學習為狀態運運算元而非模式記憶。
- 透過新建的診斷基準「CycleBench」,研究顯示 WorldCycle 將狀態歸還漂移降低了 44%,並將複合行動準確率提升 4x。