INTACT:免搜尋世界模型的同構行為意圖學習架構
為何重要
INTACT 代表了世界模型從「預測性模擬」邁向「即時控制」關鍵一步的技術突破。透過架構層面直接對映「意圖至行為」,大幅降低了推理延遲,這對依賴低延遲回應的 Agent 開發至關重要。 此方法證明瞭跳過複雜的全域性動力學或逐點潛在匹配的可能性,顯著縮短了訓練週期並提高了效率。對產業而言,這種能在極短延遲下提供穩定性策略的能力,將為未來的機器人互動與實體世界控制系統提供更可行的技術路徑。
INTACT 是一種基於 JEPA 的端到端「意圖至行為」學習技術,用於解決傳統潛在世界模型在恢復特定行為時需付出高昂測試搜尋成本的問題。該架構透過與動作法律則語義相關聯的變數,將行為標註軌跡轉化為可部署介面。
- 在四項官方 LeWM 任務中,單一時期且「零搜尋」的模型分別達到 85.78%、100.00%、97.67% 與 97.89% 的成功率。
- 區域性 CEM 策略可將候選序列數量從 9,000 縮減至 384,減少 23.44 倍取樣量,同時提升 macro success 16.00 點。
- 單一共享四任務編碼器可達到 89.39% E5 Direct macro,且 Direct inference 推斷延遲僅需 2.9--5.5 ms。