Temporal-Distance JEPA:具備計畫感知的隱藏世界模型預測控制
為何重要
填補了世界模型訓練與實際規劃執行之間的關鍵落差。 傳統的 latent world model 常陷入「訓練表現強,部署規劃弱」的困境。TD-JEPA 通過挖掘軌跡中的時間結構,實現了訓練目標與採用成本的協同設計。這不僅提升了機器人在 Two-Room 等複雜場景的自駕能力,更證明瞭解決長距離順序規劃問題的可行性,對未來發展具高自主性的具身智慧(Embodied AI)至關重要。
Joint-Embedding Predictive Architectures (JEPA) 選擇在表徵空間進行預測而非還原畫素,是離線示範冷啟動控制技術的理想骨幹。本文提出的 TD-JEPA 修正了傳統往復模型盲目使用歐幾裡得幾何距離進行規劃的缺陷,改為直接從無獎勵軌跡中挖掘導向性時間成本。
- TD-JEPA 保留了 LeWM 編碼器與預測器的核心架構,並引入滾動一致性專案以匹配規劃範圍。
- 在「鎖定評估」模式下,使用採礦出的成本時,Two-Room 任務的成功率達到 100.0%,優於 LeWM 的 97.4%。
- 使用共享歐幾裡得規劃在相同時序訓練檢查點,OGB-Cube 的準確率較 LeWM 提升了 14.2 個百分點,且有助於改善 Push-T。
- 在所有環境的鎖定評估中,TD-JEPA 均匹配或超越 LeWM 和 RC-aux 基準線。