SyncWorld:透過視覺校準讓世界模型具備零樣本模擬器能力
為何重要
解決了機器人學的一大痛點——動作語言不通用,提升了世界模型在不同環境間遷移的能力。此技術減少對特定訓練資料的依賴,為通用機器人開發提供了彈性更高的架構思路。
世界模型在機器人領域日益重要,但不同視覺環境、相機角度或機器人設定會導致同一個數值動作的視覺表現不同,造成訓練與部署的落差。SyncWorld 提出利用視覺校準回合來指定環境特定的 Action-Visual Mapping,讓世界模型能在未見過的環境中,像零樣本模擬器一樣準確執行動作預測,並支援在測試時進行政策改善。- 將視覺校準回合(包含特定自由度的配對幀與動作)用於指定環境特定的 Action-Visual Mapping。- 訓練過程教導模型透過視覺證據解讀動作,並在缺乏明確校準時利用互動歷史。- 在先前未見的情境中準確模擬動作結果,並實現無需額外訓練的測試時政策改進。