ActionPiece:重塑視覺語言動作模型的自迴歸行動 Token 化機制
為何重要
過去評估 VLA 模型往往只關注單點精度,卻忽略了動作調整間的物理關係脈絡。ActionPiece 引入的物理排序一致性(PRC)為機械人控制提供了一種評估動作精緻度的關鍵新指標,這有助於縮小從模擬環境到真實機器人執行的落差,是 Robot-X 護城河形成過程中的關鍵技術支撐。
在視覺語言動作模型中,行動 token 化直接影響機器人策略訓練的目標與指令執行效果。為解決傳統均方誤差無法捕捉動作間物理關聯的問題,研究提出 ActionPiece 透過物理排序一致性來衡量還原後的效能。
- ActionPiece 透過聯合監督表示學習與量化,強制編碼器及量化特徵維持近鄰與遠距的相對排序。
- 在 Qwen3-VL-4B 的訓練設定下,該方法於 LIBERO 資料集上達成 94.8% 的成功率。
- 包含未見過的 LIBERO-Plus (68.8%)、SimplerEnv (71.9%) 以及 VLA-Arena L0-L2 (51.5%) 的跨環境評測皆顯示出方法的有效性。