ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

ActionPiece:重塑視覺語言動作模型的自迴歸行動 Token 化機制

研究 1 個來源 · 6 天前
為何重要

過去評估 VLA 模型往往只關注單點精度,卻忽略了動作調整間的物理關係脈絡。ActionPiece 引入的物理排序一致性(PRC)為機械人控制提供了一種評估動作精緻度的關鍵新指標,這有助於縮小從模擬環境到真實機器人執行的落差,是 Robot-X 護城河形成過程中的關鍵技術支撐。

在視覺語言動作模型中,行動 token 化直接影響機器人策略訓練的目標與指令執行效果。為解決傳統均方誤差無法捕捉動作間物理關聯的問題,研究提出 ActionPiece 透過物理排序一致性來衡量還原後的效能。

  • ActionPiece 透過聯合監督表示學習與量化,強制編碼器及量化特徵維持近鄰與遠距的相對排序。
  • 在 Qwen3-VL-4B 的訓練設定下,該方法於 LIBERO 資料集上達成 94.8% 的成功率。
  • 包含未見過的 LIBERO-Plus (68.8%)、SimplerEnv (71.9%) 以及 VLA-Arena L0-L2 (51.5%) 的跨環境評測皆顯示出方法的有效性。
ActionPieceVLA ModelsVision-Language-ActionRobotic ControlQwen3-VLTokenization

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00