ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

基於表徵錨定與語言-動作對齊的可泛化 VLA 培訓方法 (Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment)

研究 1 個來源 · 14 天前
為何重要

行為克隆導致表徵崩解是落地機器人控制的核心痛點。Anchor-Align 提出一條新途徑:利用凍結模型作為訓練槓桿,讓通用的視覺理解能力成為特定操作任務的基底。這對積極佈局具身智慧的開發者而言,提供了一條可簡化訓練 pipeline、提升模型泛化邏輯的主流派方法論;對業界而言,這意味著訓練長輩模型 不再需要犧牲掉模型的通用性。

  • 透過 Vision-Language Anchoring 與 Language-Action Alignment,解決行為克隆覆寫預訓練表徵、語言與動作不對齊的問題。
  • 在實體 xArm7 機器人上,兩種常見 VLA 架構的實機成功率依序從 28% 提升至 54%、37% 提升至 60%。
  • 模擬測試涵蓋 LIBERO-PRO、LIBERO-Plus 與 CALVIN,在各類 OOD 幹擾、感知韌性與長週期控制中展現一致的效能增進。
Anchor-AlignVLABehavior CloningRoboticsxArm7

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00