VA-Bench:透過視覺演示、主動感知與度量控制測量具身空間智慧
為何重要
VABench 強化了具身 AI 領域讀者對通用多模態模型侷限性的認知:即便在視覺理解上表現良好,MLLMs 在處理長視野規劃、環境遷移及「感知-行動」閉環時,仍面臨極高技術壁壘。這項研究為評估未來機器人商業化落地所需的通用推理能力提供了嚴謹基準。
空間智慧要求機器在不完整觀察下識別缺失證據、解讀共同空間框架並採取行動。研究團隊推出 VA-Bench 以評估從觀察、推理到行動修正的完整迴圈,測試通用 MLLMs 是否能將視覺演示與主動感知轉化為成功的具身行動。
- 資料集包含 14 種基礎任務家族(11 單臂、3 雙臂)、7 種保留的幾何/佈局變體及長視野 5 物件組成軌跡。
- 在標註執行結果中,最佳模型在目標定位上得分 100.0%,空間關係得分 78.9%;三次執行的宏觀平均任務成功率僅為 53.93% +/- 3.17%。
- 實驗顯示,啟用主動相機控制能將任務成功率從被動多視角的 27.86% 提升至 57.50%,而僅保留的幾何遷移會導致成功率下降超過 30 個百分點。