RoboSPA:具身 AI 推理能力的新評估基準
為何重要
此研究直指具身 AI 落地商用的最大瓶頸:模型難以處理長程式的連貫性與精細的空間邏輯。這意味著目前開發的「具體 Agent」大多停留在概念驗證(Proof of Concept)階段,距離能處理真實世界非結構化任務仍有鴻溝。對產業而言,未來的競爭焦點將從單純的推理速度或模型規模,轉向如何提升長視覺序列的記憶與規劃能力,這將深刻影響雲端運算資源(如 GPU)在即時運算方面的應用需求。
Vision-Language-Action (VLA) 模型雖在語言條件機器人操作上展現潛力,但現有資料集與基準多侷限於預設場景與短時間跨度。研究團隊推出 RoboSPA,專注於診斷 VLA 模型在高複雜度情境下的實體感知與流程規劃能力。
- 聚焦兩大核心:Fine-Grained Spatial Reasoning(細緻空間推理)與 Long-Horizon Procedural Planning(長程式規劃)
- 涵蓋 10 個任務類別、56 個基礎任務,並設定 5 個難度等級,總共產生 280 種變體以檢驗模型極限
- 累積 527K 個軌跡資料,隨機分散於多種具身例項與場景中
- 實測結果指出現有 VLA 模型在面對複雜空間關係、精確低層執行及記憶密集型規劃時表現不夠穩健