SpatialCLI:學習如何使用空間工具,隨後丟棄工具
為何重要
這項技術突破了大型模型對高階能力(精確空間推理)的獨佔地位,證明透過「工具鏈 + 內化遷移」的訓練範式,中小型模型同樣能追上乃至擊敗頂級模型,顯著降低了具身智慧體的成本門檻;此外,模型最終能將工具能力「內化」的特性,解決了實地部署中依賴外部運算資源的反向工程難題,對 Agent 與具身 AI 的本地化落地具有重要參考價值。
針對通用 Vision-language models (VLMs) 在物理空間推理中「看得全卻不懂細節」以及專用模型「有細節卻缺決策能力」的矛盾,研究團隊推出 SpatialCLI 框架,採用三階段訓練策略,讓型號先學習透過工具擴充感知,再將其能力內化至模型內部。
- SpatialCLI 的三個階段分別為:藉由工具擴充感知、以冷啟動 SFT 與 agentic RL 最佳化工器具使用,以及將成功軌跡內化為模型能力。
- 新建 SpatialCLI-Bench 包含 516 個組合感知範例,涵蓋定位、分割、深度與姿態。
- 在 MindCube 測試中,普及版 Qwen3-VL-8B-Instruct 接入工具後準確率從 29.3% 升至 84.6%,超越使用工具的 GPT-5.6 Sol(72.1%);抑制工具使用後,該模型仍保留 73.8% 的能力。