ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

SpatialCLI:學習如何使用空間工具,隨後丟棄工具

模型 1 個來源 · 6 天前
為何重要

這項技術突破了大型模型對高階能力(精確空間推理)的獨佔地位,證明透過「工具鏈 + 內化遷移」的訓練範式,中小型模型同樣能追上乃至擊敗頂級模型,顯著降低了具身智慧體的成本門檻;此外,模型最終能將工具能力「內化」的特性,解決了實地部署中依賴外部運算資源的反向工程難題,對 Agent 與具身 AI 的本地化落地具有重要參考價值。

針對通用 Vision-language models (VLMs) 在物理空間推理中「看得全卻不懂細節」以及專用模型「有細節卻缺決策能力」的矛盾,研究團隊推出 SpatialCLI 框架,採用三階段訓練策略,讓型號先學習透過工具擴充感知,再將其能力內化至模型內部。

  • SpatialCLI 的三個階段分別為:藉由工具擴充感知、以冷啟動 SFT 與 agentic RL 最佳化工器具使用,以及將成功軌跡內化為模型能力。
  • 新建 SpatialCLI-Bench 包含 516 個組合感知範例,涵蓋定位、分割、深度與姿態。
  • 在 MindCube 測試中,普及版 Qwen3-VL-8B-Instruct 接入工具後準確率從 29.3% 升至 84.6%,超越使用工具的 GPT-5.6 Sol(72.1%);抑制工具使用後,該模型仍保留 73.8% 的能力。
SpatialCLIVision-Language ModelsVLMTool UseEmbodied AIQwen3-VL

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00