Trace:導向分類法的多領域視覺推理強化學習環境
為何重要
這項研究填補了視覺語言模型應用 RLVR 的資料缺口,具體量化證實了即使使用 3B / 7B 等小引數規模模型,也能透過程式化環境訓練顯著提升推理能力,降低了對頂級超大模型依賴。對於開發者而言,這首次提供了符合研究級標準的公開視覺推理驗證環境,能加速多模態應用的邏輯檢測與最佳化。
針對語言模型推論透過 RLVR 提升的趨勢,視覺語言模型長期缺乏廣泛且可驗證的訓練資料。研究團隊推出 Trace,將任務構建分為場景語法與可執行程式,解決視覺實現與答案計算的耦合問題。
- 環境包含 1,000 個任務,涵蓋 277 種場景語法 與 11 個視覺領域,透過共享語義狀態實現受控的語義與視覺變化。
- 在 64,000 個範例 上執行 RLVR 訓練後,Qwen2.5-VL-3B 與 Qwen2.5-VL-7B 在 24 個外部基準 的平均分數分別提升 3.51 點與 4.06 點。
- 證明瞭廣泛的程式模仿訓練具有跨任務分佈的泛化能力。