ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Trace:導向分類法的多領域視覺推理強化學習環境

研究 1 個來源 · 14 天前
為何重要

這項研究填補了視覺語言模型應用 RLVR 的資料缺口,具體量化證實了即使使用 3B / 7B 等小引數規模模型,也能透過程式化環境訓練顯著提升推理能力,降低了對頂級超大模型依賴。對於開發者而言,這首次提供了符合研究級標準的公開視覺推理驗證環境,能加速多模態應用的邏輯檢測與最佳化。

針對語言模型推論透過 RLVR 提升的趨勢,視覺語言模型長期缺乏廣泛且可驗證的訓練資料。研究團隊推出 Trace,將任務構建分為場景語法與可執行程式,解決視覺實現與答案計算的耦合問題。

  • 環境包含 1,000 個任務,涵蓋 277 種場景語法11 個視覺領域,透過共享語義狀態實現受控的語義與視覺變化。
  • 64,000 個範例 上執行 RLVR 訓練後,Qwen2.5-VL-3BQwen2.5-VL-7B24 個外部基準 的平均分數分別提升 3.51 點與 4.06 點。
  • 證明瞭廣泛的程式模仿訓練具有跨任務分佈的泛化能力。
TraceRLVRVisual ReasoningQwen2.5-VLTaxonomy-Guided

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00