ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

時序推理框架 ChronoVision:透過隱含狀態重建加強視覺邏輯

研究 1 個來源 · 6 小時前
為何重要

ChronoVision 針對目前 MLLM 在視覺語意理解上的瓶頸(時序連續性不足)提出了一套較為完整的解決方案,結合監督學習與強化學習的多階段訓練策略,為未來開發具備複雜視覺推理能力的 Agent 提供了新的技術架構參考。對開發者而言,這代表多模態模型正在從單一感知邁向「動態過程」與「邏輯排序」的進階階段。

現有的多模態大型語言模型(MLLM)在處理需要多步驟時序推理的視覺任務時經常表現不佳,主要因為語言推理難以精確描述連續的視覺變化;為瞭解決這個問題,研究者提出了 ChronoVision 框架,旨在讓視覺邏輯與隱含的影像表示對齊。

  • 框架核心包含「Reconstructive Visual Head」與「ROI Attention Locating」模組,前者在監督微調階段預測最終轉換狀態的隱含表示,後者則透過語義範疇查詢將注意力聚焦於關鍵視覺證據。
  • 採用帶有隱含過程基準機制的強化學習進行後訓練,並使用複合獎勵函式來評估結果正確性、隱含過程對齊度與無監督視覺聚焦效果。
  • 新構建 Vbvr-VQA 資料集,將影片推理嚴格轉化為影像排序任務以進行時序追蹤評估。
  • 實驗顯示 ChronoVision 在 Vbvr-VQA 基準上達到 SOTA,領域內外準確率分別為 74.8% 和 71.6%,並在跨領域挑戰性基準 IntPhys2 上取得 55.0% 的準確率。
ChronoVisionTemporal ReasoningMultimodal ModelsReinforcement LearningComputer Vision

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00