ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

CLBench-V:從落地到知識獲取的多模態情境學習評估標準

研究 1 個來源 · 7 天前
為何重要

單一基準分數低於 0.3 的結果揭示了多模態模型從「資訊理解」邁向「情境推理」的巨大瓶頸。對開發者而言,CLBench-V 提供了評估模型是否能處理圖表、頁面與圖片等多模態雜訊的新標竿;對產業趨勢而言,這暗示未來支出將從單純的引數堆疊轉向更複雜的檢索、聚合理論與推理架構。

現實任務常需模型從特定情境中學習,而非僅依賴預訓練知識。本篇介紹 CLBench-V 作為評估多模態情境學習的新基準,涵蓋科學、金融、長檔案等不同領域。

  • CLBench-V 將任務組織為三個維度:情境落地、新資訊應用與新知識學習。
  • 基準包含 3,443 個樣本,並測試了六個近期的多模態模型。
  • 在所有測試模型中,最佳整體得分僅為 0.2847,顯示多模態情境學習能力遠未飽和。
  • 具體表現優勢:InternVL3.5-30B-A3B 在情境落地與新知識學習表現最佳,而 Qwen3.5-Plus 則在新資訊應用表現最佳。
CLBench-VInternVL3.5-30B-A3BQwen3.5-Plus多模態情境學習Benchmark

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00