CLBench-V:從落地到知識獲取的多模態情境學習評估標準
為何重要
單一基準分數低於 0.3 的結果揭示了多模態模型從「資訊理解」邁向「情境推理」的巨大瓶頸。對開發者而言,CLBench-V 提供了評估模型是否能處理圖表、頁面與圖片等多模態雜訊的新標竿;對產業趨勢而言,這暗示未來支出將從單純的引數堆疊轉向更複雜的檢索、聚合理論與推理架構。
現實任務常需模型從特定情境中學習,而非僅依賴預訓練知識。本篇介紹 CLBench-V 作為評估多模態情境學習的新基準,涵蓋科學、金融、長檔案等不同領域。
- CLBench-V 將任務組織為三個維度:情境落地、新資訊應用與新知識學習。
- 基準包含 3,443 個樣本,並測試了六個近期的多模態模型。
- 在所有測試模型中,最佳整體得分僅為 0.2847,顯示多模態情境學習能力遠未飽和。
- 具體表現優勢:InternVL3.5-30B-A3B 在情境落地與新知識學習表現最佳,而 Qwen3.5-Plus 則在新資訊應用表現最佳。