PerceptionBench:評估多模態大型語言模型的原子視覺感知能力
為何重要
此基準發現多模態大型語言模型在原始視覺輸入處理層面存在嚴重缺乏,「感知導致的幻覺」往往比推理錯誤更難檢測。這對開發者意味著高層次的推理表現可能掩蓋了底層對影像關鍵細節的遺漏,迫使工程實作需要在多模態處理鍊中引入更嚴格的感知偵測機制。
- 為瞭解決既有基準測試常混淆視覺感知與推理或領域知識的缺陷,PerceptionBench 專注評估多模態大型語言模型的「原子」視覺感知能力。
- 該基準採用自下而上方法,分析 42 個既有測試的失敗點,建構出定義 10 項原子視覺感知能力的錯誤分類法則。
- 基準包含 3,000 個經驗證問題,每題僅測試單一能力,且難度主要源自感知而非推理或知識。
- 對 16 款前沿多模態大型語言模型的測試結果顯示,沒有任何一款模型達到 60% 的準確率,且感知相關的幻覺是平均表現最差的技能。