重新思考多模態自動事實查核的評估方法:動態評估集的汙染風險與影響
為何重要
這項研究扼要地揭露評估環境本身的盲點,暗示許多主流模型的效能排名可能因資料集汙染而失真,迫使開發者在佈署自動事實查核系統時,必須優先建立嚴謹的除汙評估流程,不可僅依賴所謂的「動態」資料集。 對開發者而言,這是建立可信評估標準時不可迴避的關鍵警示。
多模態自動事實查核旨在透過外部證據驗證主張,但許多現有靜態評估集因模型偏好使用內部知識而存在「汙染」風險,導致效能估計失真。本研究重新檢視了 SOTA 靜態 benchmark AVeriTeC 與新建的動態基準 ClaimReview2025Q4,發現動態評估並非全然無汙染。
- 實證顯示動態評估僅能降低風險,仍有 17.09% 至 29.30% 的截斷後新主張具有潛在汙染。
- MAFC 系統在汙染情況下,宏平均準確率 可能增加高達 11.34 分,且會嚴重扭曲系統排名。
- 研究團隊在嚴格控管的環境下重新檢驗了 SOTA LLM 的效能,並提供可信 MAFC 評估的實務指南。