ModaLens:測量醫療影像 VLM 敏感度的審計工具
為何重要
這項研究揭示了醫療 AI 評估中的「報告洩漏」風險:若模型主要依賴文字而非視覺資料,現有的 binary performance 可能產生誤判。這推動了評估生態從單純的 accuracy 測試,轉向需要「灰盒審計」來驗證模型是否真正具備視覺推理能力。對開發者而言,這類工具成為強化 RAG(檢索增強生成)系統可信度的必要性。
- 為瞭解決醫療影像 VLM 可能過度依賴文字報告而非實際影像的問題,研究者提出 ModaLens 審計框架。
- 實驗使用 MedGemma-27B 在來自 293 位病人的 3,199 組 MIMIC-CXR 成對案例上進行測試,每個案例包含 14 道問題。
- 當報告不可得時,模型在影像被替換任務上的回答改變率高達 20.94%,顯著高於報告可得時的 4.26%,這表明報告可用性會大幅抑制模型對影像的敏感度。
- 研究發現即使二元預測未改變,影像替換仍會干擾模型的連續答案評分空間。