ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Tri-PvP:透過感知與命題證據衝突揭露全模態大語言模型的模態偏見

研究 1 個來源 · 55 分鐘前
為何重要

這項研究直指當前多模態 AI 開發中常被低估的「認知決策偏差」問題。既然模型在視覺上傾向相信「眼見為憑」(感知訊號),但在聲音上卻更傾向依賴「文字敘述」(命題訊號),這意味著在金融交易、醫療看診或自動導航等依賴多感測器融合的場景中,系統可能會做出矛盾的判斷。這提醒開發者和技術決策者,未來的微調策略不能只看通用的 SFT 資料,必須針對不同模態的信賴機制進行差異化對齊。

現有的全模態大語言模型 會協同處理視覺、聲音和文字,但在遭遇跨模態衝突時,其對模態偏見的理解仍不充分。目前的評估基準混淆了同一模態內的「感知訊號」(如照片錄音)與「命題訊號」(如描述性陳述),導致偏見成因無法精準歸因。研究人員推出 Tri-PvP 基準,旨在釐清證據形式與模態本身的偏見差異。

  • 研究提出了 Tri-PvP 基準,包含 8,000 個樣本,模擬跨越視覺、聲音和文字的三模態衝突,並允許其中兩種模態呈現感知或命題形式。
  • 對 5 個 OLM 的評估發現,大多數模型在大多數條件下仍存在強大的視覺偏見,表明簡單的架構調整無法根本解決。
  • 發現兩種證據形式的模態偏見存在系統性不對稱:模型在視覺任務偏好感知訊號,在聲音任務卻偏好命題訊號。
  • 透過逐層線性探測分析顯示,模態偏見在早期的表示層就已可被線性解碼,且僅能部分被緩解。
Tri-PvPOLLM模態偏見Benchmark多模態 AI

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00