ENTRAP-VL:一種用於檢測視覺語言模型雙重情境刻板依賴的探測工具
為何重要
此研究揭示了一項關鍵的可靠性缺陷:多模態輸入可能同時操作模型輸出,造成安全與判斷的雙重幹擾。這對於依賴 VLM 構建的 AI Agent 與安全系統至關重要,因為惡意設計的覆蓋文字或疊加影像可能故意誤導模型。透過開源此測試儀器,標準化「輸入端幹擾」的檢測機制,迫使產業界重新審視模型對路徑依賴及輸入出錯的容忍度。
新興的「情境刻板依賴」現象指模型會被不相關的輔助輸入拉偏輸出,先前的研究雖以此解釋單模態語言模型,但難以直接套用於視覺語言模型。作者認為這需要針對圖文雙頻道性質設計的測試儀器,而非簡單移植既有基準。
- 提出名為 ENTRAP-VL (ENTRainment Assessment Probe for Vision and Language) 的測試探測儀,旨在作為檢驗視覺語言模型是否遭受不相關語境幹擾的專用工具。
- 資料集包含 1,500 個手動策劃的專案,涵蓋八個類別,並依據「與專案的關聯性」與「真實性」兩個軸向組織分類。
- 儀器結構區分為文本情境流(八個情境條件)與視覺情境流(三個情境條件),以獨立驗證文字與影像對模型的雙重影響範疇。
- 作者強調此工具旨在提供評估協議與資料集,而非針對特定模型進行測量,預計將公開釋出。