看見還是知道?大型多模態語言模型的視覺情境敏感度
為何重要
本研究精準定位了 MLLMs 的技術瓶頸:模型雖然能編碼視覺資訊,卻缺乏對何時該依賴視覺、何時該依賴先驗知識的穩定控制力。對開發者而言,若要強化模型在閱讀影像時嚴格區分「影像事實」與「文字知識」,除了微調,利用向量操控可能是更精簡的解方。對投資人來說,這意味著純粹的模型體量競賽之外,若能掌握「向量路徑」或微調技巧,將是提升模型可靠性與應用落地(如醫療、法務等依賴嚴謹證據的場景)的關鍵差異。
大型多模態語言模型 往往整合視覺輸入與語言先驗,但在視覺證據與預訓練知識衝突時常表現不佳。研究人員開發 *WhatIfVis* 基準測試並透過兩個診斷範式,分析出模型慣用語言先驗的取捨機制,真正障礙其表現的其在感知後的資訊運用。- 開發了 *WhatIfVis* 基準測試,涵蓋「時空關係」、「顏色」、「數量」、「尺寸」與「重量」5 個粗粒度維度。- 發現 MLLMs 在最終層影像 Token 中依然保留了粗粒度視覺證據,問題源於事後的「後感知」利用而非感知階段本身。- 通過監督微調 和學習向量皆能提升模型對視覺情境的穩定控制能力,且此效果具有跨領域的泛化性。