消除座標錯誤:無區域標籤的視覺檔案理解證據歸因研究
為何重要
視覺檔案分析系統常面臨「黑盒」問題,即模型能給出答案卻無法證明依據。本研究證明,只要將模型輸出轉化為文字引用並利用佈局解析進行對應,便能大幅減少定位錯誤與無中生有的現象。更重要的是,這提供了一條不依賴昂貴區域標註的訓練路徑,是未來 RAG(檢索增強生成)與具備可解釋性 Agent 場景的重要技術接駁。
視覺檔案理解需要模型歸屬答案至證據區域,但傳統的座標介面常導致歸因幻覺。一項研究比較座標介面與透過語言直接引用並讓檢索器定位相關區域的語言介面,發現前者在六個開源模型上表現較差。
- 將介面改為「語言 + 多模態檢索」,CiteVQA 子集的證據召回率從最高 8 點提升至 26–47 點,幻覺率大約減半。
- 即使不使用區域標籤,透過 GRPO 食譜訓練模型的語言引用能力,仍能讓 8B 基礎模型的「嚴格歸屬精度」從 22.4% 提升至 33.8%。