個人化海市蜃樓:LLM 如何捏造使用者檔案,以及為何自我監測誤導
為何重要
重新定義了個人化 AI 技術的底線,證實了所有大型語言模型在使用者記憶場景下都存在系統性的「捏造」風險,這對依賴精準檔案的 Agent 與客服系統而言是結構性的技術障礙。開發者原已習慣的「自我監控」機制在本研究中被證實不可靠,未來系統架構必須匯入獨立的仲裁機制與外部驗證流程,以確保多輪對話中使用者資訊的整合不會產生偏誤。
隨著具備持久記憶的個人化 LLM 逐漸普及,學者提出 Over-Inference (OI) 現象,即模型會捏造超過證據支援的使用者屬性,並發布 MirageBench 基準測試進行量化分析。
- 12 個評測模型平均有 41.6% 的宣告出現 Over-Inference,範圍落在 35%–49%,沒有任何模型能完全逃脫此現象。
- 模型自我監測評估與客觀判定呈現 負相關 (rho = -0.60, p = 0.044),模型自我報告的信心愈低,實際上被判定為捏造的內容反而愈高。
- OI 比率具備任務依賴性 (27%–59%),且在多輪對話的 pilot 測試中,推論出的屬性會大致線性累積,鮮少修正。