ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

個人化海市蜃樓:LLM 如何捏造使用者檔案,以及為何自我監測誤導

研究 1 個來源 · 13 小時前
為何重要

重新定義了個人化 AI 技術的底線,證實了所有大型語言模型在使用者記憶場景下都存在系統性的「捏造」風險,這對依賴精準檔案的 Agent 與客服系統而言是結構性的技術障礙。開發者原已習慣的「自我監控」機制在本研究中被證實不可靠,未來系統架構必須匯入獨立的仲裁機制與外部驗證流程,以確保多輪對話中使用者資訊的整合不會產生偏誤。

隨著具備持久記憶的個人化 LLM 逐漸普及,學者提出 Over-Inference (OI) 現象,即模型會捏造超過證據支援的使用者屬性,並發布 MirageBench 基準測試進行量化分析。

  • 12 個評測模型平均有 41.6% 的宣告出現 Over-Inference,範圍落在 35%–49%,沒有任何模型能完全逃脫此現象。
  • 模型自我監測評估與客觀判定呈現 負相關 (rho = -0.60, p = 0.044),模型自我報告的信心愈低,實際上被判定為捏造的內容反而愈高。
  • OI 比率具備任務依賴性 (27%–59%),且在多輪對話的 pilot 測試中,推論出的屬性會大致線性累積,鮮少修正。
MirageBenchOver-InferencePersonalizationLLMBenchmarkHallucination

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00