Keep It InMind:檢測代理記憶中的隱性聯想盲點
為何重要
此研究揭露了目前 RAG(檢索增強生成)架構中「檢索」論點的致命缺陷——高召回率不代表高可用率。開發者將被迫重新思考 Agent 記憶設計,放棄對多餘資料無限擴充套件的依賴,轉而追求在當前視窗中保留最關鍵語境的精準路由演算法;對投資人而言,這確認了在 Agent 領域,資訊決策演算法比海量資料儲存更具估值潛力。
現有長期記憶系統假設記憶資訊能透過模糊匹配被檢索出來,但由於世界知識與查詢脈絡的斷裂,導致關鍵資訊往往無法被喚起。研究提出 InMind 基準,驗證了當前系統在這方面的嚴重失效。
- 基準規格:InMind 包含 125 個任務,涵蓋 10 個生活領域,其中 113 個任務有公開可引用來源支援,並透過配對控制區分資料未被儲存、缺乏橋接知識或儲存但未顯現等三種失敗原因。
- 效能差距:在記憶可見於上下文時,其他模型回答間接查詢的成功率高達 84.0%;反之,五種向量、圖形及代理記憶系統在嘗試檢索時,成功上限僅 14.4%,即使這些系統背書認為能 100% 檢索到事實。
- 技術診斷:將嵌入維度擴增八倍僅略微改善召回率,而當在問答前讓記憶「可見」時,效能恢復,顯示問題在於查詢條件介面的路由決策,而非向量表示不足。