ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

利用布林檢索最佳化深度研究代理人:搜尋、檢視、擷取

研究 1 個來源 · 14 小時前
為何重要

對於正在嘗試降低 Agent 成本與提高資訊可靠度的開發者來說,這項研究證明瞭傳統資訊檢索技術(布林查詢 BQL)結合結構化文件分析,能有效解決大型語言模型 在長上下文推理中的 Token 燒錢問題與雜訊幹擾。這顯示未來 Agent 的研發重心將從單純加強模型能力,轉向最佳化外部資訊檢索與擷取的效率。

現有深度研究代理人忽視網站結構(如標題與屬性),採用貪婪讀取整頁的「搜尋-造訪」工作流程。研究介紹名為 SIEVE 的介面,利用欄位化布林檢索 目標檔案欄位並僅擷取相關章節。

  • SIEVE 的運作機制包含候選檔案過濾、排序、呈現包含結構資訊的結果卡片,以及針對所選區塊的精細擷取。
  • 在三個 QA 資料集上,SIEVE 的準確度高於最精確的傳統「搜尋-造訪」設定。
  • SIEVE 減少了 20.7% 至 50.6% 的 token 使用量,同時保持與其他檢索器一樣的準確度。
SIEVEBoolean Retrieval (BQL)Deep-Research AgentsHugging Face Daily PapersInformation Retrieval

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00