超越相關性為中心的檢索:以評分準則為導向的檔案集選擇與排序
為何重要
這項研究標誌著 RAG(檢索增強生成)技術評估從「單一檔案相關性」向「整體檔案集品質」的重大思維轉變。AI Agent 需要的是判斷力而非淵博,能篩選出互補且低冗餘的檔案集是提升決策品質的核心。對開發者而言,這代表未來 RAG 系統的重訓點將更傾向於解決檔案間的衝突與協調問題;對產業而言,這項基準測試的定稿有助於縮短 AI Agent 技術落實的試錯週期。
隨著大型語言模型與 AI Agents 接管搜尋結果的消費者角色,檔案集的整體品質已成為決定下游生成能力的關鍵瓶頸。研究團隊提出一套完整的「評估-診斷-最佳化」框架,並設計 SetwiseEvalKit 來系統化地評量檔案集的品質,克服了傳統評估忽略檔案互動(冗餘、衝突、互補)的問題。
- SetwiseEvalKit 是一個涵蓋約 28K 條高品質評分準則的三層九維度基準,專門針對短形式與長形式場景設計。
- 研究對 12 個重排序器的測試結果顯示,即使是最優秀的方法,其覆蓋率上限也僅為約 45%,且跨檔案協調能力普遍薄弱。
- 提出的 Rubric4Setwise 方法屬於無需訓練的架構,能將評分準則轉化為檔案集選擇訊號,是目前唯一在兩種場景下均維持頂尖效果的解法。