AutoIndex:將檔案表徵學習視為可最佳化的執行程式
為何重要
此技術顛覆了傳統資訊檢索(IR)中將索引視為固定預處理的慣例,對 RAG(檢索增強生成)系統的架構師而言,提供了一種新穎的效能最佳化途徑。對於開發者,這意味著未來針對特定領域(如法律或研報)的檢索效能提升,可能不再依賴人工調整權重,而是依賴獨特檔案邏輯的自動化程式生成。從產業競爭角度來看,這類「自動化索引編譯工具」若商品化,將成為下一輪搜尋與 RAG 架構選型的關鍵依據。
AutoIndex 是一個框架,主張將檔案表徵的產生視為可執行的轉換程式,而非檢索開始前的預先設定步驟。
- 該框架透過驗證引導的程式搜尋,自動對檔案進行切片、豐富、正規化、重新加權或重新組織,以對映至最終的檢索表徵。
- 在固定 BM25 為檢索基底、包含 8 種異質任務的 CRUMB 基準上,該程式於所有任務中皆優於靜態全檔案基線,平均 Recall@100 提升 8.4%,nDCG@10 提升 8.3%。
- 針對特定任務,Recall@100 最大可提升 30.5%,nDCG@10 最大可提升 43.6%,證明檔案表徵應作為明確的最佳化目標。