BM25 在大規模下獲勝:RAG 模式的大規模擴充套件研究
為何重要
此研究對開發者與架構決策者而言,證明瞭在 RAG 應用中不能盲目依賴複雜的代理或圖形檢索架構,簡單高效的詞法檢索在處理大規模資料時擁有更高的價效比與穩定性。 對於產業而言,這意味著學術界與業界在追逐最新 RAG 技術時,應回到基礎模型的語意分析能力,而非僅在檢索層進行不可擴充套件的堆砌。 投資人應注意,未來競爭重點將在於「高效率檢索」的最佳化,而非單純依賴昂貴的 LLM 推理層。
許多檢索增強生成(RAG)的模式(詞法、密集、圖形、代理)在不同資料規模下的實際效能研究不足。本研究透過 28 個層級、約 450 倍規模的語料庫測試,實驗發現從基礎規模擴大時,不同 RAG 模式會出現效能交叉點而非永久領先。
具體結果如下:
- 在 bedrock 層級上,應用順序探索的 File-System Agent 模式代幣成本比 BM25 高出 39 倍,且隨搜尋空間擴大效能遞減。
- 當 corpus 代幣約達 1,000 萬時,BM25 追上並超越 File-System Agent,在更大規模層級全面領先,落後幅度近 20 分。
- 純分詞檢索(BM25)在不使用 LLM 構建的狀態下,仍位於低成本帕累託曲線的優勢區域。圖形 RAG 則因建構與部署瓶頸,效能始終低於 BM25。