Harness-G:用於搜尋代理的圖結構抓取框架
為何重要
該研究直擊 RL 搜尋代理在實務訓練中常因檢索重疊而陷入區域性解的缺點,提出了一個工程上更穩健且可解釋的介面重構方案。對產業價值而言,這意味著強化學習式檢索服務有望從隨機探索轉向結構化高效利用證據。技術團隊可藉此改進現有 Search-R1 或類似推理模型的檢索階段。
現有強化學習搜尋代理在抽取證據時常遇到「檢索等價坍縮」的問題,導致不同查詢最終落入相似的證據集合。本研究提出圖結構的 Harness-G 框架,將自由形式查詢重構為有限動作選擇。在六個 QA 基準測試中,Harness-G 在 1.5B 和 3B 級模型規模下,平均 F1 均優於最強基準 Graph-R1。
- 將檢索介面從自由形式查詢重構為有限動作選擇(選取證據句子、實體或回答),由環境管理狀態。
- 引入結構化非短視信用機制,利用凍結的答案評分器比較替代方案並歸因收益。
- 與 Graph-R1 比較,在 1.5B 模型規模下 F1 高出 10.74 點,在 3B 規模下高出 3.98 點。