ABSeeker:透過「回溯式信用分配」訓練長歷程搜尋代理
為何重要
這項技術解決了長軌跡深度搜尋代理的核心難題:當最終答案不正確時,傳統監督或強化學習無法反向解析出哪個步驟失效。透過將最終結果的稀疏信用分配到每一步驟,ABSeeker 證明瞭最佳化的訓練策略能讓輕量級模型(4B)發揮出接近重型模型(30B)的複雜搜尋能力,這對於希望降低運算成本、提升 Agent 部署效率的開發者與企業具有實質參考價值。
長距離搜尋代理在執行多步驟任務時,常因缺乏微細的監督訊號而難以區分哪些步驟有效。本文提出「回溯式信用分配(ABC)」框架,透過答案倒推尋找回關鍵線索,將稀疏的最終結果轉為密集的步驟監督。
- 方法論:包含「答案回溯式線索恢復」與「線索錨定步驟評分」,將稀疏軌跡結果轉為密集步驟獎勵。
- 模型設定:基於 Qwen3.5-4B 訓練 ABSeeker,僅使用 8.5k 範本。
- 效能表現:在 BrowseComp 上達到 37.3%,受控上下文後提升至 55.3%;BrowseComp-ZH 分別為 39.1% 與 52.9%。
- 競爭優勢:表現超越同等規模模型,並逼近 30B 量級模型的效能。