PARSER:並行閱讀與深度推理的長語境 LLM Agent 架構
為何重要
- 這是解決長語境 LLM agents 效能瓶頸的關鍵架構突破,證明透過解耦閱讀與推理、匯入 reinforcement learning,可在低規格 backbone 下優於高規模現有大模型。 - 對產業意義:提供了一條低成本的長文件處理路徑(非擴大模型引數,而是最佳化 Agent 架構),顯示可落實於開發 Agent 應用的技術路線。 - 值得關注:RL 在複雜推理鏈中的應用價值正在興起,PARSER 展示了其「教會 Agent 思考」而非僅僅「餵給資料」的潛力。
- 發生什麼:傳統 Sequential memory agents 在處理長文件時,閱讀與推理深度耦合,導致證據放置敏感且延遲隨檔案長度增加。PARSER 透過解耦設計,讓 subagents 平行讀取文件,lead agent 則進行深度推理。
- 架構最佳化:PARSER 集中所有可學習行為在 lead agent 上,使用 reinforcement learning 進行最佳化,subagents 則保持為 frozen off-the-shelf models。
- 效能與資料:在 7K 至 896K tokens 的 Multi-hop QA 測試中,4B backbone 在 896K tokens 上比最佳 sequential baseline 優 12.0 分;9B backbone 則跑贏 DeepSeek-V4-Pro 6.3 分。
- 效益:推理延遲最高可減少 11x,並對證據位置、順序與距離的擾動具魯棒性。