軟體工程 Agent 的類別感知專家訓練與聚合框架
為何重要
該研究證明瞭在處理複雜且異質的軟體工程任務時,「分類感知的專家訓練與聚合」策略能帶來顯著的效能指標提升。這對於開發者來說提供了從單體模型訓練邁向模組化、可插拔 Agent 系統的技術路徑,可能改變未來 AI Coding Agent 的技術架構與市場評價標準。
為解決統一強化學習在多元軟體工程任務中難以兼顧所有類別進展的問題,研究團隊提出「類別感知專家訓練與政策整合框架」。該框架使用 SWE Labeler 組織訓練資料,並透過 Refresh-Repair-Expand (RRE) 迭代更迭專家進行長期回溯訓練。最終的 MOPD 模型在 Pro-618 平均解析度達到 58.04%,在 SWE-bench Multilingual 平均解析度達到 59.00%,較基礎模型分別提升 5.39% 與 2.78%。