CalibForge:透過對抗求解器校準擴充套件可學習終端任務
為何重要
這項研究不僅是基礎理論的探索,更驗證了資料生成策略在提升 Agent 效能中的關鍵地位,而非僅依賴模型規模擴張。對開發者而言,這代表透過精準的「任務微調」與校準,或許能以較小的模型規模達成原本需要更大數據集才能達到的硬性指標。盡管不直接衝擊硬體法規或商業併購,它為 Agent 工具在軟體工程場景的落地應用提供了一個可參考的資料最佳化範例。
訓練終端機代理時,若僅確認任務的可解性並不足以確保良好的學習表現;CalibForge 是一個自主的終端機任務合成系統,運用已知的求解器行為透過「對抗性校準」來修訂候選任務,進而鎖定並擴大特定求解器設定下的「可學習區域」。
- CalibForge 採用多求解器校準與對比求解器校準兩種策略,利用求解器間的共識或分歧來重新定義任務,使其更適合模型學習。
- 研究團隊以此係統構建了 5,431 個經校準過的終端機任務,消融實驗結果顯示其監督效果優於傳統的執行驗證或單一求解器回饋。
- 在 Terminal-Bench 2.0、SWE-bench Pro 與 Doc2Repo 這三項基準測試上,使用完整資料集訓練的模型表現優於對應基準模型,最大提升幅度分別為 24.71、27.68 和 30.04 個百分點。