代理 harness 與模型的共演化:政策修正助弱模型趕上模仿法的不足
為何重要
這項研究直擊企業 Agent 開發中常見的生態衝突,指出低階模型模擬高階模型的全軌跡在特定環境下會失效。 對開發者而言,這提供了一個「保留模型原生風格,透過區域性修正融合 harness 智慧」的技術路徑。 對投資人來說,這意味著未來的競爭可能不光是模型大小,更在於能否將業界專家知識經濟化地濃縮排工具層與調參流程中。
本研究探討 Agent harness(系統提示詞、工具集與執行環境架構)與模型權重在企業任務中的共演化策略。主要發現是,弱模型單純模仿強模型在已演化 harness 上的完整軌跡,反而會導致特定的系統崩潰。
- 在 Qwen3-Coder 與 Gemma 4 的七項企業代理任務中,此模仿訓練導致弱模型表現回退 4 到 30 分。
- 分析顯示模仿行為破壞了模型與 harness 的適配度,導致弱模型繼承了不具備執行能力的強動態規劃策略。
- 解決方案為 On-policy expert-correction pipeline,透過元級 MLE 代理僅修正失敗回合,同時保留 harness 演化與模型的本質策略風格。