RRSI:代理框架的規範化遞迴自我提升
為何重要
隨著 LLM 應用邁向智慧體時代,如何自動且穩健地最佳化 Harness 成為決定性障礙。RRSI 這項研究針對「自我改進過擬合」的行為模式提出了具體的規範化解決方案,不僅提升了泛化能力,更直接改善了資源效率。 對於產業與開發者而言,這驗證了透過最佳化系統層級配置(如提示詞工程與工具排程)來逼近或超越基礎模型權重改進的可行性,這為降低智慧體的運算成本和提升應用健壯性提供了一條可落地的技術路徑。
- LLM 智慧體的能力深受其 Harness(提示詞、工具、記憶管理等)影響,現有自動化遞迴改進方法容易因過擬合特定訓練任務,導致在分佈外基準(OoD)測試中表現退化。
- Google Research 釋出 RRSI(Regularized Recursive Self-Improvement)演算法,利用提議者(proposer)和包含評論員(critic)與剪枝器(pruner)的選擇器來約束候選變更,強制優化出可重用的機制而非死記硬背特定任務。
- 在涵蓋程式設計、代理工作空間和工程設計的 8 個基準測試中,RRSI 相較於標準演化方法,在目標集合上提升高達 14.1 分,在 5 個分佈外基準上提升 4.7 分,並將策略代令使用量減少了 30%。