OpenForgeRL:在任何環境中訓練 Harness 原生代理的開源框架
為何重要
此框架打破了大企業封閉 API 對代理研發的繫結,讓開源社群能夠直接在真實 Harness(如 Codex、OpenClaw)環境中最佳化模型。這對需要複雜工具呼叫與多步驟推理的企業開發者而言,提供了一條跳過閘道器限制的可行路徑,可能改變未來 AI Agent 開發的工具鏈生態,降低高階代理的開發門檻。
針對現代理訓練中難以用開放式基礎設施端到端訓練的複雜 Harness(如 Claude Code、Codex)問題,OpenForgeRL 提供了一套解決方案。該框架透過輕量級代理與 Kubernetes 指揮器解耦訓練與推理,讓研究人員能在多樣環境與 Harness 中擴大規模訓練代理。
- 攜帶輕量級 Proxy 與 Kubernetes Orchestrator,將 Harness 模型呼叫與 Rollout 分離在獨立容器執行,實現訓練與推理解耦。
- 在複雜測試集上驗證效能:OpenForgeClaw 在 ClawEval 達 31.7 pass@3,OpenForgeGUI 在 WebVoyager 達 72.3。
- 比起同規模的開放基線表現更佳,且在 GUI 任務中能與數倍規模的模型匹敵。