CodeMidas:從程式碼本身擴充套件代理程式設計 RL 環境
為何重要
這項研究跳脫了傳統依賴 issue 與 commit 等離散開發記錄來建構訓練集的框架,證實了「原始碼即任務」的可行性,極大擴充了 coding agents 的可用測試範圍。 對於自動化軟體工程領域,此成果對接 LLM 生成與真實世界基礎設施建置建立了具體技術橋樑,特別是 +17% 的 ProgramBench 效能提升,顯示 RL 在複雜程式建構上的潛力。 它提供了一套可擴充套件的基準測試標準,讓後續研究能更精確地評估 AI 代理在多語言、多領域程式設計任務中的執行可靠性。
訓練具備程式設計能力的代理需仰賴多樣化且可靠的任務,現行方法多受限於 issue 與 commit 等開發產物。研究團隊提出 CodeMidas,僅以原始碼為輸入,自動將現有程式庫的實作功能轉化為可執行的 RL 環境。
- 資料集涵蓋 3,185 個開源專案,橫跨 23 種程式語言與 15 個技術領域,共產生 5,545 個訓練任務。
- 在使用 GRPO 訓練 MiMo-V2.5 後,模型在 DeepSWE、ProgramBench 和 Terminal-Bench v2.1 等基準測試上皆獲提升(最高 +17%)。
- CodeMidas 透過代理探索功能來制定規範、構建測試,並利用執行檢查與解決回放來過濾任務,建立了一套可自動化的環境建構流程。