ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

CodeMidas:從程式碼本身擴充套件代理程式設計 RL 環境

研究 1 個來源 · 2 天前
為何重要

這項研究跳脫了傳統依賴 issue 與 commit 等離散開發記錄來建構訓練集的框架,證實了「原始碼即任務」的可行性,極大擴充了 coding agents 的可用測試範圍。 對於自動化軟體工程領域,此成果對接 LLM 生成與真實世界基礎設施建置建立了具體技術橋樑,特別是 +17% 的 ProgramBench 效能提升,顯示 RL 在複雜程式建構上的潛力。 它提供了一套可擴充套件的基準測試標準,讓後續研究能更精確地評估 AI 代理在多語言、多領域程式設計任務中的執行可靠性。

訓練具備程式設計能力的代理需仰賴多樣化且可靠的任務,現行方法多受限於 issue 與 commit 等開發產物。研究團隊提出 CodeMidas,僅以原始碼為輸入,自動將現有程式庫的實作功能轉化為可執行的 RL 環境。

  • 資料集涵蓋 3,185 個開源專案,橫跨 23 種程式語言15 個技術領域,共產生 5,545 個訓練任務
  • 在使用 GRPO 訓練 MiMo-V2.5 後,模型在 DeepSWE、ProgramBenchTerminal-Bench v2.1 等基準測試上皆獲提升(最高 +17%)。
  • CodeMidas 透過代理探索功能來制定規範、構建測試,並利用執行檢查與解決回放來過濾任務,建立了一套可自動化的環境建構流程。
CodeMidasMiMo-V2.5RLCoding AgentsProgramming Benchmarks

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00