ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

強化學習用於程式碼最佳化:DMC-Optim 方法提升生成效率

研究 1 個來源 · 7 天前
為何重要

這項技術突破證實了 LLM 不僅能被訓練為「寫對」程式碼,還能透過 RL 機制學習「寫得快」,這對於降低推理延遲與推理成本具有深遠意義。對產業來說,這是將生成式 AI 從原型開發階段推向真正工程生產力的關鍵一步,意味著未來調校方向將更重視非正確性的效率目標。

現有的程式碼 RL 技術多著重於正確性,但在引入執行時間作為獎勵時,常受測量噪聲與 GRPO 不穩定性影響而效果不彰。新研究提出 DMC-Optim,透過改良測試環境、獎勵機制與模型學習機制來克服稀疏訊號問題。

  • 效能提升:在 DMC-Optim 測試下,Qwen 2.5 7B 的 Top-50% pass@1 從 18.0% 提升至 31.3%,CWM 32B 則從 30.7% 大幅提升至 50.4%。
  • 嚴格基準表現:應用於更嚴格的百分位元(如 Top-30%)時,CWM 32B 取得了 125% 的相對提升。
  • 基準與人類競爭:CWM 32B 在 LCB 基準上最遠可達標準 RLVR 媒體樣本速度比較的 83% 勝率,但在複雜度改善人類表現上也僅達約一半。
Reinforcement LearningDMC-OptimCode OptimizationGRPOQwen 2.5 7BCWM 32B

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00