強化學習用於程式碼最佳化:DMC-Optim 方法提升生成效率
為何重要
這項技術突破證實了 LLM 不僅能被訓練為「寫對」程式碼,還能透過 RL 機制學習「寫得快」,這對於降低推理延遲與推理成本具有深遠意義。對產業來說,這是將生成式 AI 從原型開發階段推向真正工程生產力的關鍵一步,意味著未來調校方向將更重視非正確性的效率目標。
現有的程式碼 RL 技術多著重於正確性,但在引入執行時間作為獎勵時,常受測量噪聲與 GRPO 不穩定性影響而效果不彰。新研究提出 DMC-Optim,透過改良測試環境、獎勵機制與模型學習機制來克服稀疏訊號問題。
- 效能提升:在 DMC-Optim 測試下,Qwen 2.5 7B 的 Top-50% pass@1 從 18.0% 提升至 31.3%,CWM 32B 則從 30.7% 大幅提升至 50.4%。
- 嚴格基準表現:應用於更嚴格的百分位元(如 Top-30%)時,CWM 32B 取得了 125% 的相對提升。
- 基準與人類競爭:CWM 32B 在 LCB 基準上最遠可達標準 RLVR 媒體樣本速度比較的 83% 勝率,但在複雜度改善人類表現上也僅達約一半。