針對小型語言模型代理的高秩強化學習穩健性研究
為何重要
這項研究證明瞭小型語言模型經過正確的 RL 演算法最佳化,不僅能達到與大型模型相似的對齊效果,還能減少大量訓練資料需求,突破將 Agent 能力部署於低成本或邊緣裝置的技術障礙。對產業而言,這意味著未來 AI 產業的競爭焦點將從「堆砌引數規模」轉向「資料效率與運算最佳化」,為資源有限但需高效能響應的應用場景開闢新商機。
- 研究團隊在 70-500M 引數範圍內,使用 PPO 演算法於 15 組 (模型、語料庫) 配置上進行訓練,涵蓋 Pythia 系列 (70M, 160M, 410M) 與 SmolLM2 (135M, 360M),並在 TinyStories、CNN/DailyMail 和 Wikitext-103 等語料庫上進行測試。
- 發現三種可復現的失敗模式:PEFT/TRL 管道中的 LoRA 引數靜默凍結、使用 bfloat16 時的重要性比率數值溢位,以及因獎勵模型錯誤導致的災難性策略崩潰。
- 提出「容量餘量假說」,認為 PPO 效能取決於流暢的監督模型(PPL<20)與具區辨力的獎勵訊號,而非模型引數數量,解決方案包含合併並重新初始化介面卡、使用 float32 精度以及權重回滾機制。