ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

超越歐幾裡得限制:透過黎曼等度量政策最佳化解決 LLM 強化學習中的探索塌縮

研究 1 個來源 · 14 天前
為何重要

此研究從幾何理論層級切入,釐清了 PPO-Clip 無法有效最佳化 LLM 的根本原因,超越了過往不斷嘗試的經驗性修正。對產業界開發者而言,這提供了一個理論基礎更紮實、數值更穩定的 RLHF 新路徑;整體而言,掌握幾何不匹配的修正方法將有助於提升複雜狀態空間下的訓練效率。

強化學習 (RL) 是提升 LLM 推論能力的關鍵,但其依賴的 PPO-Clip 演算法受制於探索塌縮,新提案 RIPO 修復了 PPO-Clip 的幾何理論缺陷並提供穩定解法。

  • 根本缺陷:該研究指出 PPO-Clip 使用歐幾裡得度量來衡量政策差異,這與遵循流形內在幾何的政策理論不一致,導致在低機率區更新過於保守,最終造成探索塌縮。
  • 演算法革新:提出 Riemannian Isometric Policy Optimization (RIPO),透過在黎曼流形上保證等度量更新,有效平衡探索與利用,並改善偏差-變異折衷。
  • 效能優勢:在七個競賽級別基準測試中表現優異,在 AIME24 上相較於 GRPO 的提升幅度達 60%。
LLMReinforcement LearningPPO-ClipRiemannian Isometric Policy OptimizationRiemannian GeometryHugging Face

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00