ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

面向 LLM 全流程 FP8 強化學習的校準裁剪法

研究 1 個來源 · 19 小時前
為何重要

這項技術突破直指訓練低成本 LLM 的核心痛點,意味著開發者能在不犧牲推理能力的前提下,顯著壓低訓練算力成本,從而加速複雜 Agent 應用的商業化落地。對於投資人而言,這標誌著量化技術正從早期的硬體探索走向成熟,對於訓練平臺與推理服務商的商業模式構成正面影響。

研究指出,儘管利用 FP8 定點運算可加速 LLM 強化學習,但全流程實作仍存在嚴重訓練不穩定,常表現為熵值異常飆升。

  • Calibrated Clipping 是一種動態方法,透過比對下界分位數並重新平衡上界,將 FP8 裁剪邊界對齊高精度的 BF16 分佈,解決了先前校正技術(如 TIS)無法解決的負優勢 token 畸變問題。
  • 實驗涵蓋 GRPODAPO 演算法,驗證於 8B32B 的模型規模及多種 FP8 縮放粒度。
  • 證實該方法成功消除熵值波動,並將效能恢復至 BF16 基準水平。
FP8Reinforcement LearningCalibrated ClippingLLMQuantization

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00