面向 LLM 全流程 FP8 強化學習的校準裁剪法
為何重要
這項技術突破直指訓練低成本 LLM 的核心痛點,意味著開發者能在不犧牲推理能力的前提下,顯著壓低訓練算力成本,從而加速複雜 Agent 應用的商業化落地。對於投資人而言,這標誌著量化技術正從早期的硬體探索走向成熟,對於訓練平臺與推理服務商的商業模式構成正面影響。
研究指出,儘管利用 FP8 定點運算可加速 LLM 強化學習,但全流程實作仍存在嚴重訓練不穩定,常表現為熵值異常飆升。
- Calibrated Clipping 是一種動態方法,透過比對下界分位數並重新平衡上界,將 FP8 裁剪邊界對齊高精度的 BF16 分佈,解決了先前校正技術(如 TIS)無法解決的負優勢 token 畸變問題。
- 實驗涵蓋 GRPO 與 DAPO 演算法,驗證於 8B 到 32B 的模型規模及多種 FP8 縮放粒度。
- 證實該方法成功消除熵值波動,並將效能恢復至 BF16 基準水平。