ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

利用 NVIDIA Model Optimizer 開發 Nemotron 3.5 Lightning NVFP4 與 QAD

工具 1 個來源 · 8/18
為何重要

QAD 技術允許開發者在受限資源下執行更激進的量化(如將 Mamba 線性層量至 W4A16),從而突破標準 PTQ 的瓶頸,這對於高算力且低延遲的 Agent 或程式碼生成應用至關重要;此發表確立了 NVFP4 格式為未來高效 LLM 部署的標準新選項,影響資料中心 GPU 的配置策略。

NVIDIA 發表了一項名為量子感知知識傳遞 (QAD) 的混合量化方法,透過結合後訓練量化 (PTQ) 和知識傳遞,在保持精準度接近 BF16 基準的前提下,將 Nemotron 3.5 Lightning 模型壓縮至 22 GB 並實現達 4 倍的吞吐量加速。

  • Nemotron 3.5 Lightning NVFP4 透過將模型從 66 GB 原始 BF16 大小壓縮至 22 GB,在保持精準度的同間實現高達 4 倍的吞吐量提升。
  • 採用兩階段流程:先以 PTQ 生成低精度學生模型,再透過 QAD 使用 KL divergence 損失函式與凍結的 BF16 教師模型訓練,恢復幾乎所有因激進量化而丟失的精準度。
  • 開發者可使用 NVIDIA Model Optimizer 與 Megatron-Bridge 進行從配方選擇、訓練到匯出的端對端工作流程,方便模型部署。
Nemotron 3.5 LightningNVFP4QADModel Optimizer壓縮技術

來源 · 1 篇報導

首發 NVIDIA Technical Blog developer.nvidia.com 02:12