簡報:將 Nunchaku 4-bit 推論能力納入 Diffusers 生態
為何重要
這項整合標準化了高階量化推理在主流 AI 框架中的應用,大幅降低了開發者與企業在消費級甚至邊緣裝置上部署強大生成模型的硬體門檻。除了解決訓練後模型的部署痛點,SVDQuant 在保留精度的同顯著最佳化效能,將迫使其餘競爭量化技術(如 AWQ)進行改進,並強化 NVIDIA Blackwell 硬體在創意 AI 工具生態中的定位。
為解決現代文字生圖模型在 BF16 精準度下需耗用 20-30 GB VRAM 的問題,Hugging Face 將 Nunchaku 的 SVDQuant 4-bit 推論引擎原生整合進 Diffusers 框架,讓開發者可透過標準 API 載入並直接提升推理速度。
- 在 RTX 5090 上執行特定 checkpoint 可在約 1.7 秒內完成 1024x1024 影像生成,記憶體峰值僅約 12 GB,相較標準 BF16 減少一半且速度提升。
- 推論支援原生
from_pretrained()載入,無需本地 CUDA 編譯,NVFP4 核心會從 Hub 依需求下載,適配 NVIDIA Blackwell 系列 GPU。 - 綜合基準測試顯示,SVDQuant 可帶來 30% 加速及 50% 記憶體降幅,搭配
torch.compile可將端對端效能提升至 1.8 倍。 - 使用者可透過
diffuse-compressor工具箱建立 SVDQuant 工作流程,將自訂模型轉換為標準 Diffusers 倉庫格式並發布。