ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

簡報:將 Nunchaku 4-bit 推論能力納入 Diffusers 生態

工具 1 個來源 · 14 天前
為何重要

這項整合標準化了高階量化推理在主流 AI 框架中的應用,大幅降低了開發者與企業在消費級甚至邊緣裝置上部署強大生成模型的硬體門檻。除了解決訓練後模型的部署痛點,SVDQuant 在保留精度的同顯著最佳化效能,將迫使其餘競爭量化技術(如 AWQ)進行改進,並強化 NVIDIA Blackwell 硬體在創意 AI 工具生態中的定位。

為解決現代文字生圖模型在 BF16 精準度下需耗用 20-30 GB VRAM 的問題,Hugging Face 將 Nunchaku 的 SVDQuant 4-bit 推論引擎原生整合進 Diffusers 框架,讓開發者可透過標準 API 載入並直接提升推理速度。

  • 在 RTX 5090 上執行特定 checkpoint 可在約 1.7 秒內完成 1024x1024 影像生成,記憶體峰值僅約 12 GB,相較標準 BF16 減少一半且速度提升。
  • 推論支援原生 from_pretrained() 載入,無需本地 CUDA 編譯,NVFP4 核心會從 Hub 依需求下載,適配 NVIDIA Blackwell 系列 GPU。
  • 綜合基準測試顯示,SVDQuant 可帶來 30% 加速及 50% 記憶體降幅,搭配 torch.compile 可將端對端效能提升至 1.8 倍。
  • 使用者可透過 diffuse-compressor 工具箱建立 SVDQuant 工作流程,將自訂模型轉換為標準 Diffusers 倉庫格式並發布。
NunchakuDiffusersSVDQuant4-bitHugging FaceNVIDIA Blackwell

來源 · 1 篇報導

首發 Hugging Face Blog huggingface.co 08:00