ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

KVAE:針對多模態生成模型的個人化編碼器家屬

研究 1 個來源 · 3 小時前
為何重要

編碼器效能直接決定了多模態模型的生成保真度與訓練效率。KVAE 的開源著重於具體技術細節(如壓縮率與頻道配置)的公開,不僅提供了新的效能基準,也降低了開發者實作音訊與視訊生成模型的技術門檻。

KVAE 是一套專為音訊、影像及視訊設計的潛在擴散模型 tokenizers 系列,致力於最佳化文本條件生成的學習速度與產出品質。

  • KVAE-Audio 為連續全頻帶 48 kHz 模型,採用 50 Hz 潛在空間與 64 個頻道。
  • KVAE-3D 包含兩種因果視訊 tokenizer,支援 4x16x16 與 4x8x8 的壓縮率;KVAE-2D 則將影像壓縮率設為 8 倍並配備 32 個頻道。
  • 在重建 (PSNR, LPIPS, PESQ) 及生成 (Frechet Distance, CLIP score) 等評測上,表現優於或匹配 Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio 與 MMAudio 等開源技術。
KVAELatent DiffusionTokenizerMultimodalAudio-Video

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00