KVAE:針對多模態生成模型的個人化編碼器家屬
為何重要
編碼器效能直接決定了多模態模型的生成保真度與訓練效率。KVAE 的開源著重於具體技術細節(如壓縮率與頻道配置)的公開,不僅提供了新的效能基準,也降低了開發者實作音訊與視訊生成模型的技術門檻。
KVAE 是一套專為音訊、影像及視訊設計的潛在擴散模型 tokenizers 系列,致力於最佳化文本條件生成的學習速度與產出品質。
- KVAE-Audio 為連續全頻帶 48 kHz 模型,採用 50 Hz 潛在空間與 64 個頻道。
- KVAE-3D 包含兩種因果視訊 tokenizer,支援 4x16x16 與 4x8x8 的壓縮率;KVAE-2D 則將影像壓縮率設為 8 倍並配備 32 個頻道。
- 在重建 (PSNR, LPIPS, PESQ) 及生成 (Frechet Distance, CLIP score) 等評測上,表現優於或匹配 Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio 與 MMAudio 等開源技術。