AuK 技術報告:語音生成與編輯的開源基礎模型
為何重要
AuK 展示了開源生態在 Unified Speech 模型(統一語音能力)上的技術進展,提供開發者與研究人員一個低成本評估語音生成與編輯能力的完整基礎模型。這對於尋求自建語音 ASR/TTS 能力的開發者具有直接參考價值。
Hugging Face Daily Papers 發布了 AuK,這是一個基於自然語言指令與音訊背景的開源基礎模型,旨在統一語音生成、編輯等多種任務。
- 模型建構了約 3.03 億 instruction-audio 範例與 195 萬小時有效監督資料,涵蓋生成、編輯、增強等五種任務。
- 架構整合多模態 LLM、特定領域 VAE 與基於 rectified-flow Transformer 的 hybrid 混合模型。
- 推論版本 AuK-Flash 透過影像解耦 DMD 蒸餾,實現 4 步推論且無需 classifier-free guidance,比完整模型快 4.5 倍。