ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

StepAudio 3 Gen 技術報告:基於離散自回歸 RVQ tokens 之通用音訊生成模型

模型 1 個來源 · 9 天前
為何重要

通用音訊模型從連續擴散轉向離散自回歸生成器(Token-based),標誌著架構路徑更接近大型語言模型;統一框架下的多工表現提升了模組整合的潛力。

StepAudio 3 Gen 是一個通用音訊生成模型,支援零擷取文字轉語音(TTS)、聲音設計、人聲、音效與音樂,並採用離散自回歸生成取代近期的擴散 Transformer 範式,直接在殘差量化 tokens 上建模。

  • 該模型使用維度為 16 times 2048 的殘差碼空間,以 12.5 Hz 頻率表徵通用音訊,聯合量化語義與波形級聲學特徵。
  • 生成機制採用 backbone 預測時間軸上第一個碼簿,並由輕量級因果 Transformer 補全其餘十五個碼簿。
  • 訓練包含幹擾感知的遞進式預訓練、多工指令訓練與監督微調,確保語言模型保持文本能力並實現 TTS 與聲音設計的 SOTA 表現。
StepAudio 3 GenRVQDiscrete AutoregressiveTTSAudio GenerationHugging Face

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00