ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Inflect-Micro-v2:9.36M 引數本地語音合成模型 (TTS)

模型 1 個來源 · 11 天前
為何重要

這類極低引數 (sub-10M) 的端到端語音模型為 RAG Agent、邊緣裝置對話介面,或是需要極低成本與資料隱私的應用程式提供了新的實踐路徑。 - 相較於依賴雲端 API,此類本地模型能讓開發者在匯流排中更早啟動語音處理,減少回傳延遲與隱私疑慮。 - 雖然目前受限於英語單一男聲與非零樣本克隆,但此類「小而精」的開源模型證明瞭大型模型結構未必是高效能 TTS 的必要條件,推動了模型訓練趨勢向引數效率發展。

作者獨立打造並資助的 Inflect v2 模型,成功在不到 1000 萬引數 (9.36M) 的規模內實現完整的文本轉語音 (TTS) 功能,定位為本地 CPU 或 CUDA 推論的開放權重工具。

  • 模型具備 9,356,513 個引數,檔案大小 37.53 MB FP32,輸出 24 kHz 單聲道語音,支援確定性種子與端到端長文本分塊合成。
  • 在社群盲測中偏好率高達 66.2%,UTMOS22 自然度預測分數為 4.395,ASR 語音識別準確度 (WER) 三模型平均為 3.57%。
  • 提供兩種 API 尺寸策略,Micro 版本專注 10M 以下品質,Nano 版本專注 4M 以下體積,與 Piper、KittenTTS 等較大基準形成競爭。
Inflect-Micro-v2TTSVITS-familyonnxEdge AIHuggingFace

來源 · 1 篇報導

首發 Hacker News Front Page huggingface.co 08:36