以合成語音建構低資源泰語固定聲音 TTS
為何重要
本研究精確解決了語音 AI 在「資源受限」與「客製化聲音」之間的技術痛點,尤其是泰語這類高辨析度語言。透過合成資料訓練壓縮模型,開發者得以在保護使用者隱私的前提下,在邊緣裝置低成本部署高品質語音功能。
針對低資源語言部署 TTS 通常需在昂貴的大型 voice-cloning 模型與需大量專屬語料的傳統系統間取捨。本研究提出第三種路徑,利用大型 voice-cloning 模型作為資料源,將短暫聲音參考(約 15 秒)轉化並訓練一個全由合成語音構成的緊湊型學生模型。