ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

建立生產級希臘語-英語語音識別系統:Sophea 的實務經驗與瓶頸分析

研究 1 個來源 · 8 天前
為何重要

儘管希臘語市場利基,但此報告揭示了生產級語音識別在處理特定語言與噪訊環境時典型的「資料權衡」問題。特別是 ROVER(投票融合)在提升表現上的具體量測,以及如何透過濾波器殺死浪費的稀疏資料,為開發者提供了寶貴的工程指南。這意味著在複雜語境中建構 ASR 應用,純靠模型權重不夠,還需精密的資料工程與評估門檻。

  • Sophea 系統測試歷程: 在多達 23 次訓練迭代與兩種模型架構下進行開發,評估九項生產門檻,但在語境資料組合上未見能同時通過所有門檻的方案。
  • 資料暴露量差異: 滿足希臘語噪訊環境目標需約 1,500 步的密集領域資料暴露;而保留英語語言識別能力僅允許約 250 步的暴露。
  • 整合與最佳化成果: 採用三模型 ROVER 整合後,門檻通過率從單一模型的 4–7 個提升至 9 個,重疊語音詞錯誤率(WER)從 53.35% 縮減至 37.87%(降幅 29%)。
  • 資料品質過濾: 透過六段式資料管道校準音質濾波器,將被剔除的希臘語音訊比例降低了 88.1%(從 98.7% 降至 10.6%)。
SopheaASRSpeech RecognitionROVERPython/C++

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00