ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Transcription Policy as a Latent Variable:啟動受控逐字 ASR 與字級時間戳記

研究 1 個來源 · 15 天前
為何重要

此研究解決了 ASR 領域長期存在的「評估混淆」痛點,即模型表現不佳可能源於標註風格(醫療逐字稿 vs. 一般會話)不匹配。透過將風格轉為可控變數,能大幅提升專業場域(如法律、醫療)部署 ASR 的可靠性與效率,降低跨語言部署的技術門檻。

目前的 ASR 模型在混合註解資料的訓練下,往往將逐字稿風格視為不受控的潛在變數,導致模型不穩定及評估結果混淆。本研究提出一種機制,將這些風格轉化為可控變數,並透過覆蓋感知解碼器提升模型效能。

  • 在僅使用英文訓練的情況下,德語中斷詞偵測的 F1 數值可從 10% 提升至 79%(零樣本)。
  • 全部採用英文微調的模型,在逐字稿準確度、中斷詞偵測及預期模式的品質上,超越所有基線模型。
  • 新提出的「verbatimize」任務,旨在利用高品質的標準逐字稿來擴充並豐富語音語料庫。
ASRHugging FaceWord-level TimingVerbatimGerman disfluencyEvaluation Confounding

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00