ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

語音記憶體用於代理語音辨識

研究 1 個來源 · 7 天前
為何重要

該研究揭示了在 Agent 框架中,將模型權重與可檢驗的「記憶體」繫結,是比自由調整引數成本更低且更具可移植性的 ASR 改進方案。它透過證明「剋制」比不受約束的生成是更強大的技能,為開發者在不進行訓練的情況下提升生產環境 ASR 準確率提供了一個新工具。

  • 本篇提出 Voice Memory 這種僅限推論的架構,將聽者-思考者模型分離,透過凍結更正器與非同步閘門最佳化器修訂記憶體,在不變更模型權重下提升準確率。
  • 在十個 HyPoradise 領域中,Voice Memory 將 Weighted Word Error Rate 從 8.36% 降至 7.52%(增加 3 個範例時為 7.47%)。
  • 堅持考慮「剋制」的最佳化策略顯著減少過度修正:將不受約束的生成式錯誤更正(GER)造成的錯誤破壞從 64% 降至 35%。
  • 在有噪聲遠場語音(CHiME-4)與航空命令等特定場景,錯誤率分別從 12.69% 改善至 10.46% 以及從 8.40% 最佳化至 3.40%。
Voice MemoryAgentic Speech RecognitionASRInferenceHyPoradiseWeighted Word Error Rate

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00