語音記憶體用於代理語音辨識
為何重要
該研究揭示了在 Agent 框架中,將模型權重與可檢驗的「記憶體」繫結,是比自由調整引數成本更低且更具可移植性的 ASR 改進方案。它透過證明「剋制」比不受約束的生成是更強大的技能,為開發者在不進行訓練的情況下提升生產環境 ASR 準確率提供了一個新工具。
- 本篇提出 Voice Memory 這種僅限推論的架構,將聽者-思考者模型分離,透過凍結更正器與非同步閘門最佳化器修訂記憶體,在不變更模型權重下提升準確率。
- 在十個 HyPoradise 領域中,Voice Memory 將 Weighted Word Error Rate 從 8.36% 降至 7.52%(增加 3 個範例時為 7.47%)。
- 堅持考慮「剋制」的最佳化策略顯著減少過度修正:將不受約束的生成式錯誤更正(GER)造成的錯誤破壞從 64% 降至 35%。
- 在有噪聲遠場語音(CHiME-4)與航空命令等特定場景,錯誤率分別從 12.69% 改善至 10.46% 以及從 8.40% 最佳化至 3.40%。