ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

騰訊混元 Hy ASR 3.0 preview:引入大模型語義理解的語音識別方案

模型 1 個來源 · 2 天前
為何重要

此次發布標誌著 ASR 從單純的語音轉文字工具,轉變為具備糾錯與理解能力的 AI Agent 入口,能直接提升智慧客服與企業內容生產的準確率。對模型競爭者而言,混元採用的 Encoder 與 LLM 聯合訓練路徑提供了新的技術對標樁,顯示中國大陸 AI 團隊在多模態基礎建設上持續深化。

騰訊混元於 8 月 4 日正式發布 Hy ASR 3.0 preview,將基座模型 Hy3 的語言理解能力整合進語音識別,實現從單點轉寫到語境感知的跨越。

  • 在開源評測集上整體 WER 控制在 3% 左右,中文普通話 WER 為 3.34%、英語 2.62%、粵語 3.12%,整體領先競品。
  • 採用 MoE 架構並與 Hy3 聯合訓練,透過數千萬小時無監督資料自研 Encoder 以從複雜音訊中提取高品質表徵。
  • 融合多階段強化學習與 SFT recipe,最佳化熱詞注入及高噪、耳語等場景表現,並已在騰訊雲與元寶 App 上線。
騰訊混元Hy ASR 3.0Speech RecognitionMoETencent CloudHunyuan Hy3

來源 · 1 篇報導

首發 量子位 QbitAI qbitai.com 16:58