實用聽寫模型 Canto 發布:針對真實場景最佳化
為何重要
打破「僅靠超大基礎模型吃遍天下」的迷思。Canto 顯示出專門針對 real-world ASR(自動語音識別)進行 RL(經驗強化學習)微調的具體成效,即使未具備多模態前緣模型的龐大資產,在特定場景如聽寫的即時效能與準確率上依然具備競爭力。這為垂直應用廠商指出了另一條潛力路徑:透過高質量的訓練資料與最佳化策略,而非單純堆疊算力規模。
Wispr Flow 公司發布新模型 Canto,專注於解決背景噪音、多聲道及環境幹擾等真實使用場景下的即時聽寫問題。
- 在包含 Google、OpenAI、AssemblyAI 與 Deepgram 的競品測試中,Canto 在 10 小時真實語音資料集(來自 2,300 位獨特使用者)上達成最低字錯誤率(WER)。
- 在 3 小時高難度的挑戰集測試中(含風聲、背景音、小聲耳語等),Canto 在即時低延遲應用的模型中表現最佳,雖整體排名第二但輸給了不適合即時應用的 Gemini 3.1 Pro。
- 訓練方式結合由 DeepSeekMath 提出的 GRPO 經驗強化學習法,並利用語音對齊(forced-alignment confidence)與使用者的主動更正資料來最佳化。