ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

全雙工語音模型的自我聽覺與幹擾恢復研究

研究 1 個來源 · 14 天前
為何重要

對於下一代 AI Agent 開發者而言,具備自然對話斷續能力是提升使用者接受度的關鍵。該研究建立了一套客觀的評測基準,標記出全雙工模型在非同步流程中的特定斷點,未來將有助於廠商量化技術競爭優勢。

面對全雙工語音模型在同步聽說時遇到的「錨點幹擾」(anchor interruption)問題,研究指出語音生成、合成與播放的非同步性會導致模型所知與所聞不一致。本文提出「自我聽覺」架構,透過將實際播放的語音輸出回饋至模型作為輸入流來解決此問題。

  • 核心方法:引入「自我聽覺」機制,重疊模型文字輸出與實際播放的語音,讓模型能精準接收到並意識到自己剛對外說出的內容。
  • 評測標準:推出 AnchorSpeech 資料集,專門訓練與測試結構化回應列表,並設計「AnchorSpeech-test」以評估模型在中斷後回應最後完成內容的一致性。
  • 實驗結果:實驗證實,相較於僅使用全雙工基準模型的表現,具備自我聽覺機制的模型在幹擾恢復與錨點保持上有更好的表現。
Full-DuplexVoice AISelf-ListeningAnchorSpeechAudio Models

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00