雙工語音對話模型的可導向性突破:SteerDuplex 與 SteerBench
為何重要
雙工語音模型在 AR/VR 與智慧助理領域已成為基礎需求,但過去缺乏對「可控性」 的量化標準。SteerDuplex 與 SteerBench 的建立,填補了評估模型是否能在即時互動中依指令變化語氣或風格的空缺。對開發者而言,這提供了最佳化類似 Copilot 或客戶服務聊天機器人溝通模式的具體工具;同時,指出的「獎勵破解」問題也警示了純追求反應速度可能犧牲對話完整性的工程風險。
- SteerDuplex 是一種基於 Moshi 的雙工語音模型,透過自然對話與合成對話微調,實現對語氣、人設與風格的可指令調整。
- 研究提出 SteerBench 評估基準,包含 390 筆語音提示與 1,067 條人工撰寫的二進位制評分,監督訓練使音訊導向平均通過率提升 44.5 個百分點。
- 雙階段強化學習 將原始碼清晰的幹擾回應率從 72.5% 提升至 82.5%,並將合成音訊切入率從 26.5% 降低至 9%。