OmniVChat:原生音視訊對話任務的合成、基準測試與訓練框架
為何重要
這項研究填補了音視訊理解評估的空白,提出了一套可量化的基準與強化學習訓練方案,大幅降低獲取評估資料的成本。透過證明合成資料訓練能有效遷移至真實互動,該研究為開發具備原生 Agent 能力的多模態模型提供了技術路徑與驗證標準。
OmniVChat 定義了使用者與模型之間的直接音視訊對話任務,旨在避免字幕翻譯帶來的延遲與資訊損失,標榜保留原始感知線索。然而,研究面臨真實場景錄音稀少以及難以客觀評估回覆複雜度等兩大困難。
- 論文提出 OmniVChat-Studio,一個利用影片生成技術合成音視訊對話的多代理引擎,以解決資料可用性問題。
- 建立了 OmniVChat-Bench 基準測試,包含五個能力類別以評價模型對話能力,並設計 OmniVChat-RL 強化學習獎勵機制。
- 實驗證明,利用合成資料訓練的 Qwen3-Omni-Instruct 模型,在標準基準與人類錄製資料集上均展現了效能提升。