ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

全流暢思維 OST:解決跨模態提早確認的影音推理架構

研究 1 個來源 · 8 天前
為何重要

即時影音處理的 AI 應用長期受困於資料不完備時的提早假設與幻覺問題,OST 展示了透過數學化的結構修改(超前推理與驗證區間)提升推理可靠性而非僅靠加大模型規模,這對實現可靠、即時的影音生成與互動具有重要價值。

Omni-Streaming Thinking (OST) 是一種針對 streaming omni-modal 模型「過早跨模態承諾」問題的解決方案;它透過將證據、未來預測與主張分離,並設定事後驗證區間來中斷錯誤的前提假設。

  • 基底採用凍結的 *Qwen3-Omni-30B-A3B-Instruct* 模型,透過輕量化適配運作。
  • 相比最佳開放式基線,該架構在五項 streaming 和 audio-visual 基準測試中的平均相對表現高出超過 10%。
  • 引進 *OST-DiagBench* 測試集(固定影片僅變更音訊),OST 的 d-prime 指標達到 2.95,而基線最高僅 1.38。
  • 成功驗證了能顯著降低視覺誘發的聽覺幻覺(VIAH)能力。
OSTQwen3-Omni-30B-A3B-InstructAudio-VisualStreamingHallucinationVIAH

來源 · 1 篇報導

首發 Hugging Face Daily Papers huggingface.co 04:00