Google 推出 Gemini 3.8 Live 與 Extended Thinking:標準化作語音對話 AI
為何重要
這次升級標誌著 AI 從「對話模型」向「語音 Agent(智慧體)」商業化邁出關鍵一步。Google 不僅提供了足以勝任銀行、客服等高風險任務的基準(τ benchmark),更解決了 Agent 開發長久以來的痛點——在背景執行複雜任務時不打斷使用者對話。對開發者而言,這降低了構建生產級語音應用的門檻;對投資人來說,這意味著語音 AI 從概念落地為具體的企業服務接入口。
Google 釋出最新一代即時對話模型「Gemini 3.8 Live」及其專攻複雜推理的「Extended Thinking」版本,旨在透過背景執行能力與多步驟推理,提供更自然、無中斷的語音服務。
- 效能領先:3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 上奪冠 (82.6),並在 τ-Voice 客戶服務與 τ-Voice-banking 基準上取得最高分別為 68.6% 與 35.1%。
- 流暢互動:這些模型支援 97 種語言中途切換,並能在對話中於背景執行工具 API,實現不中斷的連續互動。
- 生態整合與驗證:Salesforce 與 LangChain 等均透過 Gemini Live API 對接,且所有生成音訊皆配備 SynthID 水印,強化企業信任。