ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Google 發表 Gemini 3.8 Live 與 3.5 Transcribe,強化工業級語音互動效能

模型 1 個來源 · 7 天前
為何重要

對開發者而言,這套語音解方案縮減了以往需要「串流模型 + 思考模型 + 轉文字模型」的三段式架構處理,大幅簡化直立型客製化聊天機器人的開發難度;對產業而言,Google 強化其 Cloud 基礎設施在多模態即時通訊的競爭力,為企業級客戶提供比雜湊組合更穩定的服務選項。

Google 深度投入 LLM 語音領域,推出原生語音互動模型 Gemini 3.8 Live 與高精度語音轉文字模型 3.5 Transcribe,旨在解決開發者在即時串流情境下的對話流暢度與語音辨識精準度問題。

  • Gemini 3.8 Live 最大亮點:具備背景執行非同步函式呼叫、整合視覺輸入以及複雜背景思考的延展能力,並在 Artificial Analysis 排行榜獨佔鰲頭。
  • 極致辨識效能:3.5 Transcribe 平均 Word Error Rate (WER) 為串流 4.0% vs 非串流 2.6%,並支援一趟 1 小時的語音檔案轉寫。
  • 定價與生態整合:語音輸入/輸出定價分別為 $0.005/分與 $0.018/分鐘,已向外接 Agora、LiveKit 等平臺提供整合。
Gemini 3.8 LiveGemini 3.5 TranscribeGoogle DeepMindWERSpeech-to-SpeechGoogle

來源 · 1 篇報導

首發 Google — The Keyword blog.google 01:00