ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

OpenAI 發布 GPT-Live-1 語音模型至 API,主打「全雙工」與「自然打斷」能力

模型 1 個來源 · 12 天前
為何重要

GPT-Live-1 的推出標誌著 OpenAI 正試圖從通用模型中抽離出針對「語音互動」的最優解,解決了後端 LLM 處理高頻率、非結構化語音輸入時的同步性與延遲痛點。對產業開發者而言,這意味著構建高品質語音 Agent 的門檻降低,特別是在處理「說話中被打斷」等複雜語境時,不再需要外包開發龐大的自訂通訊協議。對競爭者來看,OpenAI 正在利用裸機級的語音 API 呼喚能力與極具誘惑力的價格,重塑語音 AI 的基礎設施層生態。

OpenAI 於 API 推出 GPT-Live-1,此源自 ChatGPT 的語音模型旨在透過單一模型處理連續的聆聽與發聲,並支援將複雜推理任務委派給後端大語言模型(如 GPT-6 Astra)。

  • 架構最佳化:原生整合 ASR(語音轉文字)與 TTS(文字轉語音)邏輯,具備原生打斷處理能力,避免了傳統串接 STT-LLM-TTS 架構的延遲與手續中斷。
  • 效能指標:相比 GPT-Realtime-2.1,在 Full Duplex Bench 效能上提升 30 個百分點,且搭配 GPT-6 Astra 時在 Tau3 測評中排名第一。
  • 實務應用:在 Speak 的企業評估中,該模型減少了語言 tutor 互動中的中斷次數約 80%,能更自然地應對背景噪音。
  • 定價策略:前聲道語音層定價為每分鐘 $0.05,專注於連線使用者與後端推理模型的橋樑層。
OpenAIGPT-Live-1Voice APIFull DuplexTau3

來源 · 1 篇報導

首發 OpenAI News openai.com 08:00