ai.doge.tg 繁體 AI 情報 最新 專案 搜尋 Telegram ↗

Google 推動 1,000 種語言計畫:從文本翻譯到語音心理聲學與在地化資料

研究 1 個來源 · 7 天前
為何重要

對開發者而言,這標誌著多模態 AI(特別是語音感知)已成為生態系標配,日後開發人機互動介面時,必須處理如手語翻譯等非標準輸入的邊緣案例。此舉不僅擴充套件了 Google 在全球數位平權市場的影響力,也迫使競爭對手必須最佳化低資源語言模型與邊緣計算能力。接下來值得關注的是 OTA 更新或新硬體搭載這些輕量級模型(如 TranslateGemma)對全球網路流量與雲端成本的潛在影響。

Google 強調其技術現已支援 300 多種語言,服務全球 70 億人口(佔全球 86%),並打破以往多數語言主導數位生態的局面。透過引入強化學習與社群合作,Google 正將翻譯重點從單純的文本轉移至理解真實世界的情感、語氣、方言之間的文化細膩差異。

  • Google 推出 Gemini 3.5 Live Translate,支援 70 種語言及 2,000 多對語言組合的即時口譯,並能自然捕捉言語穿插(Code-switching)與情感語氣。
  • Universal Speech Model 訓練超過 1,200 萬小時的語音資料,透過跨語言遷移學習,提升對資源匱乏語言的識別能力。
  • TranslateGemma 是一系列輕量級開源翻譯模型,支援 55 種語言且能在裝置端高效執行,解決 30 億無穩定網路連結的使用者需求。
  • 為建立 WAXAL 資料集,Google 與 Makerere University 等機構合作,涵蓋 27 種撒哈拉以南非洲語言,服務超過 1 億人口。
  • Project Vaani 已收集 3 萬小時以上來自 15.5 萬名講者的 109 種語言語音,採用區域導向而非語言導向的資料收集方法。
  • Google 聘用超過 1,600 名在地專家,透過 Amplify Initiative 收集 1.5 萬個多模態資料點。
  • 針對手語族群的 Sign Language-to-Text (SL2T) 模型支援 50 多種手語,起初由 Gboard 的 Rambler 與 Pixel 11 的 Live Transcribe 功能支援。
GoogleGemini1,000 Languages InitiativeUniversal Speech ModelTranslateGemmaProject Vaani

來源 · 1 篇報導

首發 Google — The Keyword blog.google 00:00