Google 推動 1,000 種語言計畫:從文本翻譯到語音心理聲學與在地化資料
為何重要
對開發者而言,這標誌著多模態 AI(特別是語音感知)已成為生態系標配,日後開發人機互動介面時,必須處理如手語翻譯等非標準輸入的邊緣案例。此舉不僅擴充套件了 Google 在全球數位平權市場的影響力,也迫使競爭對手必須最佳化低資源語言模型與邊緣計算能力。接下來值得關注的是 OTA 更新或新硬體搭載這些輕量級模型(如 TranslateGemma)對全球網路流量與雲端成本的潛在影響。
Google 強調其技術現已支援 300 多種語言,服務全球 70 億人口(佔全球 86%),並打破以往多數語言主導數位生態的局面。透過引入強化學習與社群合作,Google 正將翻譯重點從單純的文本轉移至理解真實世界的情感、語氣、方言之間的文化細膩差異。
- Google 推出 Gemini 3.5 Live Translate,支援 70 種語言及 2,000 多對語言組合的即時口譯,並能自然捕捉言語穿插(Code-switching)與情感語氣。
- Universal Speech Model 訓練超過 1,200 萬小時的語音資料,透過跨語言遷移學習,提升對資源匱乏語言的識別能力。
- TranslateGemma 是一系列輕量級開源翻譯模型,支援 55 種語言且能在裝置端高效執行,解決 30 億無穩定網路連結的使用者需求。
- 為建立 WAXAL 資料集,Google 與 Makerere University 等機構合作,涵蓋 27 種撒哈拉以南非洲語言,服務超過 1 億人口。
- Project Vaani 已收集 3 萬小時以上來自 15.5 萬名講者的 109 種語言語音,採用區域導向而非語言導向的資料收集方法。
- Google 聘用超過 1,600 名在地專家,透過 Amplify Initiative 收集 1.5 萬個多模態資料點。
- 針對手語族群的 Sign Language-to-Text (SL2T) 模型支援 50 多種手語,起初由 Gboard 的 Rambler 與 Pixel 11 的 Live Transcribe 功能支援。