DeltaMedia
2026-07-21
模型動態

Google 將同步口譯打包成 Live API,Gemini 3.5 連說邊譯、落後數秒即輸出

Google 本週正式推出 Gemini 3.

Google 將同步口譯打包成 Live API,Gemini 3.5 連說邊譯、落後數秒即輸出

Google 本週正式推出 Gemini 3.5 Live Translate,將語音翻譯底層架構從「等說完再譯」的 turn-by-turn 模式切換為連續串流生成:模型邊接收音訊邊輸出譯文,全程僅落後說話者數秒,同時保留原說話者的語調、語速與音高,並自動辨識 70 種以上語言,無需手動設定。

模型今日起分三條軌道上線:開發者可透過 Gemini Live API 和 Google AI Studio 進入公開預覽;企業用戶本月起在 Google Meet 私有預覽;一般用戶則透過 Android 與 iOS 版 Google Translate 直接使用。即時語音基礎設施平台 Agora、Fishjam、LiveKit、Pipecat、Vision Agents 已整合 Live API,開發者可借助這些平台的串流媒體管線快速部署翻譯功能。東南亞叫車平台 Grab 正測試這套模型,其用戶每月透過 app 撥打逾 1,000 萬通語音通話。

看點不在「翻得更好」,而在能力交付方式的位移。同步口譯包進公開 API,意味著這項過去侷限在商業會議軟體的能力,任何開發者理論上都能以 API 呼叫方式組裝進自家語音產品,從線上課程、多語直播到客服場景皆適用。對做即時語音 app 的工程師來說,這是能力可用性的明確訊號:同步口譯正從產品功能下放成可組裝的基建層。

相關公司 Google
本文由 DeltaMedia 編輯團隊審核後發布 · 編輯原則