一龍馬/AI 情報站讀懂消息背後的脈絡
星期四
搜尋

Google DeepMind 發表 Gemini 3.5 Transcribe,定位為旗下目前最精準的語音轉文字模型,主打即時語音互動與更「整理過」的轉錄輸出

中文摘要

官方文章指出,它可處理背景雜音、專業術語、口誤修正與 filler words,並提供兩種開發者介面:Live API 的 gemini-3.5-transcribe-live 用於低於一秒延遲的雙向串流,Interactions API 的 gemini-3.5-transcribe 用於預錄音訊、會議與通話紀錄,含說話者標註與逐字時間戳。Google 也稱此模型已用在 Gemini app、Android 的 Rambler,以及 macOS 上 Gemini app 的語音能力,但來源是官方部落格,未提供第三方評測。

一龍馬判讀

這讓語音代理、即時字幕、客服通話分析等應用可直接接上 Gemini API,但實際準確率、語言涵蓋與隱私風險仍需開發者自行驗證,不能只看官方宣稱。

原文節錄

Google DeepMind

Introducing Gemini 3.5 Transcribe Skip to main content Intelligent transcription with Gemini 3.5 Transcribe Innovation & AI Products & platforms Company news Fe

取得部分原文 · 不代表內容已獨立查證

查看原文
完整收錄文字與來源

Intelligent transcription with Gemini 3.5 Transcribe

收錄日期
2026-08-27
來源
官方 RSS+Hacker News Algolia API
抓取時間
2026/08/27 06:00(台北)
來源資料
官方來源