一龍馬/AI 情報站讀懂消息背後的脈絡
星期五
搜尋

Google 發表 Gemini 3.5 Transcribe,稱為其最新、最精準的語音轉文字模型,目標是即時、智慧型轉錄,而不只是傳統 ASR

中文摘要

官方說它可處理背景噪音、專業詞彙與口語修正,將原始音訊轉成較乾淨、格式化的文字,並已用在 Gemini app、Android 的 Rambler、macOS 上的 Gemini app 等語音功能。開發者可透過 Gemini API 使用兩種模式:Live API 的 gemini-3.5-transcribe-live 提供雙向即時串流與亞秒級延遲;Interactions API 的 gemini-3.5-transcribe 支援預錄音訊、說話者標註與逐字時間戳。

一龍馬判讀

如果實測能穩定降低錯字、斷句與格式修正成本,語音代理、即時字幕、會議紀錄與客服分析流程都會更容易產品化。HN 討論也提醒,語音模型常見的幻覺、靜音時亂吐文字、時間戳準確度與字幕格式仍需個別驗證,不能只看官方宣稱。

原文節錄

Hacker News · k9294

Introducing Gemini 3.5 Transcribe Skip to main content Intelligent transcription with Gemini 3.5 Transcribe Innovation & AI Products & platforms Company news Fe

取得部分原文 · 不代表內容已獨立查證

查看原文 閱讀社群討論
完整收錄文字與來源

Gemini-3.5-Transcribe

收錄日期
2026-08-28
來源
Hacker News Firebase API
抓取時間
2026/08/28 05:40(台北)
來源資料
52 分 · 13 則討論