📰 重點摘要
此新聞來自 Google DeepMind 部落格,非內部資料,直接翻譯處理:
Google 推出全新語音轉文字模型 Gemini 3.5 Transcribe,主打精準且智慧的語音辨識能力,已用於 Gemini App、Android Rambler 及 macOS Gemini App 等產品,現在開發者也能透過 Gemini API(Google AI Studio)與 Gemini Enterprise Agent Platform 使用。模型提供兩種 API:即時串流版 gemini-3.5-transcribe-live,透過 Live API 提供次秒級延遲的雙向串流,適合語音助理與即時字幕;預錄音訊版 gemini-3.5-transcribe,透過 Interactions API 處理會議、通話紀錄等錄音,支援語者標示與逐字時間戳記。功能亮點包括智慧修正語意(例如把「我們星期二見—不對,星期三」自動修正)、自動去除贅字如「嗯」「啊」並排版文字;支援 function calling,可將圖片生成、檔案分析等任務轉交給其他 Gemini 模型處理(目前限 macOS App);辨識支援自訂詞彙,能適應專業術語與特殊拼寫;支援超過 85 種語言,能自動偵測並處理不同腔調與方言;預錄音訊最多可標示三位語者身份並附時間戳記(三人以上為實驗性功能)。根據 Artificial Analysis 測試,字錯率(WER)方面,串流模式平均 4.0%,非串流模式平均 2.6%,在嘈雜環境下仍能準確辨識郵遞區號、訂單編號等英數字混合內容。相較前代模型 Chirp 3,新模型在辨識準確度與延遲表現上均有顯著提升。
💬 JudyAI Lab 觀點
根據 Gemini 3.5 Transcribe 的模型設計,這則發表值得留意的地方在於語音辨識已從單純轉文字進化到能理解語意脈絡並自動修正。
對AI builder來說,這反映一個明顯的產業趨勢:語音介面的競爭點正從「聽得準」轉向「聽得懂」。像是自動修正「星期二見—不對,星期三」這種語意層級的修正,以及去除贅字並自動排版,代表模型不再只是聲學辨識器,而是把語言理解整合進轉錄流程。同時,即時串流與預錄音訊分成兩套API(次秒級延遲vs逐字時間戳記與語者標示),也顯示同一顆模型要同時服務語音助理與會議記錄這兩種截然不同的使用情境,對於延遲與準確度的取捨需求並不相同。字錯率在嘈雜環境下對英數字混合內容(如郵遞區號、訂單編號)仍能保持穩定,也點出實務場景的辨識難點往往在結構化資訊而非日常對話。
想動手試的話,可以先用Gemini API測試自訂詞彙功能,看看能否準確辨識自己領域的專業術語。
📅 原文資訊
- 發布時間:2026-08-26T17:01
- 來源原文:https://deepmind.google/blog/intelligent-transcription-with-gemini-3-5-transcribe/