📰 重點摘要
Gemini家族新增兩款文字轉語音模型「Gemini 3.8 Flash TTS」與「Gemini 3.8 Flash-Lite TTS」,將語音生成從固定預設音檔升級為可動態創作的工作室,供Gemini Notebook、Google Vids等產品使用。3.8 Flash TTS主打深度創意導演與角色設計,可用自然語言提示從零打造全新聲音,涵蓋遊戲、沉浸式有聲書、播客與互動媒體角色,並能逐行控制演出,包含表演提示、節奏、口音轉換與應答語氣等細節;3.8 Flash-Lite TTS則專為大規模、低成本應用打造,適合大量配音、音訊內容製作與具表現力的語音助理,可精細調整語調、節奏與情感細節。聲音庫方面,原創聲音數從30種擴充至近乎無限,支援超過100種語言與方言的自然語言提示設計;另提供2000多種可直接商用的聲音,涵蓋墨西哥西語、魁北克法語、蘇格蘭英語等地區變體。聲音複製功能只需30秒音訊樣本即可重現一致的聲音特徵,並內建同意驗證、SynthID浮水印與C2PA憑證以保護開發者與配音者權益;使用者也能儲存並管理自訂聲音,確保長期專案輸出穩定不飄移。未來還將推出聲音混音功能,可用提示微調既有聲音的音色、音高、節奏與口音(如加入輕微南方美式口音或放緩語氣)。此系列延續Gemini Audio家族的擴張,接續先前的3.5 Live Translate、3.5 Transcribe、3.8 Live與3.8 Live Extended Thinking等產品。
💬 JudyAI Lab 觀點
Gemini家族推出兩款全新文字轉語音模型「Gemini 3.8 Flash TTS」與「Gemini 3.8 Flash-Lite TTS」,把語音生成從固定預設音檔升級成可動態創作的工作室。
從原文摘要來看,3.8 Flash TTS主打用自然語言提示從零打造角色聲音,能逐行控制演出節奏、口音轉換與應答語氣,適合遊戲與有聲書等場景;3.8 Flash-Lite TTS則鎖定大規模低成本應用。這反映出一個值得AI builder留意的設計思維:語音生成正從「選一個現成聲音」轉向「用提示詞導演聲音表演」,介面邏輯更貼近創意工具而非單純API呼叫。同時官方把聲音複製、SynthID浮水印、C2PA憑證這類同意驗證機制與功能一起推出,說明生成式語音產品在擴大能力的同時,也把身份驗證與濫用防護當成標配而非事後補救。
對想嘗試語音應用的開發者來說,可以想想:你的產品若要用到聲音克隆或角色配音功能,授權與浮水印機制要在設計初期就納入,而非事後補丁。
📅 原文資訊
- 發布時間:2026-09-23T15:25
- 來源原文:https://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/