📰 핵심 요약
Gemini 패밀리에 두 가지 텍스트 음성 변환 모델 ‘Gemini 3.8 Flash TTS’와 ‘Gemini 3.8 Flash-Lite TTS’가 추가되어, 음성 생성을 고정된 기본 음성 파일에서 동적으로 창작 가능한 스튜디오로 업그레이드했다. Gemini Notebook, Google Vids 등 제품에서 사용 가능하다. 3.8 Flash TTS는 깊이 있는 크리에이티브 디렉팅과 캐릭터 설계를 주력으로 하며, 자연어 프롬프트로 완전히 새로운 목소리를 처음부터 만들 수 있다. 게임, 몰입형 오디오북, 팟캐스트, 인터랙티브 미디어 캐릭터까지 아우르며, 한 줄씩 연기를 제어할 수 있어 연기 지시, 리듬, 억양 전환, 응답 어조 등 세부 사항까지 다룬다. 3.8 Flash-Lite TTS는 대규모·저비용 애플리케이션 전용으로 설계되어, 대량 더빙, 오디오 콘텐츠 제작, 표현력 있는 음성 비서에 적합하며 어조, 리듬, 감정 디테일을 정밀하게 조정할 수 있다. 음성 라이브러리 측면에서는 오리지널 음성 수가 30종에서 거의 무제한으로 확장되었으며, 100개 이상의 언어와 방언에 대해 자연어 프롬프트로 음성을 디자인할 수 있도록 지원한다. 또한 멕시코 스페인어, 퀘벡 프랑스어, 스코틀랜드 영어 등 지역별 변형을 포함해 바로 상업적으로 사용할 수 있는 2,000종 이상의 음성도 제공한다. 음성 복제 기능은 단 30초 분량의 오디오 샘플만으로 일관된 음성 특성을 재현할 수 있으며, 개발자와 성우의 권익을 보호하기 위해 동의 확인, SynthID 워터마크, C2PA 인증이 내장되어 있다. 사용자는 커스텀 음성을 저장하고 관리할 수도 있어 장기 프로젝트에서 안정적이고 흔들림 없는 출력을 보장한다. 향후에는 음성 믹싱 기능도 출시될 예정으로, 프롬프트를 통해 기존 음성의 음색, 음높이, 리듬, 억양을 미세 조정할 수 있다(예: 가벼운 남부 미국 억양 추가, 말투를 느리게 조정 등). 이 시리즈는 Gemini Audio 패밀리의 확장을 이어가는 것으로, 앞서 출시된 3.5 Live Translate, 3.5 Transcribe, 3.8 Live, 3.8 Live Extended Thinking 등의 제품군을 잇는다.
💬 JudyAI Lab 관점
Gemini 패밀리가 새로운 텍스트 음성 변환 모델 두 가지, ‘Gemini 3.8 Flash TTS’와 ‘Gemini 3.8 Flash-Lite TTS’를 출시하며 음성 생성을 고정된 기본 음성 파일에서 동적으로 창작 가능한 스튜디오로 업그레이드했다.
원문 요약을 보면, 3.8 Flash TTS는 자연어 프롬프트로 캐릭터 음성을 처음부터 만드는 데 주력하며, 한 줄씩 연기의 리듬, 억양 전환, 응답 어조까지 제어할 수 있어 게임과 오디오북 같은 시나리오에 적합하다. 3.8 Flash-Lite TTS는 대규모·저비용 애플리케이션을 겨냥한다. 이는 AI 빌더가 주목할 만한 설계 사고를 보여준다 — 음성 생성이 “기존 음성 중 하나를 고르는 것"에서 “프롬프트로 음성 연기를 연출하는 것"으로 전환되고 있으며, 인터페이스 로직이 단순한 API 호출보다는 크리에이티브 도구에 더 가까워지고 있다. 동시에 공식적으로 음성 복제, SynthID 워터마크, C2PA 인증 같은 동의 확인 메커니즘을 기능과 함께 출시했다는 점은, 생성형 음성 제품이 능력을 확장하는 동시에 신원 인증과 오남용 방지를 사후 보완이 아닌 기본 사양으로 다루고 있음을 보여준다.
음성 애플리케이션을 시도해보려는 개발자라면 한 가지 생각해볼 만하다: 제품에 음성 복제나 캐릭터 더빙 기능을 사용할 계획이라면, 라이선스와 워터마크 메커니즘을 사후 패치가 아니라 설계 초기 단계부터 반영해야 한다.
📅 원문 정보
- 발행 시각: 2026-09-23T15:25
- 원문 출처: https://deepmind.google/blog/say-hello-to-gemini-38-text-to-speech/