📰 핵심 요약
이 뉴스는 Google DeepMind 블로그에서 발췌한 것으로, 내부 자료가 아니며 원문을 직접 번역해 전달합니다:
Google이 정밀하고 지능적인 음성 인식 기능을 내세운 새로운 음성-텍스트 변환 모델 Gemini 3.5 트랜스크라이브를 출시했습니다. 이미 Gemini 앱, Android Rambler, macOS Gemini 앱 등 여러 제품에 적용되었으며, 이제 개발자도 Gemini API(Google AI Studio)와 Gemini Enterprise Agent Platform을 통해 사용할 수 있습니다. 이 모델은 두 가지 API 형태로 제공됩니다: 실시간 스트리밍 버전인 gemini-3.5-transcribe-live는 Live API를 통해 초 단위 미만의 지연 시간으로 양방향 스트리밍을 제공하여 음성 비서와 실시간 자막 제작에 적합하며, 사전 녹음 음성용 버전인 gemini-3.5-transcribe는 Interactions API를 통해 회의록, 통화 기록 등의 녹음을 처리하고 화자 구분 및 어절 단위 타임스탬프를 지원합니다. 주요 기능으로는 의미 기반 지능형 수정(예: “화요일에 봐요—아니, 수요일이요"와 같은 발화를 자동으로 수정)과 “음”, “어” 같은 군더더기 표현 자동 제거가 있으며, 함수 호출(function calling)을 지원해 이미지 생성이나 파일 분석 같은 작업을 다른 Gemini 모델로 넘길 수 있습니다(현재는 macOS 앱에서만 지원). 인식 과정에서 사용자 지정 어휘를 지원해 전문 용어나 특수한 철자에도 적응할 수 있으며, 85개 이상의 언어를 지원해 다양한 억양과 방언을 자동으로 감지하고 처리할 수 있습니다. 사전 녹음 음성의 경우 최대 세 명의 화자를 식별하고 타임스탬프를 표시할 수 있습니다(세 명 이상은 실험적 기능). Artificial Analysis의 테스트 결과에 따르면 단어 오류율(WER) 기준으로 스트리밍 모드는 평균 4.0%, 비스트리밍 모드는 평균 2.6%를 기록했으며, 소음이 있는 환경에서도 우편번호나 주문 번호와 같은 영숫자 혼합 콘텐츠를 정확하게 인식할 수 있습니다. 이전 모델인 Chirp 3와 비교했을 때 새 모델은 인식 정확도와 지연 시간 모두에서 뚜렷한 개선을 보였습니다.
💬 JudyAI Lab 관점
⏳ 코멘터리 보완 예정 (Hermes가 finalize_commentary 단계에서 추가하며, 사실 기반으로 작성하고 추측을 덧붙이지 않습니다)
📅 원문 정보
- 발행 시간:2026-08-26T17:01
- 원문 출처:https://deepmind.google/blog/intelligent-transcription-with-gemini-3-5-transcribe/