📰 핵심 요약

Gemini가 오늘 두 가지 새로운 실시간 음성 모델을 선보였습니다. Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking으로, 거의 실시간에 가까운 추론 능력을 내세워 음성 어시스턴트를 더 자연스러운 대화에 가깝게 만듭니다. 3.8 Live는 규모 확장성과 비용 효율성에 초점을 맞춰 대화 지능, 매끄러운 대응, 시각적 이해 능력을 결합했습니다. Extended Thinking 버전은 고난도 작업에 특화되어 다단계 추론을 강화했습니다.

성능 면에서, 3.8 Live Extended Thinking은 Artificial Analysis의 Speech to Speech Quality Index에서 종합 1위(82.6점)를 차지했으며, 에이전트 작업 완수도에서도 우수한 성적을 보였습니다. τ-Voice 테스트에서 68.6%, Sierra 은행 업무 시나리오의 τ-Voice-banking 테스트에서는 35.1%를 기록했습니다. 추론 능력 면에서는 Big Bench Audio 테스트에서 97.7%라는 높은 점수를 받았으며, 동시에 최전선 모델 대비 경쟁력 있는 가격을 유지했습니다. 3.8 Live는 Speech Agent Arena 사용자 선호도에서 2위를 기록했고, 마찬가지로 높은 비용 효율성을 유지해 개발자와 기업의 대규모 배포에 적합합니다. 두 모델 모두 ServiceNow의 EVA-Bench 음성 어시스턴트 평가에서 복잡한 워크플로우 시나리오에 대해 정확도와 대화 품질의 균형을 성공적으로 맞추며 파레토 프론티어를 한 단계 끌어올렸습니다.

기능 면에서, 3.8 Live는 시각 입력을 거의 실시간으로 처리해 대화 맥락을 풍부하게 하고, 대화 도중 지원되는 97개 언어를 자동으로 감지해 전환할 수 있으며, 백그라운드에서 도구 호출과 API 요청을 실행해 모델이 먼저 사용자 요청에 응답한 뒤 백그라운드에서 작업을 완료할 수 있도록 합니다. Extended Thinking 버전은 추론과 동시에 말할 수 있어 “잠깐 확인해볼게요” 같은 구어체 표현으로 요청을 자연스럽게 이어받고, 실시간 진행 상황 설명을 통해 사용자가 다단계 백그라운드 작업의 진행 상황을 파악할 수 있도록 안내합니다. 이 두 모델은 이미 Gemini Live API를 통해 연동 가능하며, Agora, LangChain, LiveKit 등의 개발 플랫폼에서 사용할 수 있습니다.


💬 JudyAI Lab 관점

Gemini가 출시한 3.8 Live와 3.8 Live Extended Thinking은 “실시간 음성"과 “심층 추론"을 두 개의 제품 라인으로 분리했는데, 이 분업 자체가 AI 관찰자들이 주목할 만한 지점입니다.

저희가 보는 흐름은, 음성 어시스턴트의 경쟁이 더 이상 응답 속도만 겨루는 것이 아니라 “생각하면서 동시에 말할 수 있는가"를 겨루는 방향으로 가고 있다는 것입니다. Extended Thinking은 “잠깐 확인해볼게요” 같은 구어체 표현으로 요청을 이어받는 동시에 백그라운드에서 도구 호출을 실행하여, 사용자가 원래 참아야 했던 대기감을 진행 상황을 전달받는 경험으로 바꿔놓습니다. 이런 지연 시간 시각화 설계 사고방식은 에이전트 계열 제품을 만드는 모든 팀에게 시사하는 바가 있습니다. 성능 수치 외에도, 대기 시간 동안 어떻게 소통하느냐가 마찬가지로 체험의 좋고 나쁨을 결정한다는 것입니다.

만약 여러분의 제품에도 긴 작업 대기 시나리오가 있다면, 사용자가 빈 화면을 멍하니 기다리게 하지 말고 진행 상황 안내 한 줄을 추가할 수 있을지 고민해보는 것도 좋을 것 같습니다.


📅 원문 정보


🔗 더 읽어보기