📰 핵심 요약
Synthesia는 AI 디지털 아바타 영상 생성에 집중하는 스타트업으로, 올해 초 기업가치가 40억 달러에 달했고 지난해 연간 반복 매출(ARR)은 1억 달러를 돌파했다. 동종 경쟁사로는 D-ID, HeyGen, Colossyan이 있다. 이 회사의 핵심 사업은 기업이 인터랙티브 AI 아바타 교육 영상을 제작하도록 돕는 것이며, ‘Roleplay Sessions’라는 신제품을 출시해 직원들이 인터랙티브 AI 아바타와 세일즈 스크립트 등의 시나리오를 연습할 수 있게 했다. 시스템은 실시간으로 응답하고 점수를 매긴다. 이 기사의 필자는 9월 뉴욕에 있는 Synthesia의 새 사무실을 방문했을 때, 자신만의 인터랙티브 디지털 아바타를 만들어 볼 기회를 얻었다. 이는 Synthesia가 (내부 직원이 아닌) 기자를 위해 이런 종류의 아바타를 제작한 첫 사례였다. 제작 과정에서 그녀는 사무실 내 소형 스튜디오에 들어가 팀이 다량의 사진을 촬영하고 2분짜리 음성 샘플을 녹음했으며, 본인 동의를 거쳐 아바타가 생성되었다. 팀은 그녀를 위해 두 종류의 정적 아바타(정해진 스크립트만 읽는, 안경 착용/미착용 버전 각각)와 두 종류의 인터랙티브 아바타(대화 가능하고 질문을 들을 수 있는, 마찬가지로 안경 착용/미착용 버전 각각)를 만들었다. 인터랙티브 아바타를 뒷받침하는 기술 스택은 음성-텍스트 변환, 영상 생성, 언어 모델, 텍스트-음성 변환 모델을 결합한 것이며, 그녀가 쓴 벤처캐피털 배경을 가진 스타트업의 사기율이 더 높다는 내용의 기사를 학습 자료로 사용해, 해당 기사와 관련된 질문에만 답할 수 있도록 했다. Synthesia는 자체 영상 및 음성 모델을 제공하지만, 고객이 Cartesia, ElevenLabs, Google 등 다른 업체의 모델을 대안으로 선택하는 것도 허용한다. 자세한 내용은 원문 링크를 참고하라.
💬 JudyAI Lab 관점
AI 디지털 아바타 영상 스타트업 Synthesia는 올해 기업가치가 40억 달러에 달했고 지난해 ARR이 1억 달러를 돌파했다. 이번에 기자가 직접 인터랙티브 아바타 제작 과정을 체험하게 한 것 자체가, “블랙박스를 외부인에게 열어 보여주는” 행보로서 주목할 만한 업계 신호다.
기사를 보면 인터랙티브 아바타의 배경에는 음성-텍스트 변환, 영상 생성, 언어 모델, 텍스트-음성 변환 모델의 조합이 있고, 학습 자료도 단 하나의 기사 범위로 한정되어 있으며 답변 범위 또한 제한되어 있다. 이는 AI 빌더들이 공통적으로 하는 선택을 보여준다: 방대한 범용 능력은 매력적으로 들리지만, 실제로 출시되는 제품은 대개 상호작용 범위를 좁혀서 아바타가 특정 자료와 맥락 안에서만 답하도록 하며, 그 대가로 제어 가능성과 신뢰성을 확보한다. 동시에 Synthesia가 고객에게 Cartesia, ElevenLabs, Google 등 외부 모델 연동을 개방한 것은, “자체 모델 + 서드파티 모델 병행"이 이런 유형의 제품에서 흔한 아키텍처로 자리잡고 있음을 보여준다. 단일 공급업체에 종속되지 않는 구조인 셈이다.
AI 제품을 만들고 있는 독자에게: 다음에 대화형 기능을 설계할 때, 이 AI가 정말로 “모든 것을 알아야” 하는지, 아니면 “명확한 범위 안으로 제한하는 것"이 오히려 더 신뢰할 수 있는지 스스로 물어보길 권한다.
📅 원문 정보
- 발행 시각: 2026-09-26T14:00
- 원문 출처: https://techcrunch.com/2026/09/26/i-created-an-interactive-digital-avatar-of-myself-and-you-can-talk-to-it/