📰 重點摘要
Synthesia是一家專注於AI數位分身影片生成的新創公司,今年稍早估值已達40億美元,去年年化經常性收入(ARR)突破1億美元,同類競爭對手包括D-ID、HeyGen與Colossyan。該公司主要業務是協助企業製作互動式AI分身訓練影片,並推出名為Roleplay Sessions的新產品,讓員工能與互動式AI分身練習銷售話術等場景,系統會即時回應並評分。文章作者於九月受邀參觀Synthesia在紐約的新辦公室時,獲邀為自己打造一個互動式數位分身,這是Synthesia首次為記者(而非公司內部人員)製作此類分身。製作過程中,她進入辦公室內的迷你攝影棚,由團隊拍攝大量照片並錄製兩分鐘語音樣本,經本人同意後生成分身。團隊為她做了兩種靜態分身(僅朗讀既定腳本,分別配戴眼鏡與否版本),以及兩種互動式分身(可對話、可聆聽提問,同樣分眼鏡與否版本)。互動分身背後技術堆疊結合語音轉文字、影像生成、語言模型與文字轉語音模型,並以她一篇關於創投背景新創詐欺率較高的報導為訓練素材,僅能回答與該篇文章相關的問題。Synthesia自家提供影音與語音模型,但也允許客戶選用Cartesia、ElevenLabs、Google等其他廠商的模型作替代方案。詳細內容請見原文連結。
💬 JudyAI Lab 觀點
Synthesia這家AI數位分身影片新創,今年估值已達40億美元,去年ARR突破1億美元,現在讓記者親身體驗製作互動式分身的過程,這種「開啟黑箱給外部人看」的做法本身就是一則值得關注的產業訊號。
從報導可以看到,互動式分身背後是語音轉文字、影像生成、語言模型與文字轉語音模型的組合,而且訓練素材被限定在單一篇文章範圍內,回答範圍也被鎖定。這反映出AI builder普遍在做的取捨:寵大的通用能力聽起來吸引人,但實際落地的產品往往選擇把互動範圍收窄,讓分身只能在特定素材與情境內對答,以換取可控性與可信度。Synthesia同時開放客戶接入Cartesia、ElevenLabs、Google等外部模型,也顯示出「自家模型+第三方模型並存」正成為此類產品的常見架構,而非單一供應商繫結。
給正在打造AI產品的讀者:下次設計對話型功能時,不妨先問自己——這個AI真的需要「無所不知」,還是「把它限定在一個明確範圍內」反而更可靠?
📅 原文資訊
- 發布時間:2026-09-26T14:00
- 來源原文:https://techcrunch.com/2026/09/26/i-created-an-interactive-digital-avatar-of-myself-and-you-can-talk-to-it/