📰 重點摘要
這則 Gemini 3.8 Live Avatar 新聞屬於一般 AI 產業動態,與目前工作目錄的專案脈絡無直接關聯,直接產出翻譯摘要:
Google DeepMind 於今日推出 Gemini 3.8 Live 搭配 Live Avatar 功能,延續上週 Gemini 3.8 Live 發布的動能,為原生即時對話模型加入近即時視覺形象。透過將近即時影像生成與語音配對,Live Avatar 能打造出具動態視覺人格的角色,同時具備聽、看、說的能力。該功能具備精準嘴型同步、自然表情與流暢的對話輪替,讓企業能以更具互動性的方式擴展虛擬服務,無論是客服互動或互動式導覽,都能轉化為更豐富、更易理解的數位溝通體驗。即日起,Gemini 3.8 Live with Live Avatar 已在 Gemini Enterprise 上架。技術層面上,系統同時處理視覺與音訊輸入,生成更豐富的對話內容;並支援非同步工具呼叫,讓 Live Avatar 能在維持對話不中斷的情況下,於背景觸發工具呼叫並擷取資料,處理複雜任務,例如展示的飯店旅客報到情境。多語言方面,該功能具備原生多語言語音對語音同步能力,可動態調整嘴型與表情,在 97 種語言之間無縫切換,且不會降低影像品質或產生視覺漂移。品牌客製化部分,企業除了可使用預設的多樣化虛擬形象庫外,也能以高品質參考圖像生成完全動畫化、可回應的客製化虛擬形象,同時保留參考圖像的相似度、品牌風格或角色身分特徵,不過客製化虛擬形象目前僅開放給企業白名單申請使用。
💬 JudyAI Lab 觀點
Gemini 3.8 Live搭配Live Avatar上線,把即時對話AI從「聽得懂、答得對」推進到「看起來也像在回應」,是這波多模態競賽裡一個值得記錄的節點。
這則案例反映的重點不是虛擬人有多逼真,而是企業級AI互動正從純文字/語音介面,轉向同時處理視覺與音訊輸入、並支援背景非同步工具呼叫的複合系統。像飯店報到這類場景需要AI在對話不中斷下悄悄查資料、跑流程,這種「前臺自然對話、後臺默默做事」的設計思維,才是真正決定產品能不能落地的關鍵,而不只是嘴型同步或97種語言切換這類表層功能。對AI builder來說,這提醒我們評估一個新發布時,除了看展示效果,更該看它的工具串接與多工處理能力是否經得起真實業務流程考驗。
下次評估類似產品時,不妨先問:它的背景工具呼叫機制能撐住多複雜的任務?
📅 原文資訊
- 發布時間:2026-09-24T16:20
- 來源原文:https://deepmind.google/blog/introducing-gemini-38-live-with-live-avatar/