📰 重點摘要
Gemini今天推出兩款新的即時語音模型:Gemini 3.8 Live與Gemini 3.8 Live Extended Thinking,主打接近即時的推理能力,讓語音助理更貼近自然對話。3.8 Live鎖定規模化與成本效益,結合對話智能、流暢應對與視覺理解能力;Extended Thinking版本則專攻高複雜度任務,強化多步驟推理。
在效能表現上,3.8 Live Extended Thinking在Artificial Analysis的Speech to Speech Quality Index拿下總排名第一(82.6分),在代理任務完成度方面表現領先,τ-Voice測試達68.6%,Sierra銀行業場景的τ-Voice-banking測試則為35.1%;推理能力方面,Big Bench Audio測試得分高達97.7%,同時維持相對前沿模型有競爭力的定價。3.8 Live在Speech Agent Arena用戶偏好度排名第二,同樣維持高成本效益,適合開發者與企業規模化部署。兩款模型在ServiceNow的EVA-Bench語音助理評測中,於複雜工作流程場景成功平衡準確度與對話品質,推進了帕累托前緣。
功能面上,3.8 Live可近乎即時處理視覺輸入以豐富對話脈絡,自動偵測並在對話中途切換支援的97種語言,並能在背景執行工具呼叫與API請求,讓模型可先回應用戶請求同時背景完成任務。Extended Thinking版本則可邊推理邊說話,用「讓我確認一下」等口語提示自然承接請求,並透過即時進度敘述引導用戶了解多步驟背景任務的進展。這兩款模型已可透過Gemini Live API串接,供Agora、LangChain、LiveKit等開發平台使用。
💬 JudyAI Lab 觀點
Gemini推出的3.8 Live與3.8 Live Extended Thinking,把「即時語音」跟「深度推理」拆成兩條產品線,這個分工本身就值得AI觀察者留意。
我們看到的趨勢是,語音助理的競爭不再只比回答快不快,而是比能不能邊想邊說。Extended Thinking用「讓我確認一下」這類口語承接請求,同時背景執行工具呼叫,把使用者原本要忍受的等待感,轉化成被交代進度的體驗。這種延遲視覺化的設計思維,對任何在做agent類產品的團隊都是提醒:效能數字之外,等待期間怎麼溝通,同樣決定體驗好壞。
如果你的產品也有長任務等待場景,不妨想想能不能加一句進度提示,而不是讓使用者對著空白畫面乾等。
📅 原文資訊
- 發布時間:2026-09-15T17:05
- 來源原文:https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking/