📰 重點摘要

不動明王,等等——這是一則翻譯任務,直接處理。

Google 在部落格分享其語言普及進展:目前旗下技術與產品已支援超過300種語言,覆蓋逾70億使用人口,佔全球人口86%。文章回顧Google Translate自2006年推出以來,語言數已從最初少數幾種擴增至逾250種。文中指出,單純的文字翻譯並不足夠,真正的溝通還涉及語氣、節奏、情緒與語境等元素,而傳統語音辨識系統採用「語音轉文字→處理→再合成語音」的多步驟流程,會流失這些人類溝通中最豐富的部分,例如笑聲、話語重疊、猶豫停頓,以及像西班牙語混英語(Spanglish)、印地語混英語(Hinglish)這類語碼混雜現象。

為此,Google將研發重心轉向「原生音訊智慧」,讓Gemini等模型直接處理音訊本身,同時掌握聲音與語意兩個層面。具體成果包括:Gemini 3.5 Live Translate已支援70種語言、超過2,000組語言配對的即時口語翻譯,並能自然捕捉語碼混雜與情緒線索;Gemini 3.5 Transcribe是目前最精準的語音轉文字模型,即使在嘈雜環境或專業術語較多的情境下,也能將原始音訊轉為格式工整的文字,該技術也應用於Android Gboard的Rambler功能,可自動去除贅字、修正文法標點,並支援語音編輯改寫與語言間無縫切換。此外,Google啟動「千種語言倡議」,目標支援全球最常用的1,000種語言,其核心的Universal Speech Model以1,200萬小時音訊訓練而成,運用跨語言遷移學習技術,將資源豐富語言中學到的能力,轉移應用到資源稀缺語言的語音理解上。


💬 JudyAI Lab 觀點

這則新聞在講Google把翻譯技術重心從「文字」轉向「原生音訊」,讓AI直接聽懂聲音裡的語氣與情緒,而不只是轉出文字。

單純把語音轉文字再處理再合成語音,這個多步驟流程會流失掉人類溝通中最真實的部分——笑聲、停頓、語碼混雜(像西班牙語混英語、印地語混英語)都在轉換過程中消失。Google的解法是讓Gemini這類模型直接吃音訊本身,同時處理聲音跟語意兩層資訊,例如Gemini 3.5 Live Translate已支援70種語言、超過2,000組語言配對即時口語翻譯,能自然抓到情緒線索與語碼混雜。這反映一個設計思維上的轉變:AI產品要更貼近真實使用情境,光是把任務拆成多個獨立步驟串起來,反而會犧牲掉最關鍵的細節,把處理管線往「端對端」收斂,才更能保留原始訊號裡的資訊。

如果你的產品也有語音或多語處理需求,可以想想現有流程裡哪一段轉換正在偷偷丟失資訊。


📅 原文資訊


🔗 延伸閱讀