📰 重點摘要
Google DeepMind推出突破性的手語轉文字(sign-language-to-text, SL2T)模型,這是一款大規模多語言AI模型,首度將手語辨識技術從實驗室帶入消費級產品。該模型已整合進Pixel 11的Gboard輸入法與Live Transcribe即時字幕App,率先支援美國手語(ASL)轉英文,未來將擴展至更多裝置與更多手語語種。此功能讓聾人與重聽使用者能透過對手機比手語來取代打字,可用於網頁搜尋、撰寫訊息與文件、向Gemini下達查詢或執行任務;在Live Transcribe中也能直接以手語回應對話,不必再靠文字來回輸入。根據測試者反饋,用ASL比手語比打英文字更快、更自然、體驗也更好。
技術上,手語翻譯比語音轉文字困難得多,主要有兩個核心挑戰:第一,語音轉文字只是同一語言內「聲音對應文字」的序列映射,但手語是擁有獨立文法與詞彙的自然語言,因此需要真正的機器翻譯而非單純的手勢對詞彙轉換;第二,模型必須學會「看懂」並理解人體物理動作——手語同時透過手部、手臂、軀幹、頭部與臉部表情傳遞語意,要以高幀率精準追蹤這些動作是相當困難且複雜的電腦視覺問題。
目前全球超過200種手語、約7000萬聾人與重聽使用者長期未被語音AI技術浪潮觸及,此次DeepMind的突破被視為填補這項落差的重要一步。詳細技術細節請見原文連結。
💬 JudyAI Lab 觀點
需求商淺,直接寫。
Google DeepMind推出手語轉文字(SL2T)模型,首度把手語辨識帶進消費級產品,已整合進Pixel 11的Gboard與Live Transcribe,率先支援美國手語轉英文。這件事值得AI builder留意,因為它示範了「被主流語音AI浪潮忽略的族群」也能成為突破口——全球超過200種手語、約7000萬聾人與重聽使用者長期沒有被服務到。
技術上真正難的不是辨識手勢,而是兩件事:手語有獨立文法,必須做真正的機器翻譯而非詞彙對應;加上要即時追蹤手部、軀幹、表情等多重視覺訊號,對電腦視覺是硬仗。這提醒做產品的人,往往「被忽略的使用情境」比「更強的模型」更值得投入——測試者反饋用手語比打字更快更自然,說明介面貼合使用者的真實動作,體驗提升可能比堆引數更直接。
如果你在做AI產品,可以想想:你的使用者裡有沒有一群人,正被迫用「不自然」的輸入方式將就你的系統。
📅 原文資訊
- 發布時間:2026-08-12T14:01
- 來源原文:https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/