📰 重點摘要

OpenAI週四宣布為ChatGPT桌面版新增語音支援,讓用戶可以透過對話操控AI代理並在電腦上執行任務。這項新功能採用OpenAI本月稍早推出的新一代語音模型系列「ChatGPT-Live」。OpenAI表示,ChatGPT Voice可同時搭配ChatGPT Work與Codex使用,並能調用電腦操作技能來查詢網站與應用程式;在macOS上,透過Appshots功能,用戶還能讓應用程式讀取螢幕畫面內容,包括alt-text替代文字。語音功能最初在手機版上線時,主打更流暢的對話體驗與更好的中斷處理,但當時並未支援在手機上實際執行操作。這次的桌面版更新能力更完整,用戶可以口述涉及多個步驟的複雜指令,且ChatGPT需要用戶輸入時也能即時回應。在OpenAI釋出的展示影片中,一名開發者僅用一句指令,就讓ChatGPT建立新討論串、提交pull request,並找出程式錯誤的根本原因。官方也說明,用戶可透過iOS版App以遠端連線方式,在Codex中使用ChatGPT Voice。另外,Anthropic同步更新了Claude的語音模式,可調用Opus、Sonnet、Haiku等模型,在Gmail、Calendar、Slack、Notion、Canva等應用程式中完成任務。


💬 JudyAI Lab 觀點

OpenAI為ChatGPT桌面版加入語音操控AI代理的能力,值得注意的是這已經不只是「說話回應」,而是能真正動手在電腦上完成多步驟任務,同時Anthropic的Claude語音模式也同步跟進、串接Gmail、Calendar、Slack等常用工具。

這反映出語音介面正從「輸入方式」轉型成「操作介面」的趨勢——過去語音助理主要解決打字麻煩的問題,現在則是讓AI代理直接接手執行,包括寫程式、除錯、跨應用查詢。當語音、螢幕理解(如Appshots讀取畫面)與工具呼叫三者結合,AI builder要思考的不再只是「回答得準不準」,而是「代理能不能安全、可控地完成多步驟操作」,包括中斷處理與使用者確認機制的設計。這類語音驅動代理的體驗設計,將成為下一階段產品差異化的關鍵之一。

如果你也在打造AI工具,不妨想想:你的產品有哪個操作流程,適合改成語音驅動的多步驟代理來完成?


📅 原文資訊


🔗 延伸閱讀