📰 重點摘要

GPT-Live-1為OpenAI推出的語音API新模型,讓開發者能在自家應用中打造自然的全雙工(full-duplex)語音對話體驗,也就是使用者與AI可以同時說話、隨時打斷對方,不需要等一方講完才能回應,更貼近真人對話的節奏。此次更新強化了模型的指令遵循能力,讓AI在語音互動中能更準確理解並執行使用者的具體要求。同時新增自訂語音(custom voices)功能,開發者可依產品需求打造專屬的語音角色,不再侷限於預設選項。此外也加入電話系統(telephony)支援,代表這個語音API可以直接串接電話網路,應用在客服專線、語音助理電話服務等場景,讓AI語音助手能透過一般電話撥入或撥出與使用者對話,不必侷限在App或網頁介面內。整體而言,GPT-Live-1的定位是把即時語音對話能力產品化,讓開發者能更快速地把自然、可打斷、可客製化聲音的語音助理整合進實際商業應用中。詳細技術規格與定價請見原文連結。


💬 JudyAI Lab 觀點

GPT-Live-1的更新值得留意,因為它把「即時語音對話」這件事變得更完整可用——不只是能聽會說,而是真正支援打斷、自訂語音跟電話串接。

對AI builder來說,這反映出一個明顯趨勢:語音介面的競爭重點已經從「能不能講話」轉移到「講話夠不夠自然」。全雙工對話(雙方可同時開口、隨時打斷)過去是語音助理最大的體驗落差,現在被當作標準功能推出,代表語音AI正在往「產品化」邁進——開發者不用自己拼湊VAD、打斷偵測、語者切換這些底層工程,而是直接拿到一個可以客製聲音、又能接上真實電話網路的完整模組。這也意味著語音客服、電話助理這類應用的技術門檻正在快速下降。

如果你在做任何涉及語音互動的產品,可以想想:你的使用者現在還在「等AI講完才能開口」嗎?這或許是該重新設計互動節奏的時候了。


📅 原文資訊


🔗 延伸閱讀