OpenAI在2026年7月8日把ChatGPT裡的語音整組換成GPT-Live,full-duplex(可以理解成同時聽跟說、你講到一半就能打斷它),順手還能邊聽邊即時翻譯[Source: https://openai.com/index/introducing-gpt-live/]。免費帳號預設換成GPT-Live-1 mini,付費的可以用大一點的GPT-Live-1[Source: https://openai.com/index/introducing-gpt-live/]。

這幾天社群一堆人截圖它翻譯多順。但有個問題幾乎沒人回答:你要開Zoom或Google Meet跟國外客戶視訊,它到底接不接得進去?讓對面那個人也聽得到翻譯?

先把話講開:這條「線」不是只有跟客戶開會才用得上。你追一場國外的 YouTube 直播想邊看邊懂、你上一堂只有英文的線上課、你跟時區隔一個地球的遠端同事開 daily、你面試一家外商、你聽一場外語 webinar——只要聲音是從電腦裡放出來的,接法都一樣。這也是為什麼值得花五分鐘把它學會:學的是一條能到處接的線,不是一個只服務跨國業務的窄技巧。

答案是接得進去,而且今天就能接——只要你懂那條看不見的「線」在哪。這篇把接法一次講清楚,也把三個會卡住的地方攤開講,讓你不是玩個新鮮,而是明天開會、明天看直播就真的多一個能用的工具。

「另開一支手機對著講」為什麼是死路

視訊會議是雙向音訊:你要聽對方,對方也要聽你。你旁邊擺一支手機開GPT-Live翻譯,翻出來的聲音只進了你自己的耳朵—電腦這端的Zoom根本不知道有這段音訊存在,對面一個字都收不到。反過來,手機也聽不清楚Zoom喇叭放出來的對方聲音,隔著空氣還有迴音。

看 YouTube 直播、上線上課這種「只進不出」的單向場景,手機對著螢幕勉強能聽個大概,但一樣被空氣、雜訊、迴音吃掉一截準度,還騰不出手記筆記。所以「多開一臺裝置」這條路,不是難用,是從架構上就先天吃虧的。要讓翻譯真的乾淨地進到你這端,聲音得在同一臺機器內部用「線」接起來,不是隔空喊話。看懂這一點,你就已經領先大多數還在拿手機對著螢幕喊的人。

真正的接法:一條看不見的「虛擬音訊線」

關鍵字叫虛擬音訊線(virtual audio cable,可以理解成一條看不到的線,把A程式的喇叭輸出,直接當成B程式的麥克風輸入)。Mac上常見的是BlackHole或Loopback,Windows上是VB-CABLE,都有免費版[Source: https://github.com/ExistentialAudio/BlackHole]。

先把訊號怎麼走畫出來,後面每一步在幹嘛你就懂了:

1
2
3
4
5
6
7
8
你講話 →(真麥克風)→ ChatGPT 開 GPT-Live 翻譯
                          │ 翻好的聲音走「系統輸出」
              虛擬音訊線(BlackHole / VB-CABLE)
                   │                        │
     Zoom 的「麥克風」選這條線          分一份給你的耳機
                   ▼                        ▼
        對面聽到的是翻譯後的聲音        你自己也聽得到

一句話:你不是對著Zoom講話,是讓GPT-Live翻完的聲音「假裝成你的麥克風」,Zoom以為那就是你在說話,對面就聽得到了。下面照做,Mac大概五分鐘。

Mac版(BlackHole,免費)

  1. 裝BlackHole。到官方GitHub下載BlackHole 2ch安裝,或用Homebrew一行brew install blackhole-2ch;裝之前先把正在放聲音的App關掉[Source: https://github.com/ExistentialAudio/BlackHole]。
  2. 開「音訊MIDI設定」(Audio MIDI Setup,在 應用程式 → 工具程式 裡)。左下角按 +,建一個「多重輸出裝置」(Multi-Output Device),把BlackHole和你自己的耳機/喇叭兩個都勾起來——這一步就是為了讓你自己也聽得到。
  3. 在同個視窗右鍵那個多重輸出,選「將此裝置用於聲音輸出」。系統的聲音會同時分一份給BlackHole、一份給你耳朵。
  4. 到Zoom → 設定 → 音訊,把「麥克風」下拉選成BlackHole 2ch,喇叭維持你的耳機。Google Meet、Teams也一樣,在音訊設定裡把麥克風選BlackHole。
  5. 測一次:ChatGPT開GPT-Live講一句讓它翻,Zoom設定頁的麥克風音量條會跳動,就代表對面收得到了。

兩個坑先講,免得你白弄半天:一,建多重輸出時別拿AirPods當「主要」裝置,它取樣率低會讓整組破音,主要裝置用內建喇叭或BlackHole 2ch就好[Source: https://github.com/ExistentialAudio/BlackHole]。二,這個免費做法是「整臺系統的聲音」都會灌進麥克風,所以開會時記得把會叮咚叫的通知、背景音樂關掉;如果你想只讓ChatGPT這一個App的聲音進去、別的都不進,那要用付費的Loopback做單一App路由。

Windows版(VB-CABLE,免費)

  1. 下載VB-CABLE,解壓後用「系統管理員身分」執行VCCABLE_Setup_x64.exe,裝完重開機讓系統認得這條線[Source: https://help.livevoice.io/article/146-using-vb-audio-virtual-cable-to-send-audio-from-zoom-or-ms-teams-to-livevoice]。
  2. 把要翻的聲音導進這條線:到 設定 → 系統 → 聲音 → 音量混音器,把ChatGPT(或你的瀏覽器)那一條的輸出裝置單獨指到CABLE Input,其他App就不受影響。
  3. 到Zoom → 設定 → 音訊,把「麥克風」選成CABLE Output[Source: https://help.livevoice.io/article/146-using-vb-audio-virtual-cable-to-send-audio-from-zoom-or-ms-teams-to-livevoice]。
  4. 想自己也聽得到:到「聲音控制台 → 錄製 → CABLE Output → 內容 → 接聽」,勾「接聽此裝置」並指定你的耳機;或裝同一家免費的VoiceMeeter,把聲音同時分給耳機和Zoom。
  5. 一樣測一句,看Zoom麥克風音量條有沒有跳。

只想單向聽一場外語直播、上一堂英文課?那更省事:你根本不用管「送回Zoom」那半段,把來源聲音用同一條虛擬線餵給GPT-Live讓它翻給你聽就好,對外那段直接跳過。同一條線,會議兩頭接、純聽接一頭,學一次到處能用。

老實說一句:真正麻煩的是「雙向」——同一場會議裡,既要把你的話翻給對方、又要把對方的話翻回給你,等於要再拉第二條線把Zoom收到的聲音倒餵進GPT-Live,還得閃開迴音迴圈。這關不好過,所以後面談三個卡點時我會建議:雙向、多人、又要準的場合,別硬用GPT-Live單扛,配一個專門的會議翻譯工具更省事。先從上面「你說、對方聽翻譯」這條穩的路開始,就已經比多數人早半步。

這段是真正能動手、而且今天就能兜起來的部分。它靠的是作業系統層的音訊路由,不是等哪個官方功能上線。也就是說,就算GPT-Live現在還沒開放開發者API(官方只說即將開放、沒給日期也沒給定價[Source: https://openai.com/index/introducing-gpt-live/]),你也不必乾等——虛擬音訊線本身就是那個「先用起來」的解法。

沒有API,開發者現在能做什麼

想拿GPT-Live做產品的人看到「沒有API」會直覺覺得沒戲,但這件事要分兩層看。

第一層,官方API還沒開,你確實沒辦法把GPT-Live當後端服務去程式化呼叫。第二層——也是多數人漏掉的——你要交付的「即時語音翻譯」這個結果,不一定非得等它的API。虛擬音訊線這條路本身就能被包成一套可重複的內部工作流:固定好路由、寫成一份設定指令碼、配上現成的會議或直播轉錄工具,就是一個今天能交付給團隊、給客戶、甚至做成給一般使用者的流程,不必卡在等一個沒有日期的API上。

而且需求早就被驗證過了,而且遠不只商務會議。像Felo這類專門掛在音訊上的工具,已經在做用ChatGPT/OpenAI替Zoom、Google Meet、Teams做即時雙語字幕與轉錄,連YouTube直播都一起覆蓋[Source: https://chromewebstore.google.com/detail/felo-subtitles-chatgpt-li/ponokiofkijoolhebggofhhibnafebna?hl=zh-CN]。換句話說,「AI掛進聲音流做即時翻譯」涵蓋的是開會、上課、看直播一整片人的需求,不是還要你去教育市場的新概念,是已經有人在跑的成熟需求。你要做的不是從零證明它有沒有人要,而是把體驗做得比現有工具更貼你的場景。

等哪天API真的開了,你今天摸熟的音訊路由、會議與直播整合、延遲取捨這些工,一分都不會白費——它們正是那時候你能立刻跑得比別人快的底子。

三個會卡住的地方:延遲、口音、術語

接得起來,不等於順。真正決定這套能不能用的,是三件事。先知道它們,你就能在開會、開播前先把場景挑對,而不是當場出糗。

延遲最需要注意。OpenAI到現在沒有公佈任何GPT-Live的首字延遲或落後秒數[Source: https://openai.com/index/introducing-gpt-live/]。即時語音翻譯本來就會有時間差—它得先聽完一句、丟給模型翻、再念出來,這條路徑天生就慢半拍。在一對一慢慢聊、或單向聽一場直播時可以忍,但在一場你來我往的多人會議裡,只要每句話都被拉開一截,整場節奏就容易垮掉。具體會差幾秒?官方沒給,我們也不編,等它公佈或有可信實測再補。實務上的解法很簡單:先用在一對一、單向觀看、或步調慢的場合,把它的長處吃滿。

口音跟語言覆蓋是第二關。OpenAI自己揭露,除了「大多數常用語言」,其他語言會有非母語口音跟流利度不足,完整的多語言對等在上市時「明確列為未達成」[Source: https://openai.com/index/introducing-gpt-live/]。所以你的會議或那場直播如果是英、日、韓這種大語言,體感會好很多;越冷門的語言,越容易出戲。挑對語言,這關就過大半。

專業術語是第三關,而且沒有官方資料,只能靠推理。GPT-Live把難題背景丟給後面的文字模型邊講邊算,一般對話、一般直播夠用;但財報數字、法律條款、醫療名詞、技術規格這種不能翻錯一個字的場景,判斷是—它可以當輔助,但你不能把它當唯一那份逐字稿。這也是為什麼在持續進行的真實對話裡,專用即時翻譯工具反而更穩:像Zoom、Google Meet這類會議本身就有的即時翻譯字幕[Source: https://support.google.com/meet/answer/10964115?hl=zh-Hant&co=GENIE.Platform%3DDesktop][Source: https://www.timekettle.co/blogs/tips-and-tricks/how-to-translate-zoom-or-google-meet-conversations-in-real-time],或Felo這類專門掛在會議與直播上的轉錄翻譯工具[Source: https://chromewebstore.google.com/detail/felo-subtitles-chatgpt-li/ponokiofkijoolhebggofhhibnafebna?hl=zh-CN],守得住「只翻譯」這個角色,還會留給你一份能回看的雙語逐字稿——這對事後要整理會議記錄、複習課程重點的人特別實用。聰明的接法是兩個一起上:GPT-Live顧即時對話的順,專用工具顧那份可回查的準。

還有一個容易踩的期待:GPT-Live(其實OpenAI任何一個介面)都沒辦法幫你撥一般電話號碼做翻譯通話,那是完全另一類產品[Source: https://openai.com/index/introducing-gpt-live/]。想接電話的,別等它,直接找對的工具。

所以現在到底能不能用

能,而且門檻比你想的低。想先玩手感,就在ChatGPT語音裡直接開GPT-Live試翻譯;要真的接進Zoom、接進你在看的那場直播,去查你系統對應的虛擬音訊線(Mac找BlackHole、Windows找VB-CABLE),把上面那條「假裝成麥克風」的路兜起來——會議就兩頭接、單純觀看就接一頭,挑個大語言、步調慢一點的場合先跑一次。

「把GPT-Live接進你的聲音流」這件事,不管那頭是客戶、是同事、還是一場外語直播,技術上今天就接得起來,剩下的只是你有沒有先把場景挑對。虛擬音訊線那段是真的能動手,而三個卡點——延遲、冷門語言、專業術語——都不是玄學,是你事前就能繞開的已知邊界。懂了這條線怎麼接、邊界在哪,你就比同一場會議、同一場直播裡的其他人早半步:他們還在猶豫要不要開手機對著講,你已經讓翻譯乾乾淨淨進到耳朵裡了。工具會一直往前跑,但先把手弄髒、先接起來的那個人,永遠站在最能吃到下一波紅利的位置。