OpenAI는 2026년 7월 8일 ChatGPT의 음성 기능 전체를 GPT-Live로 교체했습니다. full-duplex(동시에 듣고 말할 수 있다는 뜻으로, 상대가 말하는 도중에 끼어들 수도 있습니다) 방식이며, 듣는 동시에 실시간 통역까지 가능합니다[Source: https://openai.com/index/introducing-gpt-live/]. 무료 계정은 기본적으로 GPT-Live-1 mini로 전환되고, 유료 계정은 더 큰 모델인 GPT-Live-1을 사용할 수 있습니다[Source: https://openai.com/index/introducing-gpt-live/].
요 며칠 커뮤니티에는 이 통역이 얼마나 매끄러운지 캡처한 글이 넘쳐납니다. 하지만 거의 아무도 답하지 않는 질문이 하나 있습니다. Zoom이나 Google Meet으로 해외 고객과 화상회의를 할 때, 이걸 정말로 연결할 수 있을까요? 상대방도 그 통역을 들을 수 있게 만들 수 있을까요?
먼저 짚고 넘어가겠습니다. 이 “선"은 고객과 회의할 때만 쓰이는 게 아닙니다. 해외 유튜브 라이브 방송을 실시간으로 이해하며 보고 싶을 때, 영어로만 진행되는 온라인 강의를 들을 때, 지구 반대편 시차의 원격 동료와 데일리 미팅을 할 때, 외국계 기업 면접을 볼 때, 외국어 웨비나를 들을 때—컴퓨터에서 소리가 나오는 상황이라면 연결 방법은 모두 동일합니다. 그래서 5분을 들여 이걸 익혀둘 가치가 있는 겁니다. 배우는 건 어디에나 연결할 수 있는 하나의 “선"이지, 해외 영업만을 위한 좁은 기술이 아니니까요.
답은 “연결할 수 있다"이고, 그것도 오늘 당장 연결할 수 있습니다. 보이지 않는 그 “선"이 어디 있는지만 알면 됩니다. 이 글은 연결 방법을 한 번에 명확히 설명하고, 막히기 쉬운 세 가지 지점도 펼쳐서 다뤄, 단순히 신기한 걸 만져보는 데서 그치지 않고 내일 회의, 내일 라이브 시청에서 정말로 쓸 수 있는 도구를 하나 더 갖추도록 돕습니다.
“핸드폰을 하나 더 켜서 대고 말하기"가 막다른 길인 이유
화상회의는 양방향 오디오입니다. 당신은 상대의 말을 들어야 하고, 상대도 당신의 말을 들어야 합니다. 옆에 핸드폰을 하나 두고 GPT-Live로 통역을 돌리면, 통역된 소리는 당신 자신의 귀로만 들어갑니다. 컴퓨터 쪽 Zoom은 이 오디오가 존재하는지조차 알지 못하고, 상대방은 한 글자도 받지 못합니다. 반대로 핸드폰도 Zoom 스피커에서 나오는 상대의 목소리를 제대로 알아듣지 못합니다. 공기를 통해 전달되는 데다 에코까지 섞이기 때문입니다.
유튜브 라이브나 온라인 강의처럼 “듣기만 하고 말하지 않는” 단방향 상황이라면, 핸드폰을 화면에 대는 방식으로 대략적인 내용은 알아들을 수 있습니다. 하지만 이 역시 공기, 잡음, 에코에 정확도를 어느 정도 빼앗기고, 필기할 손도 남지 않습니다. 그러니 “기기를 하나 더 켜는” 이 방법은 쓰기 어려운 정도가 아니라, 구조적으로 처음부터 불리한 방식입니다. 통역이 정말로 깔끔하게 당신 쪽으로 들어오려면, 소리는 같은 기기 안에서 “선"으로 연결되어야지, 공중에 대고 외치는 방식이어서는 안 됩니다. 이 점을 이해하면 여전히 핸드폰을 화면에 대고 외치고 있는 대다수 사람들보다 이미 한 발 앞서게 됩니다.
진짜 연결 방법: 보이지 않는 “가상 오디오 케이블”
핵심 키워드는 가상 오디오 케이블(virtual audio cable, 보이지 않는 선으로 A 프로그램의 스피커 출력을 그대로 B 프로그램의 마이크 입력으로 만들어준다고 이해하면 됩니다)입니다. Mac에서 흔히 쓰이는 것은 BlackHole이나 Loopback이고, Windows에서는 VB-CABLE이며, 모두 무료 버전이 있습니다[Source: https://github.com/ExistentialAudio/BlackHole].
먼저 신호가 어떻게 흘러가는지 그려보면, 이후 각 단계가 무엇을 하는 건지 바로 이해될 겁니다.
| |
한 문장으로 정리하면: 당신은 Zoom에 대고 말하는 게 아니라, GPT-Live가 통역을 마친 소리가 “당신의 마이크인 척” 하도록 만드는 겁니다. Zoom은 그게 바로 당신이 말하는 소리라고 인식하고, 상대방도 들을 수 있게 됩니다. 아래대로 따라 하면 Mac 기준 대략 5분이면 됩니다.
Mac 버전(BlackHole, 무료)
- BlackHole을 설치합니다. 공식 GitHub에서 BlackHole 2ch를 내려받아 설치하거나, Homebrew로
brew install blackhole-2ch한 줄이면 됩니다. 설치 전 소리를 재생 중인 앱은 모두 꺼두세요[Source: https://github.com/ExistentialAudio/BlackHole]. - “오디오 MIDI 설정”(Audio MIDI Setup, 응용 프로그램 → 유틸리티 안에 있습니다)을 엽니다. 왼쪽 아래 +를 눌러 “다중 출력 장치”(Multi-Output Device)를 만들고, BlackHole과 자신의 헤드셋 또는 스피커 둘 다 체크합니다. 이 단계가 바로 당신 자신도 소리를 듣게 하기 위한 조치입니다.
- 같은 창에서 그 다중 출력 장치를 우클릭해 “이 장치를 사운드 출력으로 사용"을 선택합니다. 시스템 소리가 BlackHole과 당신의 귀 양쪽으로 동시에 나뉘어 전달됩니다.
- Zoom → 설정 → 오디오로 가서 “마이크” 드롭다운을 BlackHole 2ch로 선택하고, 스피커는 그대로 헤드셋으로 둡니다. Google Meet, Teams도 마찬가지로 오디오 설정에서 마이크를 BlackHole로 선택하면 됩니다.
- 한 번 테스트해 보세요. ChatGPT에서 GPT-Live를 켜고 한 문장을 통역시켜 보면, Zoom 설정 화면의 마이크 음량 표시줄이 움직이는 것으로 상대방이 수신 중임을 확인할 수 있습니다.
미리 짚어둘 함정이 두 가지 있습니다. 헛수고하지 않도록 말이죠. 첫째, 다중 출력 장치를 만들 때 AirPods를 “기본” 장치로 지정하지 마세요. 샘플링 속도가 낮아 전체가 깨진 소리가 날 수 있습니다. 기본 장치는 내장 스피커나 BlackHole 2ch로 두면 됩니다[Source: https://github.com/ExistentialAudio/BlackHole]. 둘째, 이 무료 방식은 “시스템 전체의 소리"가 마이크로 흘러 들어가므로, 회의 중에는 딩동거리는 알림이나 배경음악을 꺼두는 걸 잊지 마세요. ChatGPT 이 앱 하나의 소리만 들어가고 다른 건 들어가지 않게 하고 싶다면, 유료 Loopback으로 앱별 단일 라우팅을 설정해야 합니다.
Windows 버전(VB-CABLE, 무료)
- VB-CABLE을 내려받아 압축을 풀고, “관리자 권한"으로 VCCABLE_Setup_x64.exe를 실행합니다. 설치 후 재부팅해야 시스템이 이 케이블을 인식합니다[Source: https://help.livevoice.io/article/146-using-vb-audio-virtual-cable-to-send-audio-from-zoom-or-ms-teams-to-livevoice].
- 통역할 소리를 이 케이블로 흘려보냅니다. 설정 → 시스템 → 사운드 → 볼륨 믹서로 가서, ChatGPT(또는 브라우저)항목의 출력 장치만 단독으로 CABLE Input으로 지정합니다. 다른 앱은 영향을 받지 않습니다.
- Zoom → 설정 → 오디오에서 “마이크"를 CABLE Output으로 선택합니다[Source: https://help.livevoice.io/article/146-using-vb-audio-virtual-cable-to-send-audio-from-zoom-or-ms-teams-to-livevoice].
- 자신도 함께 듣고 싶다면 “소리 제어판 → 녹음 → CABLE Output → 속성 → 청취” 로 가서 “이 장치 청취"를 체크하고 헤드셋을 지정하세요. 또는 같은 회사의 무료 프로그램 VoiceMeeter를 설치해 소리를 헤드셋과 Zoom 양쪽으로 동시에 분배할 수도 있습니다.
- 마찬가지로 한 문장을 테스트해 Zoom 마이크 음량 표시줄이 움직이는지 확인하세요.
해외 라이브 방송을 단방향으로 듣거나, 영어 강의를 듣고 싶을 뿐이라면 더 간단합니다. “Zoom으로 다시 보내는” 절반 과정은 신경 쓸 필요가 없습니다. 원본 소리를 같은 가상 케이블로 GPT-Live에 흘려 넣어 당신에게 통역해 주게 하면 됩니다. 외부로 나가는 쪽은 그냥 건너뛰면 됩니다. 같은 케이블로 회의는 양쪽 연결, 순수 청취는 한쪽만 연결하는 식으로, 한 번 배우면 어디서든 쓸 수 있습니다.
솔직히 말하면 진짜 번거로운 건 “양방향"입니다. 같은 회의 안에서 당신의 말을 상대에게 통역해 주는 동시에, 상대의 말도 당신에게 다시 통역해 줘야 합니다. 즉 Zoom이 받은 소리를 다시 GPT-Live로 흘려 넣는 두 번째 케이블을 또 끌어와야 하고, 에코 루프도 피해야 합니다. 이 관문은 통과하기 쉽지 않습니다. 그래서 뒤에서 세 가지 병목을 다룰 때 이렇게 제안하겠습니다. 양방향에, 다인원에, 정확도까지 필요한 자리라면 GPT-Live 하나에 무리하게 의존하지 말고, 회의 전용 통역 도구를 함께 쓰는 게 더 편합니다. 먼저 위에서 다룬 “당신이 말하고 상대가 통역을 듣는” 안정적인 방식부터 시작하는 것만으로도 이미 대다수보다 반걸음 앞서게 됩니다.
이 부분은 정말로 손을 움직여 오늘 당장 완성할 수 있는 부분입니다. 이는 운영체제 차원의 오디오 라우팅에 기대는 것이지, 어떤 공식 기능이 출시되기를 기다리는 게 아닙니다. 즉 GPT-Live가 지금 개발자용 API를 열지 않았어도(공식 발표는 “곧 개방하겠다"고만 했을 뿐 날짜도 가격도 밝히지 않았습니다[Source: https://openai.com/index/introducing-gpt-live/]), 마냥 기다릴 필요는 없습니다. 가상 오디오 케이블 자체가 바로 그 “먼저 써보는” 해법입니다.
API가 없는데, 개발자는 지금 무엇을 할 수 있을까
GPT-Live로 제품을 만들고 싶은 사람들은 “API가 없다"는 말을 들으면 본능적으로 가망이 없다고 느낍니다. 하지만 이건 두 층위로 나눠 봐야 합니다.
첫 번째 층위, 공식 API가 아직 열리지 않았으니 GPT-Live를 백엔드 서비스로 프로그래밍하여 호출할 방법은 확실히 없습니다. 두 번째 층위—그리고 대부분이 놓치는 부분—당신이 전달해야 할 “실시간 음성 통역"이라는 결과물이, 반드시 이 API를 기다려야만 하는 건 아니라는 점입니다. 가상 오디오 케이블이라는 이 경로 자체가 반복 가능한 내부 워크플로로 패키징될 수 있습니다. 라우팅을 고정하고, 설정 스크립트로 작성하고, 기존의 회의나 라이브 방송 전사 도구와 결합하면, 그것만으로 오늘 당장 팀에, 고객에게, 심지어 일반 사용자에게 제공할 수 있는 프로세스가 됩니다. 날짜조차 정해지지 않은 API를 기다리는 데 발이 묶일 필요가 없습니다.
게다가 이 수요는 이미 검증되었고, 그 범위도 비즈니스 회의에 국한되지 않습니다. Felo 같은, 오디오에 특화된 도구들은 이미 ChatGPT/OpenAI를 활용해 Zoom, Google Meet, Teams용 실시간 이중언어 자막과 전사를 제공하고 있으며, 유튜브 라이브까지 함께 커버합니다[Source: https://chromewebstore.google.com/detail/felo-subtitles-chatgpt-li/ponokiofkijoolhebggofhhibnafebna?hl=zh-CN]. 다시 말해 “AI를 오디오 스트림에 걸어 실시간 통역을 한다"는 것은 회의, 강의, 라이브 시청 전반에 걸친 수요를 아우르는 것이지, 당신이 시장을 교육해야 하는 새로운 개념이 아니라 이미 누군가가 실제로 운영 중인 성숙한 수요입니다. 당신이 해야 할 일은 그것이 수요가 있는지 처음부터 증명하는 게 아니라, 기존 도구보다 당신의 시나리오에 더 잘 맞는 경험을 만드는 것입니다.
언젠가 API가 정말로 열리면, 오늘 익혀둔 오디오 라우팅, 회의·라이브 방송 통합, 지연 시간 트레이드오프 같은 작업들은 하나도 헛되지 않습니다. 그것들이야말로 그때 다른 사람보다 즉시 앞서 달릴 수 있는 밑바탕이 됩니다.
막히기 쉬운 세 지점: 지연 시간, 억양, 전문 용어
연결이 된다고 해서 매끄러운 건 아닙니다. 이 방식을 실제로 쓸 수 있을지를 결정하는 건 다음 세 가지입니다. 미리 알아두면 회의나 방송 전에 상황을 제대로 골라 쓸 수 있고, 현장에서 낭패를 보지 않습니다.
지연 시간이 가장 주의해야 할 부분입니다. 지금까지 OpenAI는 GPT-Live의 첫 응답 지연이나 뒤처지는 시간(초)을 전혀 공개하지 않았습니다[Source: https://openai.com/index/introducing-gpt-live/]. 실시간 음성 통역은 원래 시간차가 발생할 수밖에 없습니다. 한 문장을 다 들은 뒤 모델에 넘겨 통역하고, 다시 읽어줘야 하니 이 경로 자체가 태생적으로 반 박자 느립니다. 일대일로 천천히 대화하거나 라이브 방송을 단방향으로 들을 때는 참을 만하지만, 서로 주고받는 다인원 회의에서는 매 문장마다 시차가 벌어지면 회의 전체의 리듬이 쉽게 무너질 수 있습니다. 구체적으로 몇 초나 차이가 날까요? 공식 발표가 없으니 저희도 지어내지 않겠습니다. 공개되거나 신뢰할 만한 실측이 나오면 보완하겠습니다. 실무적으로는 해법이 간단합니다. 먼저 일대일, 단방향 시청, 혹은 템포가 느린 자리에 써서 장점을 최대한 살리는 것입니다.
억양과 언어 커버리지가 두 번째 관문입니다. OpenAI 스스로 밝히길, “가장 많이 쓰이는 언어” 외에는 비원어민 억양과 유창함 부족이 나타나며, 완전한 다국어 대등 지원은 출시 시점 기준으로 “명확히 미달성"이라고 명시했습니다[Source: https://openai.com/index/introducing-gpt-live/]. 그러니 회의나 방송이 영어, 일본어, 한국어처럼 사용 인구가 많은 언어라면 체감이 훨씬 좋을 것이고, 언어가 비주류일수록 어색함이 드러나기 쉽습니다. 언어를 잘 고르는 것만으로 이 관문의 절반은 통과한 셈입니다.
전문 용어는 세 번째 관문이며, 공식 자료가 없어 추론에 의존할 수밖에 없습니다. GPT-Live는 어려운 문제의 배경을 뒤에 있는 텍스트 모델에 넘겨 실시간으로 계산합니다. 일반 대화나 일반 방송에는 충분하지만, 재무 수치, 법률 조항, 의료 용어, 기술 사양처럼 한 글자도 틀려서는 안 되는 상황이라면 판단이 다릅니다. 보조 도구로는 쓸 수 있지만, 이걸 유일한 속기록으로 삼아서는 안 됩니다. 그래서 지속되는 실제 대화에서는 오히려 전용 실시간 통역 도구가 더 안정적입니다. Zoom, Google Meet 같은 회의 앱 자체에 내장된 실시간 통역 자막[Source: https://support.google.com/meet/answer/10964115?hl=zh-Hant&co=GENIE.Platform%3DDesktop][Source: https://www.timekettle.co/blogs/tips-and-tricks/how-to-translate-zoom-or-google-meet-conversations-in-real-time]이나, Felo처럼 회의와 라이브 방송에 특화된 전사·통역 도구[Source: https://chromewebstore.google.com/detail/felo-subtitles-chatgpt-li/ponokiofkijoolhebggofhhibnafebna?hl=zh-CN]는 “통역만” 하는 역할을 확실히 지켜내고, 나중에 다시 볼 수 있는 이중언어 속기록도 남겨줍니다. 이는 회의록을 정리하거나 강의 핵심을 복습해야 하는 사람에게 특히 유용합니다. 영리한 접근은 두 가지를 함께 쓰는 것입니다. GPT-Live는 실시간 대화의 매끄러움을 담당하고, 전용 도구는 다시 확인할 수 있는 정확도를 담당하는 식으로요.
밟기 쉬운 기대 하나가 더 있습니다. GPT-Live(사실 OpenAI의 어떤 인터페이스든)는 일반 전화번호로 전화를 걸어 통역 통화를 해주지는 못합니다. 그건 완전히 다른 종류의 제품입니다[Source: https://openai.com/index/introducing-gpt-live/]. 전화 연결이 필요하다면 기다리지 말고 바로 맞는 도구를 찾으세요.
그래서 지금 실제로 쓸 수 있을까
쓸 수 있습니다. 그것도 생각보다 진입 장벽이 낮습니다. 먼저 감을 잡아보고 싶다면 ChatGPT 음성에서 바로 GPT-Live를 켜고 통역을 시험해 보세요. 정말로 Zoom에 연결하거나, 지금 보고 있는 라이브 방송에 연결하고 싶다면 자신의 운영체제에 맞는 가상 오디오 케이블을 찾으세요(Mac은 BlackHole, Windows는 VB-CABLE). 위에서 다룬 “마이크인 척하는” 경로를 완성하면 됩니다. 회의라면 양쪽을 연결하고, 단순 시청이라면 한쪽만 연결하면 됩니다. 사용 인구가 많은 언어에, 템포가 좀 느린 자리를 골라 먼저 한 번 돌려보세요.
“GPT-Live를 당신의 오디오 스트림에 연결한다"는 것은, 상대가 고객이든 동료든 외국어 라이브 방송이든, 기술적으로 오늘 당장 연결할 수 있습니다. 남은 건 상황을 제대로 골랐는지 여부뿐입니다. 가상 오디오 케이블 부분은 정말로 손을 움직여 실행할 수 있고, 세 가지 병목—지연 시간, 비주류 언어, 전문 용어—도 신비로운 게 아니라 사전에 충분히 피할 수 있는 이미 알려진 한계입니다. 이 선을 어떻게 연결하는지, 경계가 어디인지 알고 나면 같은 회의, 같은 라이브 방송 안의 다른 사람들보다 반걸음 앞서게 됩니다. 그들이 아직 핸드폰을 켜서 대고 말할지 말지 망설이는 동안, 당신은 이미 통역을 깔끔하게 귀에 흘려 넣고 있을 테니까요. 도구는 계속 앞으로 나아가겠지만, 먼저 손을 더럽히고 먼저 연결해 본 사람이 언제나 다음 물결의 혜택을 가장 잘 누릴 수 있는 자리에 서 있습니다.