📰 핵심 요약
ChatGPT는 OpenAI 연구원 Diogo Almeida에게 실망감을 안겼다. 그는 ChatGPT 개발에 참여했고 현재 AI 붐을 이끄는 핵심 훈련 기술인 ‘인간 피드백 기반 강화학습’(RLHF)을 발명했지만, 여전히 그 결과물에 만족하지 못하고 있다. 그는 업계 전체가 지난 4년간 ‘인간의 언어’ 출력을 최적화하는 데만 매달렸지만, 정작 컴퓨터가 필요로 하는 것은 다른 종류의 언어이며, 이 때문에 LLM을 진정한 자동화에 활용하기 어렵다고 지적한다.
2년 전 Almeida는 OpenAI를 떠나 TypeSafe AI를 설립하고 이 문제를 해결하려 했다. 이번 주 이 회사는 신규 모델 Jev를 발표했는데, transformer 구조를 채택했지만 LLM은 아니다 — 텍스트를 출력하지 않고 확률, 이른바 ‘보정된 결정’(calibrated decisions)을 출력한다. 언어 출력을 포기함으로써 모델은 매우 저렴하고 매우 빨라졌으며, 출력 옵션을 사용자가 미리 정의하기 때문에 환각(hallucination)이 발생하지 않는다. 출력 토큰은 무료이고, 입력 토큰은 백만 단위가 아니라 십억 단위로 과금된다.
개발자들의 반응은 뜨거웠고, 회사는 한때 수요 폭증으로 API 서비스를 제공하지 못할 정도였다. Vercel 엔지니어 Pranit Sharma는 기존에 OpenAI Luna 5.6으로 구동하던 명령어 안전 분류기를 Jev로 교체한 뒤 속도가 5배에서 18배 향상되었고 정확도도 더 높아졌다고 밝혔다. Bryo AI CTO Nikhil Mudholkar는 상업용 이메일 분류 작업에서 Jev와 Gemini를 비교했는데, Gemini의 정확도가 소폭 더 높았지만 비용은 10~20배 더 비쌌다며, 그는 Jev가 실제 확률값을 반환한다는 점을 더 높이 평가했다 — 이는 자동화 워크플로우에서 신뢰도 임계값을 판단하는 데 적합하기 때문이다.
특정 시나리오에서 LLM을 대체하는 것 외에도, Jev는 LLM 에이전트의 행동을 감시하는 저비용 점검 메커니즘으로도 활용될 수 있다. 에이전트의 궤적을 추적하고, 탈옥(jailbreak) 공격을 방지하며, 모델 라우팅(model routing) 판단을 돕는 데 쓰인다.
💬 JudyAI Lab 관점
Diogo Almeida는 ChatGPT 개발에 참여했고 RLHF 기술을 발명한 인물이지만, 지금은 업계 전체가 지난 4년간 잘못된 방향으로 갔다고 생각한다 — 인간의 언어 출력을 최적화하는 데만 집중하면서, 정작 컴퓨터가 진짜로 필요로 하는 것은 다른 종류의 언어라는 사실을 간과했다는 것이다. 그는 OpenAI를 떠난 뒤 TypeSafe AI를 설립했고, 이번 주 발표한 신규 모델 Jev는 텍스트 출력을 포기하고 대신 보정된 확률값을 출력하는 방식을 택했다.
이는 AI 빌더들이 주목할 만한 설계 발상을 보여준다: 모든 시나리오에서 LLM이 자연어를 생성할 필요는 없다는 것이다. 출력 옵션을 미리 정의할 수 있는 경우, 확률 출력 방식은 환각 문제를 완전히 제거하면서 비용과 지연 시간도 대폭 줄일 수 있다. Vercel 엔지니어의 실측 결과, 명령어 안전 분류기를 Jev로 교체한 뒤 속도가 5배에서 18배 향상되었다. 또 다른 사례에서는 Gemini의 정확도가 소폭 더 높았지만 비용은 10~20배 더 비쌌고, Jev가 실제 확률값을 반환한다는 점이 자동화 워크플로우의 신뢰도 임계값 판단에 더 적합하다는 평가를 받았다. 이는 더 강력한 언어 생성 능력을 추구하는 것 못지않게 ‘적절한 도구로 적절한 일을 하는 것’ 역시 중요하다는 점을 일깨워준다.
다음에 AI 워크플로우를 설계할 때는, 이 작업이 정말 텍스트 출력을 필요로 하는지, 아니면 확률 판단만으로 충분한지 먼저 물어보는 것은 어떨까?
📅 원문 정보
- 발행 시각: 2026-09-18T18:49
- 원문 출처: https://techcrunch.com/2026/09/18/a-new-kind-of-ai-model-from-a-chatgpt-inventor-is-thrilling-developers/