📰 핵심 요약
알리바바 그룹이 월요일 자사 최강 AI 모델이라 불리는 「Qwen3.8 Max」를 공식 발표했으나, 벤치마크 테스트 결과 실제 성능은 회사가 이전에 주장했던 수준에 미치지 못한 것으로 나타났다. 테스트 결과에 따르면, 알리바바가 「최강」이라 칭한 이 신모델은 다수의 중국 본토 및 해외 경쟁사보다 성능이 뒤처지는 것으로 확인됐다. 보도에서는 특히 알리바바가 애초 Qwen3.8 Max의 성능이 「Fable 5 다음으로 강력하다」고 주장했으나, 실제 테스트 결과는 이 주장을 뒷받침하지 못한다고 지적했다. 가격 측면에서는 Qwen3.8 Max가 중국 동종 업계인 문의 어둠(Moonshot AI) 산하 Kimi K3 모델보다 명백히 저렴하게 책정되어, 알리바바가 이번 중국 AI 모델 경쟁에서 단순히 모델 성능으로 경쟁하기보다 가격을 주요 경쟁 전략으로 삼고 있을 가능성을 보여준다. 원문 요약에는 Qwen3.8 Max의 구체적인 벤치마크 점수, 파라미터 규모, 혹은 Kimi K3와의 상세한 가격 비교 수치는 제공되지 않았으며, 자세한 내용은 원문 링크를 참고하기 바란다. 전반적으로 이번 뉴스는 중국 AI 대기업들이 모델을 발표할 때 사용하는 홍보 문구와 제3자 실측 결과 사이에 괴리가 발생하는 현상을 보여준다.
💬 JudyAI Lab 관점
알리바바가 월요일 자사 최강 모델이라 부르는 Qwen3.8 Max를 발표했지만, 벤치마크 테스트 결과 실제 성능은 공식 주장 수준에 미치지 못한 것으로 나타났다. 이러한 「홍보 문구」와 「제3자 실측」 사이의 괴리야말로 이번 뉴스에서 진짜 주목할 만한 지점이다.
보도에 따르면, 알리바바는 애초 Qwen3.8 Max의 성능이 Fable 5 다음으로 강력하다고 주장했지만 실제 테스트 결과는 이를 뒷받침하지 못했다. 동시에 가격은 문의 어둠(Moonshot AI)의 Kimi K3보다 명백히 낮게 책정되어 있다. 이는 이번 중국발 AI 모델 경쟁에서 상당수 업체들이 신제품을 발표할 때 마케팅 언어가 실측 데이터보다 앞서 나가는 경향을 보여주며, 성능으로 뚜렷한 격차를 벌리기 어려울 때 가격이 오히려 더 직접적인 경쟁 수단이 되고 있음을 시사한다. AI 빌더 입장에서는 새겨들을 만한 대목이다. 어떤 신모델을 평가하든 「최강」 「어느 모델 다음으로 강력」 같은 공식 문구 자체는 판단 근거가 될 수 없다는 것이다.
다음에 비슷한 주장을 접하게 되면, 먼저 독립적인 벤치마크 점수를 대조해 본 뒤 자신의 프로젝트에 도입할지 결정하는 편이 낫다.
📅 원문 정보
- 발행 시각: 2026-08-03T06:05
- 원문 출처: https://asia.nikkei.com/business/technology/artificial-intelligence/alibaba-s-new-qwen-ai-model-falls-short-of-second-only-to-fable-5-claim