📰 핵심 요약

Vals는 2024년 설립된 스타트업으로, AI 업계의 낡은 모델 벤치마킹 시스템을 바로잡는 것을 목표로 한다. 설립 2년도 채 되지 않아 빠르게 성장했다: 작년에는 8VC와 Bloomberg Beta가 주도한 시드 라운드를, 지난달에는 Andreessen Horowitz가 주도한 4000만 달러 규모의 시리즈 A를 유치했다.

공동창업자 Rayan Krishnan은 현재 25세로, Palantir에서 인턴 경험이 있으며 스탠퍼드 재학 시절 마이크로소프트와 스탠퍼드 인공지능연구소(Stanford AI Lab)에서도 일한 바 있다. 그는 Vals를 창업하게 된 계기가, 시장에 더 강력한 신규 모델이 빠르게 쏟아지는데도 학계의 벤치마킹 시스템은 이런 최전선의 발전 속도를 따라가지 못한다는 점을 관찰한 데서 비롯됐다고 밝혔다. 그는 벤치마크의 존재 의미가 모델이 제조사의 주장대로 실제로 그 능력을 발휘할 수 있는지 검증하는 데 있어야 한다고 생각한다.

Vals와 기존 벤치마킹 시스템의 가장 큰 차이점은, 현재 많은 테스트 문제가 공개되어 있어 모델 제조사가 이런 문제에 직접 맞춰 훈련시켜 “부정행위"를 할 수 있다는 데 있다. 반면 Vals는 구체적인 테스트 내용을 공개하지 않는다. 또한 기존 평가는 주로 추상적인 “지능” 테스트(예: 모델에게 변호사 자격시험 같은 지식형 시험을 치르게 하는 방식)에 치우쳐 있었지만, Vals는 법률, 금융, 프로그래밍 등 특정 산업 분야에서 모델이 복잡한 실제 업무를 완수하는 능력을 평가하는 방식으로 전환했다. 핵심은 모델이 만들어낸 결과물의 품질이 실제 인간 근로자와 견줄 만한지를 검증하는 데 있다. Krishnan은 또한 평가가 긍정적 성과만 보는 것이 아니라, 모델이 “통제를 벗어나 작동"할 경우 초래할 수 있는 부정적 영향까지 분석해야 한다고 언급했다. 원문에서는 Vals가 구체적으로 어떤 능력을 평가하는지에 대한 세부 내용을 다루고 있으니, 자세한 내용은 원문 링크를 참고하길 바란다.


💬 JudyAI Lab 관점

JudyAI Lab이 오늘 주목한 신호가 하나 있다: 설립 2년이 채 안 된 Vals가 두 차례 투자 라운드를 거쳐 Andreessen Horowitz가 주도한 4000만 달러 규모의 시리즈 A까지 유치했다는 사실은, “AI 평가를 새롭게 정의하는 일"에 대한 시장의 수요가 강하다는 것을 보여준다.

이는 업계의 한 흐름 전환을 반영한다. 모델의 성능 발전 속도가 학계 벤치마크의 업데이트 속도를 앞지르면, “점수 따먹기” 자체가 의미를 잃게 되고, 심지어 제조사가 맞춤 훈련으로 숫자를 부풀리는 수단으로 전락할 수 있다. Vals가 취한 두 가지 방식은 AI 빌더들이 참고할 만하다 — 맞춤형 훈련을 막기 위해 구체적인 테스트 내용을 공개하지 않는 것, 그리고 평가의 중심을 추상적인 지식 테스트에서 법률, 금융, 프로그래밍 등 구체적인 산업 과제의 실제 완수 품질로 옮긴 것이다. 또한 “모델이 통제를 벗어났을 때의 잠재적 부정적 영향"을 평가하는 관점 역시, 평가가 단순히 모델이 무엇을 해낼 수 있는지뿐 아니라 잘못했을 때 그 대가가 얼마나 큰지도 함께 봐야 한다는 점을 일깨워준다. 이러한 “표준화된 시험 문제 대신 실제 과업 결과로 평가한다"는 접근은 향후 평가 방법론이 진화해 갈 방향 중 하나가 될 수 있다.

다음에 모델을 선택할 때는 이렇게 한번 더 물어보자: 이 모델의 점수가 공개된 문제은행에서 나온 것인지, 아니면 답을 본 적 없는 실제 과업을 정말로 완수해서 얻은 것인지.


📅 원문 정보


🔗 함께 보면 좋은 글