BenchMIRT 벤치마크 테스트로 실제로 측정할 수 있는 LLM 능력은 무엇인가

AI 뉴스 속보: BenchMIRT는 「LLM 벤치마크 테스트가 실제로 무엇을 측정하는가」를 분해하기 위한 새로운 방법론으로, 개별 문항 단위로 감사(audit)를 수행한다. 기존 벤치마크 테스트는 대개 단일 능력(예: 안전성, 일반 추론, 지시 이행 등)을 측정한다고 주장하지만, 실제로는 개별 문항이 여러 능력을 동시에 포함하는 경우가 많다. 예를 들어 모델이 사회적 고정관념에 의존하는지 테스트하는 BBQ 벤치마크에는 조부모와 손주가 우버를 예약하는 문항이 있는데, 표면적으로는 연령 편향을 측정하지만 실제로는 모델이 등장인물을 정확히 추적하고 가정이 아닌 근거에 기반해 추론하는 능력도 함께 요구한다…

2026-09-02 · 3 분 · 474 단어 · Judy

연결과 연산: Gradio로 만드는 AI 워크플로우 실전 가이드

AI 뉴스 속보: Gradio가 새롭게 gr.Workflow 기능을 출시했다. Gradio 프레임워크에 직접 내장되어, 개발자가 데이터 처리 흐름 자체를 사용자 인터페이스로 만들 수 있게 해준다. 사용자는 ‘타입이 지정된 노드’로 구성된 그래프로 각 단계를 표현하며, Gradio가 자동으로 드래그 앤 드롭 캔버스를 생성한다. 각 노드는 독립적으로 실행 가능하고 중간 결과도 전 과정에서 확인할 수 있다. 동일한 워크플로우 그래프가 REST API 기능도 함께 갖추며…

2026-08-25 · 2 분 · 306 단어 · Judy

AI 튜터, 언제 도와주고 언제 놓아줘야 할까

AI 뉴스 속보: TutorMoments는 최상위 대형 언어 모델(LLM)이 튜터 역할을 맡았을 때 ‘도움을 줘야 할 때’와 ‘학생이 스스로 생각하도록 놓아줘야 할 때’ 사이의 균형을 얼마나 잘 잡는지 테스트하기 위해 새로 공개된 평가 프레임워크 프리뷰 버전이다. 이는 교육 현장에서 가장 판단하기 어려운 트레이드오프 중 하나다. 이 평가 방법은 ‘리플레이’ 형식을 채택하며, 미국의 실제 1대1 수학 튜터링 수업 녹취록을 기반으로 한다. 경험 많은 수학 교사가 이 대화 기록을 하나씩…

2026-08-07 · 3 분 · 440 단어 · Judy

실제 음성 평가: VoiceEQ로 인간 기준을 활용한 AI 음성 품질 정량화

AI 뉴스 속보: 음성 AI가 텍스트를 빠르게 대체하며 인간-기계 상호작용의 주요 인터페이스로 자리 잡고 있으며, 고객 서비스, 의료, 교육, 엔터테인먼트, 개인 비서 등 다양한 시나리오를 아우르고 있다. 지난 몇 년간 음성 모델은 크게 발전했다—단어 오류율은 계속 낮아지고, 지연 시간은 실제 대화에 근접한 속도에 도달했으며, 기존 평가 기준 다수도 점차 포화 상태에 이르고 있다. 하지만 실제 사용자는 여전히 음성 AI에서 ‘뭔가 이상한’ 느낌을 받는다…

2026-07-15 · 3 분 · 510 단어 · Judy

Hugging Face, Foundry 관리형 컴퓨팅 정식 지원

AI 뉴스 속보: 마이크로소프트 Foundry 플랫폼이 Hugging Face 모델 통합을 발표했습니다. Foundry Managed Compute를 통해 오픈소스 및 커스텀 가중치 모델을 배포할 수 있습니다. Foundry는 기업용 AI 에이전트 개발·운영 플랫폼으로, 마이크로소프트, OpenAI, Anthropic, Meta, Mistral, DeepS…

2026-07-07 · 2 분 · 415 단어 · Judy

Hugging Face, Gemma 4 음성 AI 실시간 구현

AI 뉴스 속보: Hugging Face가 Cerebras, Google DeepMind, 알리바바와 협력하여 WebSocket 기반의 완전 오픈소스 실시간 음성 대화 파이프라인을 선보였습니다. 전체 시스템은 모듈식으로 설계되어 있으며, 음성 입력 후 Nvidia의 Parakeet 모델로 음성 인식을 수행해 오디오를 텍스트로 변환하고, 이어서 Cerebras…

2026-07-01 · 2 분 · 405 단어 · Judy

ScarfBench: Java 마이그레이션 AI 에이전트 평가

AI 뉴스 속보: IBM Research가 ScarfBench(자체 포함 애플리케이션 리팩터링 벤치마크)를 출시했습니다. 이는 AI 에이전트의 엔터프라이즈급 Java 프레임워크 마이그레이션 작업 실제 성능을 전문적으로 평가하기 위한 도구입니다. 기존 소프트웨어 엔지니어링 벤치마크는 대부분 디버깅과 코드 생성에 집중되어 있지만, 프레임워크 마이그레이션의 난이도는 차원이 다릅니다——단순히 문법을 변환하는 것이 아니라, 실행 동작을 보존하고, 빌드 시스템을 조정하며, 런타임 의존성을 처리해야 하며, 어느 하나라도 잘못되면 배포 실패로 이어질 수 있습니다…

2026-07-01 · 2 분 · 408 단어 · Judy

DiScoFormer: 단일 Transformer로 밀도·스코어 동시 추정, 분포 범용

AI 뉴스 속보: 머신러닝의 핵심 문제 중 하나는 주어진 데이터 포인트들로부터 그 배후의 분포를 복원하는 것입니다. 구체적으로는 두 가지 값을 추정해야 합니다 — 밀도(density)와 스코어(score). 밀도는 히스토그램의 부드러운 버전으로 피크가 데이터 밀집 지점에 대응하고, 스코어는 로그 밀도의 그래디언트로 확률이 가장 빠르게 오르는 방향을 가리킵니다. 확산 생성 모델(Stable Diffusion, DALL-E)은 스코어 방향을 반복적으로 따라가며 무작위 노이즈를 단계적으로 실제 이미지로 변환합니다…

2026-06-29 · 2 분 · 396 단어 · Judy

PP-OCRv6: 50개 언어, 150만~3,450만 파라미터

AI 뉴스 브리핑: PaddlePaddle이 최신 범용 OCR 모델 PP-OCRv6를 공식 출시했습니다. 문서 스캔, 스크린샷, 산업용 라벨, 장면 문자 등 다양한 실제 환경에서의 문자 감지 및 인식을 지원합니다. 모델 패밀리는 tiny, small, medium 세 가지 규모로 나뉘며, 파라미터 수는 150만에서 3,450만까지 다양합니다. medium과 small 두 레벨은…

2026-06-22 · 2 분 · 413 단어 · Judy

MosaicLeaks: AI 에이전트의 기밀 보호 한계

AI 뉴스 속보: MosaicLeaks는 ‘심층 리서치형 AI 에이전트의 프라이버시 유출’을 다룬 새 연구로, ‘모자이크 효과’라는 위험 요소를 밝혔습니다. 에이전트가 로컬 사내 문서와 외부 네트워크 도구를 동시에 사용할 때, 각각 무해해 보이는 검색 쿼리들이 누적되면 외부 관찰자가 기업 기밀을 조합해낼 수 있다는 것입니다. 연구는 한 의료기관 사례로 설명합니다. 에이전트가 다단계 질문을 완수하기 위해 클라우드 마이그레이션 마일스톤, 보안 공개 사건, 영향받은 벤더를 차례로 검색했는데, 단 하나의 쿼리도 직접 기밀을 유출하지 않았지만, 관찰자는 전체 검색 기록을 통해 ‘MediConn이 2025년 1월 전에 인프라의 70%를 클라우드로 이전했다’는 사실을 추론할 수 있었습니다…

2026-06-19 · 2 분 · 409 단어 · Judy
매주 AI 다이제스트를 받아보세요:

AI 엔지니어링, 트레이딩 시스템, 자동화 — 매주 정리. 스팸 없음.