BenchMIRT 벤치마크 테스트로 실제로 측정할 수 있는 LLM 능력은 무엇인가
AI 뉴스 속보: BenchMIRT는 「LLM 벤치마크 테스트가 실제로 무엇을 측정하는가」를 분해하기 위한 새로운 방법론으로, 개별 문항 단위로 감사(audit)를 수행한다. 기존 벤치마크 테스트는 대개 단일 능력(예: 안전성, 일반 추론, 지시 이행 등)을 측정한다고 주장하지만, 실제로는 개별 문항이 여러 능력을 동시에 포함하는 경우가 많다. 예를 들어 모델이 사회적 고정관념에 의존하는지 테스트하는 BBQ 벤치마크에는 조부모와 손주가 우버를 예약하는 문항이 있는데, 표면적으로는 연령 편향을 측정하지만 실제로는 모델이 등장인물을 정확히 추적하고 가정이 아닌 근거에 기반해 추론하는 능력도 함께 요구한다…