📰 핵심 요약

ProvenanceGuard 논문은 「출처 인식 사실 검증」(Source-Aware Factuality Verification)이라는 방법을 제시하며, MCP(Model Context Protocol) 아키텍처 기반 대형 언어 모델 에이전트가 자료 출처를 인용할 때 흔히 발생하는 오류, 즉 「교차 출처 혼동」(cross-source conflation)을 해결하고자 한다. 이 오류는 어떤 주장이 증거 풀(pool) 안에 실제로 존재하고 사실이지만, 에이전트가 이를 잘못된 출처 도구에 귀속시키는 경우를 가리킨다. 기존의 「출처 무관」(source-blind) 검증 방식은 해당 주장이 전체 증거 풀 안에서 뒷받침되는지만 확인하며, 존재하기만 하면 통과로 판정하기 때문에 이러한 귀속 오류를 잡아내지 못한다. 논문은 예시를 통해 설명한다. 고객 서비스 에이전트가 “계정 기록에 따르면 이 요금제는 30일 환불 기간을 제공합니다"라고 답변했지만, 실제로 이 환불 규정은 계정 기록이 아니라 정책 문서에 적혀 있는 경우, 두 출처의 증거를 뒤섞어 보면 이 주장은 근거가 있다고 오판될 수 있다. 하지만 따로 떼어 검토하면 귀속 오류를 발견할 수 있다. 의료 현장에서도 비슷한 상황이 발생하면 환자 개인의 투약 기록이 의학 문헌의 연구 결과로 잘못 인용되어 오해를 불러일으킬 수 있다. ProvenanceGuard는 에이전트가 답변을 생성한 이후에 개입하는 검증 계층으로, 모델을 재훈련할 필요 없이 기록된 MCP 추적 기록(도구 출력과 각각의 출처 ID 포함)을 직접 읽는다. 작동 과정은 다섯 단계로 이루어진다. 답변을 구체적인 주장으로 분해하고, 각 주장에 가장 관련성 높은 출처를 찾아내고, 해당 출처가 실제로 이 주장을 뒷받침하는지 확인하고, 이 출처가 답변에서 명시적 혹은 암묵적으로 언급한 출처와 일치하는지 대조한 다음, 마지막으로 「주장별 출처 판정」과 전체 답변 수준의 「허용/차단」 결정을 산출한다. 답변이 차단될 경우, RARR 스타일의 복구 메커니즘을 통해 다시 생성하고 재검증할 수 있다. 자세한 실험 설계와 데이터는 원문 링크를 참고하기 바란다.


💬 JudyAI Lab 관점

ProvenanceGuard가 지적하는 문제는 직관적이다. AI 에이전트가 자료를 조회할 때 답변 자체는 맞을 수 있지만, 인용된 출처가 엉뚱한 대상과 연결될 수 있으며, 이런 오류는 사람이 검토할 때 특히 놓치기 쉽다.

이는 AI 빌더 커뮤니티에 다음과 같은 시사점을 준다. 검증 메커니즘의 설계 사고방식이 더 정교해져야 한다는 것이다. 과거의 「출처 무관」 검증 방식은 어떤 주장이 전체 증거 풀 안에서 뒷받침되는지만 확인했을 뿐, 그 주장이 「주장하는 출처」와 실제로 일치하는지는 검사하지 않았다. 이는 MCP 아키텍처에서 여러 도구와 여러 출처가 동시에 작동할 때 특히 위험하다. ProvenanceGuard는 답변 생성 후에 개입하는 검증 계층을 채택하여, 답변을 구체적인 주장으로 분해하고 출처를 하나씩 대조함으로써 모델 재훈련 없이도 이 허점을 메운다. 이러한 「사후 감사」 방식은 「훈련 시점 수정」과 달리, 다중 출처 에이전트 시스템을 구축할 때 참고할 가치가 있는 설계 사고방식이다.

만약 여러분의 시스템이 여러 자료 출처를 통합해 답변을 생성한다면, 현재의 검증 로직이 「뒷받침되는지 여부」만 보고 「같은 출처에서 뒷받침되는지」는 놓치고 있지 않은지 점검해 보기를 권한다.


📅 원문 정보


🔗 더 읽어보기