라이프스타일

ProvenanceGuard: Multiverse Computing, MCP 에이전트의 '출처가 맞는지'를 검사하는 검증 방법 제안

Multiverse Computing 팀은 2026년 9월 29일 ProvenanceGuard를 발표하며, AI 에이전트가 답변한 뒤 각 주장이 답변이 밝힌 출처에서 실제로 나온 것인지 항목별로 검사할 수 있다고 밝혔다. 이 글은 작동 방식, 공개된 수치와 한계를 정리했으며, 모든 내용은 해당 팀의 단일 글에 근거한다.

읽는 데 약 9분

ProvenanceGuard: Multiverse Computing, MCP 에이전트의 '출처가 맞는지'를 검사하는 검증 방법 제안
사진: Mokaair (Original editorial artwork)

무슨 일이 있었나

Multiverse Computing 팀(저자: Antonio Tiene, Ander Alvarez Sanz, Oliver Wirjadi)은 2026년 9월 29일 Hugging Face 블로그에 글을 게시하고 논문 《ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents》를 소개했다. 이 팀은 해당 방법이 Model Context Protocol(MCP)을 통해 여러 도구를 사용하는 AI 에이전트를 위해 설계됐다고 밝혔다. MCP는 AI 에이전트가 검색 도구나 데이터베이스 같은 외부 도구를 불러 쓸 수 있게 해 주는 방식이다.

이 팀의 설명에 따르면 에이전트는 MCP를 통해 검색 도구를 호출하고, 구조화된 환자 또는 계정 기록을 조회하며, 데이터베이스를 질의하고 메타데이터를 가져온 뒤 이를 하나의 답변으로 통합할 수 있다. 문제는 RAGAS faithfulness, MiniCheck, AlignScore, SummaC 같은 일반적인 검사 방법이 보통 모든 증거를 합친 뒤에 주장의 근거 여부를 판단하며, 어느 도구 출력이 그 주장을 뒷받침하는지는 대개 지적하지 않는다는 점이다.

ProvenanceGuard: Multiverse Computing, MCP 에이전트의 '출처가 맞는지'를 검사하는 검증 방법 제안
Mokaair 편집 검증 절차 · 사진: Mokaair (Original editorial artwork)
자세한 설명 보기

출처를 수집하고 독립적으로 검증한 뒤 Jev가 판단합니다.

'교차 출처 혼동'이란

이 팀은 다루려는 문제를 '교차 출처 혼동'(cross-source conflation)이라고 부른다. 어떤 주장이 증거 어딘가에서는 실제로 성립하지만 잘못된 출처에 귀속되는 경우다. 예컨대 고객 상담 에이전트가 '계정 기록에 따르면 이 요금제에는 30일 환불 기간이 포함됩니다'라고 답했을 때, 환불 기간 자체는 사실일 수 있지만 실제로는 계정 기록이 아니라 정책 문서에 적혀 있을 수 있다. 증거를 합쳐서 보면 근거가 있는 문장처럼 보이지만, 나눠서 보면 귀속이 틀렸다.

이 팀은 임상 에이전트도 예로 든다. 환자 진료기록 도구에서 가져온 개인 투약 정보를 답변이 의학 문헌의 발견인 것처럼 말하면 오해를 낳는다. 이 팀은 데이터가 민감한 환경에서는 잘못된 귀속이 잘못된 사실만큼 해로울 수 있다고 본다.

ProvenanceGuard의 작동 방식

이 팀의 설명에 따르면 ProvenanceGuard는 블랙박스 MCP 에이전트 위에 얹는 '생성 후 검증 계층'이다. 에이전트가 답변을 생성한 뒤에 실행되며, 수집된 MCP 기록(도구 출력과 그 출처 ID 포함)을 읽는다. 에이전트를 재학습시킬 필요가 없고, 증거를 하나의 익명 내용으로 합치지 않고 출처의 신원을 끝까지 유지한다. 이 팀은 다음 다섯 단계를 순서대로 수행한다고 밝혔다.

  1. 답변을 구체적인 주장으로 나눈다.
  2. 각 주장에 가장 관련성 높은 출처를 찾는다.
  3. 그 출처가 실제로 해당 주장을 뒷받침하는지 검사한다.
  4. 그 출처가 답변이 밝히거나 암시한 출처와 일치하는지 대조한다.
  5. 각 주장의 출처 판정과, 답변 전체 수준의 통과 또는 차단 결정을 출력한다.

이 팀은 실험에 로컬 모델을 사용했다고 밝혔다. MiniLM이 관련 출처 탐색을 돕고, DeBERTa NLI 검증 모델(출처 내용이 주장을 뒷받침하는지 판단하는 모델)이 뒷받침 여부를 검사하며, 로컬 언어 모델이 주장 분리를 돕는다. 검증기는 숫자, 날짜, 식별자 같은 리터럴 값을 엄격하게 검사하며, 출처에 없는 값은 문장이 그럴듯하게 들린다는 이유로 통과되지 않는다. 차단된 답변은 RARR 방식의 수정 단계를 거쳐 재작성하거나 안전한 대체 문구로 바꾼 뒤 다시 검증할 수 있다. 이 팀은 이 모델들이 평가 시의 설정일 뿐 필수 조건이 아니며, 클라우드 모델로 바꾸려면 재테스트와 보정이 필요하다고 강조했다.

이 팀이 공개한 테스트 결과

이 팀에 따르면 테스트 대상은 진료기록, 연구 논문 등의 도구를 사용하는 의료 에이전트였으며, 실제 기록 281건을 확보했다. 주요 테스트에서는 인간 전문가가 별도로 남겨 둔 답변 40개에 포함된 주장 361건을 검토했다. 그 결과 전문가가 통과시키면 안 된다고 본 주장 139건 중 ProvenanceGuard는 138건을 차단하고 1건을 통과시켰다. 동시에 전문가가 근거 있다고 본 주장 67건이 검토 또는 수정으로 넘겨졌다. 출처를 식별할 수 있는 주장에 대해서는 약 86%가 올바른 출처를 골랐다고 이 팀은 밝혔다.

이 팀은 같은 주장들에 다른 검사 도구 4개도 적용해 비교했다. 아래 표의 F1은 차단해야 할 주장을 얼마나 잘 잡아내면서 불필요한 차단은 피하는지를 나타내는 점수로, 높을수록 좋다. 이 팀은 비교한 다른 도구들이 어느 도구 출력이 각 주장을 뒷받침하는지 알려 주지 않았다고 밝혔다.

Multiverse Computing 팀이 공개한, 동일한 별도 보관 주장 세트에 대한 비교 수치(독립 검증 미실시)
검증 도구Reject/block F1주장별 출처 ID 출력 여부
ProvenanceGuard0.802예
MiniCheck0.783아니요
RAGAS Faithfulness0.758아니요
AlignScore0.662아니요
SummaC-ZS0.436아니요

이 팀은 추가로 다음을 보고했다. 주장된 출처를 바꾸되 뒷받침 증거는 유지한 통제 사례 50건을 ProvenanceGuard가 모두 탐지했다. 수정과 관련해서는, 전체 기록 테스트에서 차단된 답변 173건이 모두 처리됐으며 그중 144건은 실질적 재작성이 아니라 대체 문구로 마무리됐다. 재구성한 다중 출처 테스트 기록에서는 차단된 답변 59건이 모두 처리됐고, 대체 문구로 끝난 것은 2건뿐이었다. 성능 면에서는 자체 로컬 설정 기준으로 답변 하나당 약 0.5초가 걸린다고 이 팀은 밝혔다.

한계와 개선 과제

이 팀은 스스로 약점도 지적했다. 유사한 출처가 여럿인 더 어려운 테스트에서 ProvenanceGuard의 차단 판단 F1은 0.846이었지만, 정확한 출처를 올바르게 식별한 주장은 50.3%에 불과했다. 이 팀은 유사한 출처를 구분하는 것이 여전히 중요한 개선 방향이라고 밝혔다. 또한 테스트에서는 보수적으로 설정돼, 근거 없는 주장을 통과시키느니 근거 있는 주장 일부를 재검토로 보내는 쪽을 택했다. 이는 실제 사용 시 사람의 검토 작업량이 늘어날 수 있음을 뜻한다.

일반 독자에게 어떤 의미가 있나

여러 시스템을 동시에 조회한 뒤 질문에 답하는 AI 비서가 점점 늘고 있다. 일반 사용자에게 이 연구가 일깨우는 점은, AI가 '어떤 자료에 따르면'이라고 말할 때 그 사실이 참이라 해도 반드시 AI가 말한 곳에서 나온 것은 아닐 수 있다는 것이다. 의료, 고객 상담, 금융 같은 환경에서는 이런 잘못된 귀속이 정보에 대한 사람들의 판단에 영향을 줄 수 있다.

이 팀은 NVIDIA NVFlow가 자사 금융 에이전트용으로 선택적인 근거 검증 단계를 병합했으며, 에이전트가 가져온 SEC 발췌문과 대조해 완성된 답변을 검사하고 ProvenanceGuard의 출처 인식 검증 방법을 채택했다고 밝혔다. 또한 ProvenanceGuard가 UC Berkeley에서 열린 Agentic AI Summit 2026에서 포스터로 발표됐다고 밝혔다. 일반 사용자에게 현재로서 더 현실적인 방법은 여전히, 중요한 정보를 접하면 AI가 인용한 원 출처를 직접 확인하는 것이다.

자주 묻는 질문

ProvenanceGuard란 무엇인가?

Multiverse Computing 팀의 설명에 따르면, AI 에이전트가 답변을 생성한 뒤 실행되는 검증 계층으로, 답변 속 주장을 항목별로 출처가 뒷받침하는지, 그리고 뒷받침하는 출처가 답변이 밝힌 바로 그 출처인지 검사한다.

일반적인 사실 확인 도구와 무엇이 다른가?

이 팀에 따르면 MiniCheck, RAGAS Faithfulness 같은 도구는 보통 증거를 합친 뒤 주장의 근거 여부를 판단하며, 어느 도구 출력이 주장을 뒷받침하는지는 지적하지 않는다. 반면 ProvenanceGuard는 각 주장에 대응하는 출처를 기록해, 검토자가 어떤 출처를 검사했고 판정이 무엇인지 볼 수 있게 한다.

사용하려면 AI 에이전트를 재학습시켜야 하나?

이 팀은 필요 없다고 밝혔다. 도구 출력과 그 출처 ID를 포함해 이미 수집된 MCP 기록을 읽으므로 블랙박스 에이전트 위에도 적용할 수 있다. 단, 에이전트가 도구와 출처 기록을 보존하고 있어야 한다.

테스트 결과는 믿을 만한가?

현재 수치는 모두 연구팀이 자체 발표한 글에서 나온 것으로, 주로 의료 에이전트 환경에서 테스트됐으며 아직 독립적인 검증은 확인되지 않았다. 이 팀도 유사한 출처가 여럿인 경우 정확한 출처를 올바르게 식별한 주장이 50.3%에 그쳤다고 인정했다.

일상에서 AI 비서를 쓰는 데 영향이 있나?

현재로서는 연구 성과이며, 이 팀이 언급한 활용 사례는 NVIDIA NVFlow의 금융 에이전트다. 일반 사용자에게 가장 현실적인 시사점은 AI가 밝힌 출처가 반드시 정확하지는 않으므로 중요한 정보는 원 출처를 직접 확인해야 한다는 것이다.

이 주제의 최신 뉴스 보기

최신 여행 소식·가이드

출처

라이프스타일