生活分享

ProvenanceGuard:Multiverse Computing 提出為 MCP 代理檢查「來源是否正確」的驗證方法

Multiverse Computing 團隊於 2026 年 9 月 29 日發表 ProvenanceGuard,聲稱可在 AI 代理回答後逐項檢查每個主張是否真的來自答案所說的來源。本文整理其運作方式、公布數據與限制,所有內容均來自該團隊的單一文章。

閱讀時間約 7 分鐘

ProvenanceGuard:Multiverse Computing 提出為 MCP 代理檢查「來源是否正確」的驗證方法
圖片:Mokaair (Original editorial artwork)

發生了甚麼事

Multiverse Computing 團隊(作者列為 Antonio Tiene、Ander Alvarez Sanz 與 Oliver Wirjadi)於 2026 年 9 月 29 日在 Hugging Face 部落格發表文章,介紹論文《ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents》。該團隊表示,這套方法專為透過 Model Context Protocol(MCP)使用多種工具的 AI 代理而設。這裡的「AI 代理」是指能自行呼叫工具、查資料再作答的 AI 系統;MCP 則是讓這類代理連接搜尋工具、資料庫等外部來源的一套協定。

據該團隊描述,透過 MCP,代理可以呼叫搜尋工具、檢視結構化的病人或帳戶紀錄、查詢資料庫及取得中繼資料,再把這些內容整合成一個答案。問題是,RAGAS faithfulness、MiniCheck、AlignScore、SummaC 等常見檢查方法,通常把所有證據合併後才判斷主張是否有依據,一般不會指出究竟是哪一個工具輸出支持了該主張。

ProvenanceGuard:Multiverse Computing 提出為 MCP 代理檢查「來源是否正確」的驗證方法
Mokaair 編輯查核流程 · 圖片:Mokaair (Original editorial artwork)
閱讀完整文字說明

消息會先蒐集來源、獨立查核,再交由 Jev 判斷。

甚麼是「跨來源混淆」

該團隊把要處理的問題稱為「跨來源混淆」(cross-source conflation):一個主張在證據中某處確實成立,卻被歸屬到錯誤的來源。該團隊舉例,客服代理回答「根據帳戶紀錄,此方案包含 30 天退款期」,退款期本身可能是真的,但其實寫在政策文件而非帳戶紀錄中。如果把證據合併來看,這句話似乎有根據;分開來看,歸屬就錯了。

該團隊亦以臨床代理為例:一項取自病人病歷工具的個人用藥細節,若被答案說成是醫學文獻的發現,就會產生誤導。該團隊認為,在資料敏感的場景中,錯誤的歸屬可能與錯誤的事實同樣有害。

ProvenanceGuard 如何運作

根據該團隊說明,ProvenanceGuard 是架在黑箱 MCP 代理之上的「生成後驗證層」:在代理產生答案後才運行,讀取擷取的 MCP 紀錄(包括工具輸出及其來源 ID),不需要重新訓練代理,並且全程保留來源身分,不把證據合併成單一匿名內容。該團隊表示,它依序執行以下五個步驟:

  1. 把答案拆成具體的主張。
  2. 為每個主張找出最相關的來源。
  3. 檢查該來源是否真的支持該主張。
  4. 比對該來源與答案所聲稱或暗示的來源是否一致。
  5. 輸出每個主張的來源判定,以及整個答案層面的放行或攔截決定。

該團隊表示,實驗採用本地模型:MiniLM 協助找出相關來源,DeBERTa NLI 驗證模型(NLI 即自然語言推論,用來判斷一段文字是否支持某句話)檢查支持程度,本地語言模型協助拆分主張。驗證器會嚴格檢查數字、日期或識別碼等字面值,來源中沒有的值不會因句子聽起來合理而通過。被攔截的答案可經 RARR 式修補步驟(依據來源改寫答案的做法)嘗試改寫或改用安全後備文字,再重新驗證。該團隊強調,這些模型只是評估時的設定而非必要條件,改用雲端模型需要重新測試與校準。

該團隊公布的測試結果

據該團隊表示,測試對象是一個使用病歷、研究文章等工具的醫療代理,共取得 281 份真實紀錄。主要測試由人類專家檢查 40 個預留答案中的 361 項主張。結果顯示,專家認為不應通過的 139 項主張中,ProvenanceGuard 攔下 138 項、放行 1 項;同時有 67 項專家認為有依據的主張被送去審查或修補。對於來源可識別的主張,該團隊稱約 86% 選對來源。

該團隊另以四種檢查工具在同一批主張上比較。下表的 Reject/block F1 是論文用來衡量「該攔的主張有沒有攔到、同時避免不必要攔截」的分數,越高越好;ProvenanceGuard 在此項得分最高,也是表中唯一會指出每個主張對應哪個來源的工具。

Multiverse Computing 團隊公布、在同一組預留主張上的比較數據(未經獨立驗證)
驗證工具Reject/block F1是否輸出主張對應來源 ID
ProvenanceGuard0.802是
MiniCheck0.783否
RAGAS Faithfulness0.758否
AlignScore0.662否
SummaC-ZS0.436否

該團隊另外報告:在 50 個更換了所稱來源、但保留支持證據的受控案例中,ProvenanceGuard 全部偵測到。修補方面,全紀錄測試中 173 個被攔截答案全部獲處理,其中 144 個以後備文字結束而非實質改寫;在重建的多來源測試紀錄中,59 個被攔截答案全部獲處理,只有 2 個以後備文字結束。效能方面,該團隊稱在其本地設定下每個答案約需半秒。

限制與待改進之處

該團隊自己也指出了弱點。在多個相似來源的較難測試中,ProvenanceGuard 的攔截判斷 F1 為 0.846,但只有 50.3% 的主張正確識別出確切來源;該團隊表示,區分相似來源仍是重要的改進方向。此外,它在測試中屬於保守設定,寧可把部分有依據的主張送去複查,也不放行沒有依據的主張。

對一般讀者有甚麼意義

愈來愈多 AI 助理會同時查閱多個系統再回答問題。對一般使用者而言,這項研究提醒一點:AI 說「根據某某資料」時,那個事實即使是真的,也未必真的出自它所說的地方。在醫療、客服或金融等場景,這種錯誤歸屬可能影響人們對資訊的判斷。

該團隊表示,NVIDIA NVFlow 已合併一個可選的依據驗證階段,用於其金融代理,對照代理取得的 SEC 摘錄檢查完成的答案,並採用 ProvenanceGuard 的來源感知驗證方法。該團隊亦表示,ProvenanceGuard 曾在 UC Berkeley 舉行的 Agentic AI Summit 2026 以海報形式發表。對一般用戶來說,目前較實際的做法仍是:遇到重要資訊時,自行查看 AI 所引用的原始來源。

常見問題

ProvenanceGuard 是甚麼?

根據 Multiverse Computing 團隊的說明,它是一個在 AI 代理產生答案後運行的驗證層,會逐項檢查答案中的主張是否有來源支持,以及支持的來源是否就是答案所聲稱的那一個。

它和一般的事實查核工具有甚麼不同?

該團隊表示,MiniCheck、RAGAS Faithfulness 等工具通常把證據合併後判斷主張是否有依據,不會指出是哪個工具輸出支持主張;ProvenanceGuard 則會記錄每個主張對應的來源,讓審查者看到檢查了哪個來源及其判定。

需要重新訓練 AI 代理才能使用嗎?

該團隊表示不需要。它讀取已擷取的 MCP 紀錄,包括工具輸出及其來源 ID,因此可套用在黑箱代理之上,前提是代理保留了工具與來源的紀錄。

測試結果可靠嗎?

目前的數據全部來自研究團隊自行發布的文章,主要在醫療代理情境下測試,尚未見獨立驗證。該團隊亦承認,在多個相似來源的情況下,只有 50.3% 的主張能正確識別確切來源。

這會影響我日常使用 AI 助理嗎?

目前這是研究成果,該團隊提到的應用例子是 NVIDIA NVFlow 的金融代理。對一般用戶來說,最實際的啟示是:AI 指明的出處未必正確,重要資訊應自行核對原始來源。

查看同分類最新消息

最新旅遊情報攻略

資料來源

生活分享