研究與評測
新論文發表 MCP 代理驗證層 ProvenanceGuard,解決跨來源混淆問題,Reject F1 達 0.802
HuggingFace Blog一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

新論文提出針對 MCP 代理的後生成驗證層 ProvenanceGuard,旨在解決「跨來源混淆」問題,即代理將正確事實歸因於錯誤來源的現象。
該系統在不重新訓練代理的情況下,讀取包含工具輸出與來源 ID 的 MCP 追蹤紀錄,將回覆拆解為具體聲明,並逐一比對來源是否支持該聲明及歸屬是否正確,最終給出單一聲明裁決與整體阻擋或放行決定;遭阻擋的回覆可透過 RARR 方式進行修復。
實驗採用本地模型配置,以 MiniLM 尋找相關來源、DeBERTa NLI 檢查來源支持度,並由本地語言模型拆解聲明。在醫療代理的 281 筆真實追蹤紀錄測試中,人類專家於獨立資料集標記了 139 項不應通過的聲明,ProvenanceGuard 成功攔截 138 項(漏掉 1 項),並基於保守策略攔截了 67 項專家認為有支持的聲明,其來源識別準確率約為 86%。
在基準測試中,ProvenanceGuard 的 Reject/block F1 分數達 0.802,超越 MiniCheck(0.783)、RAGAS Faithfulness(0.758)、AlignScore(0.662)與 SummaC-ZS(0.436),且是上述測試中唯一能輸出聲明與來源 ID 對應關係的驗證工具。
讀原始報導