跳到主要內容
2026-08-28 日報
研究與評測

Google DeepMind 推出全球首個雙盲 AI 評測機制,首測 Gemini Flash Lite 防止基準污染

Google DeepMind一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Google DeepMind 宣布推出全球首個針對專有前沿 AI 模型的雙盲評測機制,旨在解決模型提前看過測試題的「基準污染」(benchmark contamination)問題。該計畫與新加坡 AI 安全研究所、OpenMined、AVERI 及 MLCommons 合作,在保護隱私的環境中針對機密基準測試 Gemini Flash Lite 模型。 過去的外部評測面臨兩難:評測方需交出提示詞而面臨模型提前看題的風險,或模型供應商需交出模型權重而面臨智慧財產權風險。新機制採用 Google Cloud 機密運算產品組合中的 Confidential Space,透過密碼學驗證建立安全環境。 在此雙盲機制下,評測方無法看見 Gemini 的模型權重,Google 也無法看見評測方的測試提示詞,確保獨立機構能在不犧牲資料主權與安全性的前提下,對先進模型進行嚴格測試。
讀原始報導
本期分類