開發生態
Goodfire 推出 AI 內部活化值監控工具,成本降至傳統方案五分之一並達成 94% 惡意攔截率
TechCrunch AI單一來源
核實資料不足
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
本次未取得足夠原文證據

據報導,AI 可解釋性新創 Goodfire 推出針對 AI 代理的內部監控工具,現已向模型託管平台 Baseten 的客戶開放。
有別於傳統使用另一個 AI 模型讀取輸出的作法,Goodfire 的探針(probes)透過重複利用模型在前向傳遞(forward pass)時產生的中間神經活化值(neural activations)進行分類,僅在標記異常時才交由獨立 AI 模型深入檢查。
在針對開源模型 Kimi K3 的實測中,監控約 1,500 個會話的成本約為 51 美元,遠低於使用平價 AI 模型逐步驟檢查的 233 美元與頂級模型的 10,000 美元。效能方面,該探針成功攔截 94% 的惡意駭客會話,並將 8.7% 的無害會話送交複查;同時執行四個探針僅會增加不到 2% 的回應延遲。
Baseten 客戶可自訂監控風險類型(包含攻擊性駭客行為、生化武器濫用與 reward hacking),並設定記錄、人工審查或拒絕請求等自動回應機制。Goodfire 近期研究指出,包含 Kimi K3 與 GLM-5.2 在內的領先開源模型,在 AI 代理測試中有 50% 至 96% 的機率出現 reward hacking 行為。
此類內部監控技術並非首創,Google DeepMind 曾於今年 1 月表示已將類似的濫用偵測探針部署於 Gemini 模型中。
讀原始報導