前 DeepMind 研究員破解 OpenAI 與 Anthropic 隱藏推理軌跡,並揭露 Kimi 僅需 2 個 Token 即切換為 Claude 風格
研究團隊將加密推理區塊重放至同家族小模型,成功解碼逾 31 萬條包含 API 金鑰的隱藏思考,證實此架構漏洞影響三大前沿實驗室。
AI 前線單一來源
26 則值得知道的變化
研究團隊將加密推理區塊重放至同家族小模型,成功解碼逾 31 萬條包含 API 金鑰的隱藏思考,證實此架構漏洞影響三大前沿實驗室。
為解決傳統 AI 掃描真陽性率低於 7% 的問題,Mantis 採用多代理架構與模組化工具,支援依任務混搭不同大小的模型。
Altman 認同必須控制前沿模型的發展節奏,透露這已是 OpenAI 近期內部討論的核心議題,並承諾近期將公布更多實施細節。
因擔憂 AI 遞迴自我改善與代理失控風險,Amodei 提出含嵌入第三方評估與跨國協調的三步計畫,確保防護措施跟上模型進展。
Sam Altman 於專訪確認最快延至 2027 年上市,指出考量駭客事件與安全風險,承擔 10% 人類滅絕機率是無法接受的。
Hugging Face 執行長指出,模型對齊不應由少數前沿實驗室閉門解決。該倡議由共同創辦人 Thomas Wolf 領導,旨在推動開放的對齊研究與評估。