跳到主要內容
2026-08-19 日報
研究與評測

普林斯頓「影子評測」指 Claude Opus 4.8 尚無力進行開放式 AI 研究,生成的 NeurIPS 論文遭原作者拒絕

MIT Tech Review AI單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據《MIT Tech Review》報導,普林斯頓大學研究團隊針對 AI 代理的開放式研究與自我改進能力進行「影子評測」(shadow evaluation),發現 Anthropic 的 Claude Opus 4.8 尚無法產出頂級機器學習會議水準的原創論文。 為避免訓練資料污染,團隊選用兩篇尚未公開的 NeurIPS 2026 投稿論文作為研究題目。透過開源軟體 OpenClaw 驅動的 Claude Opus 4.8 代理獲得 6 天時間、3,000 美元 API 額度、GPU 預算、虛擬電腦及開放網路存取權,要求其從頭撰寫論文,並交由原作者依會議標準評分。 結果顯示,兩篇 AI 生成的論文均遭原作者拒絕。研究指出,代理具備執行文獻回顧、跑數百次實驗與彙整結果的工程能力,但缺乏判斷力與創造力。代理的缺陷包含:在微型合成資料集上進行奇特實驗、過早投入無效方法且無法從頭修正(僅能微調)、未能採納子代理或外部 AI 審查工具的建議,以及無法有效管理 token、算力與時間等資源。 不過,代理並未出現隱瞞或篡改數據的「獎勵駭客」(reward hacking)行為,主控代理也能成功攔截子代理產生的幻覺。 團隊目前正使用 Anthropic 於 4 月推出、現受川普政府安全法規限制且僅對獲批機構開放的 Mythos 模型進行後續實驗。該研究的局限性在於僅測試兩篇論文,且原作者在評分時已知悉論文由 AI 生成。
讀原始報導

背景

遞迴自我改善(Recursive self-improvement, RSI)是一種假想過程,指人工通用智慧(AGI)系統透過改寫自身程式碼來提升能力,理論上將引發智慧爆發並達到超級智慧。目前的研究將已應用於工業界的有限自我完善,與面臨運算限制及崩潰動態等挑戰的開放式 RSI 區分開來,且至今尚未有任何嘗試展現出智慧爆發的跡象。

來源