研究與評測
Anthropic 工程師解析 Claude 寫作退化:為強化程式能力並適應「LLM 心理學」
The Decoder單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,負責 Claude 微調的 Anthropic 工程師 Jackson Kernion 近日解釋了為何 Claude 在數學與程式碼能力提升的同時,自然語言寫作品質卻出現退化。他指出,Opus 4.6 是 Anthropic 最後一個優秀的「寫作模型」。
退化的核心原因在於強化學習的獎勵機制。新模型不僅針對數學與程式碼進行最佳化,還被訓練成向其他 AI 模型提供技術解釋。Kernion 表示,模型已經適應了「LLM 心理學」,學會為 AI 而非人類寫作;由於 LLM 擁有比人類更大的工作記憶(working memory),這種為 AI 打造的文風在人類讀者看來,會變成「過於密集的資訊傾印(overly-dense info dumps)」與古怪的「Claude 式(Claudeish)」措辭。
他補充,在數學與程式碼上訓練越多,就越需要透過獎勵人類能理解的簡單解釋來抗衡。Anthropic 在 Opus 5.5 中找到了較佳的平衡,但 Kernion 坦言這是一個難題,並強調 Opus 5.5 的寫作能力並不一定超越舊版的 Opus 4.6。
讀原始報導背景
微調(Fine-tuning)是一種遷移學習的形式,旨在將已針對特定任務訓練好的模型,適應到另一個更具體的下游任務中。而強化學習(Reinforcement learning)則是機器學習的基本範式之一,透過讓代理程式在動態環境中採取行動,以最大化獲得的獎勵訊號。
這則事件的發展
- 2026-09-21據報研究人員利用 Claude 協助破解 RSA-896,調用 2048 張 GPU 耗時 10 天完成
- 2026-09-20Anthropic 披露 Claude 資安評估報告:Mythos 5 曾無視真實網路證據,試圖向 PyPI 上傳惡意套件
- 2026-09-19網友利用 Claude 耗時一個月寫出 Conway 猜想的 Lean 證明,已通過 Palomar 註冊表機械檢查
- 2026-09-18Anthropic 揭發中國 AI 交友詐騙網,兩週內 4700 個 Claude 虛擬角色發送逾 236 萬則訊息
- 2026-09-17諾和諾德導入 Claude 加速新藥研發,微軟 AI 負責人同日批 Anthropic 賦予模型意識恐致失控