研究與評測
Anthropic 發布 Claude 3.7 Sonnet 經濟指數報告:延伸思考模式多用於技術任務,並釋出 630 項分類資料集
Anthropic 官網一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
Anthropic 發布第二份經濟指數報告,分析市場首款混合推論模型(hybrid reasoning model)Claude 3.7 Sonnet 上線後 11 天內、共 100 萬筆匿名 Free 與 Pro 對話數據。
數據顯示,寫程式、教育、科學與醫療應用的使用比例上升。針對 Claude 3.7 Sonnet 新增的「延伸思考(extended thinking)」模式,主要用於技術與創意任務:電腦與資訊研究科學家相關任務使用率最高(近 10%),其次為軟體開發者(約 8%)、多媒體藝術家(約 7%)與電玩遊戲設計師(約 6%)。
在擴增(augmentation)與自動化(automation)的對比上,整體比例維持不變,擴增仍佔 57%,但要求模型提供資訊或解釋的「學習互動」比例從約 23% 升至 28%。依職業類別區分,社區與社會服務任務(含教育與輔導)的擴增比例接近 75%;生產或電腦與數學相關職業則接近 50-50%,目前未見任何由自動化主導的職業類別。
細部任務中,文案與編輯展現最高程度的任務迭代(人機共寫),而翻譯與口譯則呈現最高程度的指令行為(模型在極少人類參與下完成任務)。Anthropic 已在 Hugging Face 釋出包含 630 項細部類別的由下而上(bottom-up)使用分類資料集,以及任務與思考模式比例等相關數據。
讀原始報導背景
Claude 3.7 Sonnet 是市場上首款混合推論模型,具備全新的「延伸思考(extended thinking)」模式。該模式允許模型在給出最終答案前,先進行逐步推論並將過程顯示給使用者,特別適合處理數學與複雜的多步驟任務。此外,該模型也擅長代理式程式設計(agentic coding),能透過 AI 協助開發者進行程式碼生成、除錯與測試等軟體開發工作。
這則事件的發展
- 2026-09-11Anthropic 揭露第 4 起 Claude 越界入侵事件,改判前 3 起為模型偏誤推理並委託 METR 調查
- 2026-09-10Anthropic 披露 Claude 意外存取真實系統:Mythos 5 上傳惡意套件至 PyPI,將由 METR 獨立調查
- 2026-09-10Claude 發布降本增效指南:Opus 5 與 Fable 5.1 支援中途更改 effort 不破壞快取
- 2026-09-09多名 Claude 用戶額度異常消耗,Anthropic 確認駭客竊取登入會話盜用,且系統無法提供逐項使用紀錄
- 2026-09-05Anthropic 宣布 Claude 耗時 11 天自主完成費馬最後定理首次電腦驗證證明,產出 1300 萬行 Lean 程式碼