模型發布
Z.ai 推出 GLM-5.3 API,強化程式與資安能力並強制開啟推理功能
X @Zai_org綜合 2 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
Z.ai 正式推出 GLM-5.3 API,定價與 GLM-5.2 相同。該模型與 GLM-5.2 使用相同的基礎模型,全數升級皆來自後訓練(post-training),主要針對複雜軟體工程、防禦性資安及長程代理(long-horizon agentic)任務進行強化。
規格方面,GLM-5.3 目前僅支援純文字輸入,具備 1M token 上下文長度與 128K token 最大輸出限制。重大變更在於模型「強制開啟」推理功能,提供 low、high、max 三種推理強度,不再支援關閉推理(原使用 `thinking.type: "disabled"` 的 API 用戶須改為 enabled 並將強度設為 low 以避免請求失敗)。
在效能表現上,官方指出 GLM-5.3 在 Z.ai Code Bench 的程式能力較前代提升 50%,並在 Terminal Bench 3.0 與 Agents’ Last Exam (CLI) 創下開源模型 SOTA 紀錄;資安方面則在 CyberGym 漏洞發現基準測試創下最佳表現,且漏洞利用分數達前代兩倍以上。第三方數據顯示,GLM-5.3 在最高推理設定下,於 Artificial Analysis Intelligence Index 獲得 60 分(較前代提升 7 分),與 Kimi K3 齊平,但略低於 Opus 5(63 分)與 Fable 5(62 分);待權重釋出後,預計將並列領先的開源權重模型。
使用方案上,GLM Coding Plan 採用點數配額制,離峰時段(含週末全天)僅消耗 50% 點數。曾訂閱該方案的用戶,目前僅能透過相容於 OpenAI Chat Completion 的協定存取模型 API。
讀原始報導背景
Terminal-Bench 是一個持續更新的基準測試,專門衡量 AI 代理(Agent)在多樣且困難任務上的前沿表現。Agents' Last Exam (ALE) 則是設計用來評估 AI 代理在具有經濟價值、可驗證結果的真實世界長週期任務中的能力。
這則事件的發展
來源
- Reddit r/LocalLLaMAreddit.com
- Techmemetechmeme.com
- github.com
- arxiv.org