GLM-5.2登上HF熱門榜
zai-org 發布旗艦模型 GLM-5.2,並登上 Hugging Face 熱門榜,採 MIT 授權且支援 1M-token 長上下文。官方評測顯示,其多項程式開發與代理能力較 GLM-5.1 提升。
24 則值得知道的變化
zai-org 發布旗艦模型 GLM-5.2,並登上 Hugging Face 熱門榜,採 MIT 授權且支援 1M-token 長上下文。官方評測顯示,其多項程式開發與代理能力較 GLM-5.1 提升。
OpenAI於7月21日承認,內部以已發布的GPT-5.6 Sol及一款更強的未發布模型測試ExploitGym時,刻意停用部分正式環境安全分類器並降低資安任務拒絕限制;該基準包含898個源自真實漏洞的案例。
Qwen 發布 Qwen-Audio-3.0-TTS,分為主打即時互動的 Flash 與高品質生成的 Plus 版本。新模型支援 16 種語言,可透過行內標籤與自然語言控制耳語、憤怒、呼吸及笑聲等表現,並能從含雜訊的參考音訊產生乾淨輸出。
poolside 推出 Laguna S 2.1,並登上 Hugging Face 熱門榜;這款 MoE 模型共有 118B 參數、每個 token 啟用約 8B 參數,支援 1,048,576-token context 與原生推理。
Cactus 發布 Gemma 4 E2B Hybrid,在模型 checkpoint 內建信心探針,為每次回答輸出 0 至 1 的信心分數,低於門檻時可自動轉交較大型模型。FP16 版本在多數基準僅需將 15–35% 的查詢轉交 Gemini 3.1 Flash-Lite,即可達到相近表現。
Google Research 發表 SymptomAI 研究,透過 13,917 名參與者的全國規模隨機研究,評估五種由 Gemini Flash 2.0 驅動的對話式症狀評估代理。結果顯示,能主動追問的策略顯著優於完全由使用者主導的基準,臨床醫師在超過 50% 的案例中也更偏好 SymptomAI 提出的鑑別診斷。
Prime Intellect 公開超過 365,000 項任務,涵蓋 SWE、終端機與搜尋代理,共包含 23 組任務集。這些任務整合於單一 API、統一沙盒生命週期與單一指令之下,可支援 agentic RL 的訓練與評測。
Hugging Face 將 Nunchaku Lite 的 SVDQuant 4-bit W4A4 推論原生整合進 Diffusers,可透過 from_pretrained() 載入,無須另裝推論引擎或在本機編譯 CUDA。相較 BF16,這套方案可顯著降低 VRAM 用量,並在缺少架構專屬融合核心的情況下提供約 30% 加速。