DeepSeek 無預警釋出 V4 Pro 0813 正式版 API,Agent 能力大幅提升直逼 Fable 5
新版模型軟體工程跑分翻倍,加劇與 Grok 4.6 的價格戰,官方並暗示將推出專屬代理框架 DeepSeek Harness。
愛範兒綜合 2 家多家報導
52 則值得知道的變化
新版模型軟體工程跑分翻倍,加劇與 Grok 4.6 的價格戰,官方並暗示將推出專屬代理框架 DeepSeek Harness。
測試 13 款模型發現,即使啟用思考模式,前沿模型仍有 11% 至 12% 的事實無法提取,顯示擴展規模對改善知識提取的幫助有限。
該 3.1B 模型記憶體佔用低於 3.3GB,在蘋果 M5 Max 推論達 228 tokens/s,並大幅提升螢幕 UI 理解與函數呼叫能力。
該機器人在一小時無人工介入的直播中,僅用標準夾爪處理隨機包裹,準確率逾 98%,其 WUM 架構模型能即時預測物理變化。
分析顯示 Opus 5 平均回覆達 510 字,更常使用破折號與坦誠語氣;同系列的 Fable 5 則較簡潔,但給予肯定回饋的機率翻倍。
有別於 LLM-as-judge,AutoEval 透過真實人類提示與模型回覆進行評分,維持動態基準,讓模型實驗室能快速取得基於人類偏好的洞察。
該方案幾乎無針對 ARC 進行最佳化,僅透過單一動作指令與檔案系統日誌,即可達到 99.3% 的 pass@2 成績。