跳到主要內容
2026-08-14 日報
研究與評測

DeepSeek-V4-Pro (Max) 登 Code Arena WebDev 第八,性價比超越高價模型

X @arena綜合 2 家報導單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

即將推出的開源權重模型 DeepSeek-V4-Pro (Max) 在 Code Arena: WebDev 榜單中獲得 1607 分,總排名約第 8,在開源模型中排名第 2。該模型得分落後於 GPT-5.6 Sol (xHigh)(1622 分),為僅次於 Kimi K3 (Max)(1674 分)的第二強開源模型。其定價為每百萬 Token 輸入 0.435 美元、輸出 0.87 美元,表現超越了 Opus-4.8(5/25 美元)與 GLM-5.2(1.4/4.4 美元)等更高價位的模型,預期將改變該榜單的柏拉圖前緣(Pareto curve)。目前成績為早期的 AutoEval 評分(由基於人類偏好資料訓練的獎勵模型進行自動投票),後續分數將隨真實人類投票加入而收斂。
讀原始報導

背景

獎勵模型(Reward model)是機器學習中基於人類回饋的強化學習(RLHF)技術之一,主要用於代表人類偏好,進而引導模型行為。在模型評測中,這類模型可透過學習人類的偏好資料,自動代替真人進行投票與評分。

來源

本期分類