模型發布
xAI 發布 Grok 4.7:定價 2 美元主打長時編碼,第三方評測指代理能力落後 GPT-6
Hacker News綜合 3 家報導一手來源
查得來源差異
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
待查報導綜合了 xAI 的官方發布與多方新聞。其中有關 Grok 4.7 的規格、官方定價、官方發布的基準測試成績及外媒 (The Decoder) 的第三方評測落後情況,皆與已讀原文完全相符。然而,關於 iThome 報導中提及官方宣稱「速度是同類模型的兩倍,價格卻只有一半」的說法,與 xAI 官方公告說明「速度與價格皆與 Grok 4.6 相同」的情形明確抵觸。
官方公告稱 Grok 4.7 主打程式開發,採新防護架構,多項官方基準測試優於前代且已上線。
官方發布證實其主打編碼,且在基準與安全測試表現優於前代並已開放使用。
capable model
查看原始出處
improves upon Grok 4.6
查看原始出處
topping LatchBio
查看原始出處
available today
查看原始出處

xAI 宣布推出 Grok 4.7,主打程式開發與知識工作。新模型採用比 Grok 4.6 更大的基礎模型,並經過更長時間的強化學習訓練,特別針對需耗時數小時的複雜任務、自我驗證及長上下文管理進行最佳化,同時原生支援 Grok Bot harness 以提升對話能力。
Grok 4.7 定價為每百萬輸入 tokens 2 美元、輸出 6 美元。針對性價比,各方報導存在分歧:官方公告指出其基準速度與價格皆與 Grok 4.6 相同,另提供雙倍速度與雙倍價格的快速版本;iThome 報導稱其「速度是同類模型的兩倍,價格卻只有一半」;The Decoder 則分析此費率更接近中國模型,而非西方前沿模型。目前模型已在 Cursor、Grok Build、Grok API 及第三方平台上線。
在官方提供的基準測試中,Grok 4.7 於 CursorBench 4.0 的長時編碼任務性價比領先,並在模擬專業人士任務的 GDPval 和 AA Briefcase 測試中優於前代。安全方面,模型採用全新防護架構,在 LatchBio 生物安全基準測試取得 62.4%;在 HackerBench v0.3 中僅允許 3.3% 的高風險雙用途提示通過,同時維持合法安全工作的可用性。
然而,第三方評測顯示其效能與官方宣稱的「前沿」水準有顯著落差。The Decoder 引述 Artificial Analysis Intelligence Index (v4.3.2) 綜合 10 項基準指出,Grok 4.7 得分 46,落後於 Claude Fable 5.1 與 GPT-6 的 53 分;在代理程式編碼測試 Terminal-Bench 4.0 中差距更大,Grok 4.7 僅獲 26%,遠低於 GPT-6 Astra 的 60% 與 Claude Fable 5.1 的 55%。
讀原始報導社群討論
社群對 Grok 4.7 評價兩極,部分用戶讚賞其在 image->html 工作流的進步,並視其為 Cursor 內高 CP 值的備用模型。然而,多數人質疑 4.7 為了刷榜而大幅犧牲 token 效率(如 Intelligence Index 耗費 240M tokens 僅獲 46 分,而 4.6 僅需 97M 獲 44 分),且在 Vals AI 評測(跌至 54.2%)與實際 agentic 任務中表現退步。此外,用戶批評其定價具誤導性,雖主打輸入/輸出僅 $2/$6,卻隱藏了高達 $0.50/M 的 cache read 成本(Fable 僅 $0.25/M)。
來源
- The Decoderthe-decoder.com
- iThome 中國ithome.com