跳到主要內容
2026-09-30 日報
模型發布

PostHog 開源 Jeeves 決策模型:基於 Qwen3.5-9B 具備推理能力,JevBench 跑分超越 Jev 達 0.935

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

PostHog 發布並開源具備推理能力的 Jev-style 決策模型 Jeeves。該模型基於 Qwen3.5-9B,加入 LoRA 與 pointer head,並配備 block-4 diffusion drafter,使用 SFT 與 CISPO 進行訓練,使其在給出決策機率前會先進行思考。 在跑分表現上,Jeeves 於未見過的測試資料準確率達 0.889,超越 Kev-9B(0.822)與 Jev(0.857);在 JevBench 公開層級中得分 0.935(Jev 為 0.866),其中 JevBench hard 項目得分 0.865(Jev 為 0.730)。在內部測試集中,開啟思考功能的準確率為 0.840,關閉時則降至 0.804。 Jeeves 提供相容於 Jev 的 API,支援在單一請求中同時處理是非(noul)、多選(choice)與評分(score)問題。在單張 H100 (FP8) 上,不思考的請求延遲約 0.3 秒,開啟思考的中位數延遲為 3.3 秒,可透過限制推理鏈長度(max_think)來加速。官方已釋出模型權重、完整訓練程式碼與 train/dev/test 資料,並提供可直接替換 Jev Python SDK 的 jeeves_sdk。
讀原始報導

社群討論

社群普遍質疑 Jeeves 長達 17 秒的 p90 延遲與自迴歸推理,完全違背 Jev 模型「快速、低成本」的初衷,且 MMLU 成績還掉了 10 分。網友實測(M5 Pro 48GB)100 筆推文分類耗時逾 30 分鐘,準確率 68 也低於 Jev 的 79。部分開發者建議不如直接用傳統 LLM 強制輸出 JSON,或依任務需求採用 Jev 與 LLM 的混合架構。