開發生態
J-Space 宣稱 DeepSeek V4 加 Harness 追平 GLM-5.3 遭實測打假,CoT 作者批「小模型+工具」難敵大模型內化能力
AI 科技評論單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,開源專案 J-Space Cognition Suite 宣稱透過外部 Harness,無需修改權重即可讓 DeepSeek V4 Flash 追平 GLM-5.3,搭配 DeepSeek V4 Pro 甚至超越 Claude Fable 5,並稱速度提升 2.53 倍、Token 效率提升 2.21 倍。然而,GitHub 用戶 GoForceX 使用 Terminal Bench 獨立複測發現,加入 J-Space 後基準測試分數不升反降,Token 消耗增加且推理速度變慢。面對社群要求公開原始數據,作者承認數據誇張並刪除質疑的 issue。
此事件引發 OpenAI 思維鏈(CoT)作者 Jason Wei 於 X 平台發文,指出「小模型 + 工具」無法取代大模型內化能力。他點出三大差距:大模型端到端輸出延遲最低,而工具調用會隨步驟增加耗時;大模型具備海量資料轉化的抽象歸納能力;大模型具備全局語意理解與自我糾錯能力,而小模型依賴外部工具在複雜長任務中出錯率更高。
DSPy 框架作者 Omar Khattab 亦呼應此觀點,從數學層面指出大模型的注意力機制將上下文完整保留於記憶體中,以全知視角處理資訊;而小模型加工具本質上是壓縮與遞迴,在資訊傳遞過程中會遺失大量高維資訊,無法完美模擬注意力機制對全局的掌控力。
讀原始報導背景
近期 AI 業界熱烈討論「小模型搭配外部工具」是否能取代昂貴的大模型,以解決算力成本與端側設備的限制。一款名為 J-Space 的開源專案聲稱能透過外部 Harness 工具,讓 DeepSeek 模型效能超越頂尖大模型,但隨即遭社群實測踢爆數據造假。此事件引發 OpenAI 思維鏈(CoT)發明者 Jason Wei 發文,強調大模型內化複雜認知的能力,是外掛工具無法彌補的。