跳到主要內容
2026-09-28 日報
模型發布

Fireworks 推出基於 Kimi K3 的新模型 Ember-1,主打刪減冗餘推論以降低 40% Token 消耗

Hacker News單一來源
核實資料不足

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

本次未取得足夠原文證據

據 Hacker News 消息指出,Fireworks Research 發布了基於 Kimi K3 的新模型 Ember-1,主打在維持同等品質的前提下,減少 40% 的 Token 消耗。報導稱,Kimi K3 等推論模型在生成時有高達 90% 的 Token 用於內部推論,在多輪 AI 代理任務中會導致上下文呈二次方增長與成本飆升;而單純調低 K3 的推論強度會大幅犧牲品質。 為此,Fireworks 團隊在自家的 Serverless Training 平台上進行逾 50 次實驗與 200 次評測,透過專有資料訓練 Ember-1,使其學會刪除冗餘推論,同時保留重新檢視假設與回應回饋等關鍵的自我反思能力。在 Doximity 提供的 Bedside Bench 臨床基準測試(涵蓋 500 個案例)中,Ember-1 在成本與任務表現的 Pareto 邊界(Pareto frontier)上,超越了 GPT-5.6 Sol、GPT-6 Astra 與 Claude Opus 5。 根據揭露的實測數據,與預設的 K3 Max 相比,Ember-1 在 Terminal Bench 2.1 取得 82.0% 的成績(K3 Max 為 80.9%),成本降低 51.9%;在 DeepSWE 1.1 中達到 75.2%(K3 Max 為 66.4%),成本降低 23.7%;在 SWE-bench Verified 中則以 92.2% 的表現略低於 K3 Max 的 93.2%,但節省了 15.5% 的成本。測試成本是依據 Kimi K3 的公開 API 價格(未快取輸入每百萬 Token 3 美元、快取輸入 0.3 美元、輸出 15 美元)計算,結果顯示 Ember-1 在多項測試中皆能以更低成本達到或超越 K3 Max 的水準。
讀原始報導

社群討論

社群肯定 Ember-1 減少模型過度思考的設計,但強烈質疑其定價,指出其 Token 消耗雖減半但單價卻是 Kimi K3 的兩倍,且目前 Sol 的定價(2/10)比 Kimi(3/15)更具優勢。此外,開發者擔憂 Fireworks 兼做模型研發會產生資料隱私疑慮,並批評其基於開源模型改良卻選擇閉源的做法。技術洞見方面,有人指出 Agent 應用的成本主要在 prefill 而非 decode,且大量留言嘲諷官方過度使用「Pareto frontier」作為行銷術語。