跳到主要內容
2026-08-20 日報
模型發布

Ornith-1.5 開源模型發布:具備端到端自我改進框架,397B MoE 效能對標 Claude Opus 4.8

Hacker News綜合 2 家報導多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

Ornith-1.5 基礎模型正式開源發布並上架 Hugging Face,涵蓋 397B MoE、35B MoE 與 9B 密集模型三種尺寸。該模型將 Ornith-1.0 的自我鷹架(self-scaffolding)框架擴展為完整的端到端自我改進迴圈,透過聯合最佳化任務生成、鷹架建構與解決方案 rollouts,並利用強化學習持續提升能力。系統的任務獎勵機制基於有效性、前沿難度(目標成功率設為 0.2)與新穎性,促使模型不斷生成具挑戰性且非冗餘的訓練任務。 在效能評測上,旗艦版 Ornith-1.5-397B 在 Terminal-Bench 2.1 取得 86.1 分、DeepSWE 取得 56.0 分,效能對標 Claude Opus 4.8(85.0 與 59.0),並擊敗同級的 GLM-5.2 與 DeepSeek-V4-Flash-0731。綜合 Reddit 發布資訊,397B 模型在 SWE-Bench Verified 達 86 分、HLE 達 44.6 分、ClawEval 達 81.4 分,Tool Decathlon 則為 71.2 分。 中階的 Ornith-1.5-35B 每個 token 僅啟動 3B 參數,但在 Terminal-Bench 2.1(68.5 分)與 SWE-Bench Verified(79.0 分)大幅超越 Gemma 4-31B 與 Meta 的 Muse Glimmer-30B。邊緣部署版的 Ornith-1.5-9B 亦在 SWE-Bench Verified 取得 70.6 分,其量化版本 Ornith-1.5-9B-Mobile 可直接部署於 iPhone 與 Android 裝置,效能超越 Gemma 4-31B 與 Qwen 3.6-35B 等更大規模的模型。
讀原始報導

背景

混合專家模型(MoE)是一種透過稀疏啟動來擴展模型規模的技術,在處理每個 token 時,只會啟動網路中相關的部分參數。這種機制能以較少的運算資源進行預訓練,讓模型在相同的運算預算下,達到比密集(dense)模型更大的規模。

社群討論

社群對 Ornith-1.5 適合本地部署感到興奮,實測指出 35B-A3B 在 M4 Pro 24G 上能順暢處理 32k 上下文(達 30-40 tps),且網頁抓取速度優於 Qwen 3.8 27B。然而,數據顯示其程式能力明顯落後 Qwen 3.8-27B(如 DeepSWE 僅 22.0 對比 42.2),且 397B 模型因體積過大,即使在 NVFP4 下也無法塞入兩張 Spark 顯卡。此外,針對本地硬體應優先選擇 MoE 還是稠密(Dense)模型,社群存在分歧,部分人認為在 VRAM 限制下,稠密模型能提供更好的輸出品質。

來源