Aleph Alpha 釋出開源權重模型 Kolibri,具 78B 參數與 1M 脈絡長度
已查原文 · 3 項主張
多個報導來源提及此事;未必是彼此獨立的證據。
經查證,Aleph Alpha 於官方部落格發布的公告完全支持報導中的各項重要主張。原文證實了新模型 Kolibri 在德國統一日發布,為具備 78B 總參數、支援 1M 脈絡長度的英德雙語 MoE 架構,且以 Apache 2.0 授權於 Hugging Face 上架。報導提及的應用領域(如公共行政)、主權(Sovereignty)保障,以及其無需人工介入即可穩定運作的自動化訓練管線和技術報告等細節,皆與原廠宣稱的內容一致。
模型發布與規格:於德國統一日發布 78B 參數(活躍 3B)的雙語 MoE 模型 Kolibri,支援 1M tokens,採 Apache 2.0 上架於 Hugging Face。
原文明確記載在德國統一日釋出此模型,具有 78B 總參數,並且開源授權採用 Apache 2.0。
Day of German Reunification
查看原始出處
78B total parameters
查看原始出處
Apache 2.0
查看原始出處

背景
Aleph Alpha 是一家專注於為企業與政府機構開發大型語言模型的德國人工智慧新創公司。其新模型採用的 Mixture of Experts(MoE)架構,是一種透過多個專家網路來劃分問題空間的機器學習技術,屬於一種集成學習(ensemble learning)方法。
社群討論
社群讚賞該模型極高的透明度與 78.1B 總參數/3.46B 活躍參數的 MoE 架構(訓練資料達 24T tokens,逾 20% 為德文),實測在 RTX 6000 上 fp8 推論速度可達 170 tkn/s。然而,許多人強烈質疑其「主權(sovereign)」宣傳,指出公司即將與加拿大 Cohere 合併,且實測發現它會給出過時的德國法律建議(忽略 2024 年的 DDG 法案)。此外,網友也批評其基準測試避重就輕,不僅未與 Qwen3.8 Flash 比較,在自家的德文測試中甚至以 70.8 分敗給 Qwen3.8 27B 的 79.9 分。
來源
- Hacker Newsaleph-alpha.com
- Hacker Newstej.as
- Reddit r/LocalLLaMAreddit.com
- en.wikipedia.org
- en.wikipedia.org