跳到主要內容
2026-10-04 日報
模型發布

Aleph Alpha 釋出開源權重模型 Kolibri,具 78B 參數與 1M 脈絡長度

Hacker News綜合 2 家報導多家報導
已查原文 · 3 項主張

多個報導來源提及此事;未必是彼此獨立的證據。

經查證,Aleph Alpha 於官方部落格發布的公告完全支持報導中的各項重要主張。原文證實了新模型 Kolibri 在德國統一日發布,為具備 78B 總參數、支援 1M 脈絡長度的英德雙語 MoE 架構,且以 Apache 2.0 授權於 Hugging Face 上架。報導提及的應用領域(如公共行政)、主權(Sovereignty)保障,以及其無需人工介入即可穩定運作的自動化訓練管線和技術報告等細節,皆與原廠宣稱的內容一致。

模型發布與規格:於德國統一日發布 78B 參數(活躍 3B)的雙語 MoE 模型 Kolibri,支援 1M tokens,採 Apache 2.0 上架於 Hugging Face。

原文明確記載在德國統一日釋出此模型,具有 78B 總參數,並且開源授權採用 Apache 2.0。

Day of German Reunification

查看原始出處

78B total parameters

查看原始出處

Apache 2.0

查看原始出處

定位與特性:專為公共行政等關鍵任務設計,最佳化德語與推理,強調「主權」以保障供應鏈、透明度與智財安全。

文章提及模型設計針對公共行政領域等受管制任務,並以主權(Sovereignty)涵蓋其安全與透明度特性。

public administration

查看原始出處

Sovereignty

查看原始出處

開發過程與文獻:基於前代的自動化管線,能在故障時無需人工介入穩定運行,官方亦同步釋出技術報告。

原文說明自動化管線確保遇到硬體問題時不需人員介入,並請讀者參閱其技術報告以獲取詳細資訊。

ran without a person

查看原始出處

tech report

查看原始出處
Aleph Alpha 於德國統一日釋出全新開源權重模型 Kolibri。該模型為英德雙語的 Mixture-of-Experts Transformer 架構,總參數達 78B(活躍參數 3B),支援高達 1M tokens 的脈絡長度。完整模型權重已於 Hugging Face 上架,並採 Apache 2.0 授權條款。Kolibri 專為公共行政、工業與航太等受監管領域的關鍵任務設計,針對德語、推理、數學及代理行為(agentic behavior)進行最佳化。官方強調該模型具備「主權(Sovereignty)」,提供完整的供應鏈完整性、透明度與智慧財產權安全性。其開發基於前代模型 Kolibri Origin(總參數 30B,脈絡長度 65k)的自動化訓練管線,該管線能在硬體或網路故障時無須人工介入即可穩定運行。官方亦同步釋出詳細的技術報告(Tech Report)。
讀原始報導

背景

Aleph Alpha 是一家專注於為企業與政府機構開發大型語言模型的德國人工智慧新創公司。其新模型採用的 Mixture of Experts(MoE)架構,是一種透過多個專家網路來劃分問題空間的機器學習技術,屬於一種集成學習(ensemble learning)方法。

社群討論

社群讚賞該模型極高的透明度與 78.1B 總參數/3.46B 活躍參數的 MoE 架構(訓練資料達 24T tokens,逾 20% 為德文),實測在 RTX 6000 上 fp8 推論速度可達 170 tkn/s。然而,許多人強烈質疑其「主權(sovereign)」宣傳,指出公司即將與加拿大 Cohere 合併,且實測發現它會給出過時的德國法律建議(忽略 2024 年的 DDG 法案)。此外,網友也批評其基準測試避重就輕,不僅未與 Qwen3.8 Flash 比較,在自家的德文測試中甚至以 70.8 分敗給 Qwen3.8 27B 的 79.9 分。

來源