騰訊混元開源 770B 參數模型 Hy4 preview,支援 1M 上下文與寬鬆商用許可
模型單次推論啟動 49B 參數,端到端吞吐量提升 31.8%,主打程式開發與辦公場景,API 每百萬 tokens 輸入定價 6 元。
機器之心綜合 4 家多家報導
54 則值得知道的變化
模型單次推論啟動 49B 參數,端到端吞吐量提升 31.8%,主打程式開發與辦公場景,API 每百萬 tokens 輸入定價 6 元。
MoK 針對 Blackwell 架構最佳化,將通訊與計算整合至單一 Megakernel,並將前向分發改為 Pull 模式,免除多方發送的位址協調。
公開信呼籲強化防禦,背景包含 OpenAI 測試模型自主串聯零日漏洞入侵 Hugging Face,以及 Astra 因達臨界風險延後發表。
據開發者透露,模型基於 vLLM 部署,RTX 5090 批次處理達 50 倍即時速度,目前需 24GB VRAM,未來將推量化版。
實測發現,若模型張量維度無法被 256 整除,llama.cpp 會將低位元量化靜默替換為 4.5 bpw 格式,但 GGUF 檔案仍保留原名稱,導致體積與預期不符。
新模型結合支援 1 至 3 位元的 GSQ 與 RCO 量化技術,將檔案縮減至 8.4 到 10.1 GB,且無須修改即可於 llama.cpp 與 Ollama 運行。