跳到主要內容
2026-09-25 日報
研究與評測

是石科技推出 Meta-Infer 推理引擎:PCIe 顯卡跑 DeepSeek-V4.1-Flash 吞吐量提升近 7 倍,1.5 台 6000D 影片生成匹敵 B300

量子位單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,是石科技推出 Meta-Infer 高效推理引擎,透過純軟體最佳化彌合硬體與框架間的效能落差,大幅提升 PCIe 顯卡的大模型推理吞吐量。 該引擎具備核心補齊、算子最佳化與通訊重構、平行與容量調優、快取複用四項能力。在 8 張 PCIe-Only 顯卡環境下,DeepSeek-V4.1-Flash 的輸入吞吐量從社群基線的 1932 tok/s 提升至 13274 tok/s(提升 6.87 倍),並支援 1M 超長上下文。 在其他模型表現上,DeepSeek-V4-Flash 輸入吞吐量提升 1.55 倍至 22584 tok/s;GLM5.3 輸入吞吐量提升 1.92 倍,P95 首 Token 延遲從 141.6 秒降至 46.6 秒,上下文上限從 27 萬拓展至 105 萬 Token。 影片生成方面,MiniMax H3 模型 15 秒參考圖生影片速度提升 2.48 倍。與 NVIDIA B300 相比,在 Ours Cache + LoRA 方案下,約 1.5 台 6000D 即可達到 1 台 B300 的文生影片吞吐量,參考圖生影片約需 1.7 台。 該引擎亦在國產 GPU 上完成驗證,透過將 Shared Expert 與 Routed Expert 拆分至兩條 stream 中平行提交,在 35 組同配置測試中帶來 11.26% 的吞吐量提升。
讀原始報導
本期分類