跳到主要內容
2026-09-16 日報
研究與評測

焱融科技發布 YRCache 與 ContextBox 共享快取一體機,實測長文本首 Token 延遲降低逾 89%

AI 前線單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,焱融科技發布 AI 原生推論儲存系統 YRCache 及共享快取一體機 ContextBox,旨在解決大模型推論時 KV Cache 跨節點共用的瓶頸。 ContextBox 在架構中被定位為介於本機 SSD 與持久化儲存之間的「G3.5 層」。硬體方面,單台最多搭載 26 顆 U.2 NVMe SSD,配置 4 張 NVIDIA BlueField-3 雙埠 200Gb DPU 以卸載資料路徑,透過 RDMA/RoCE 網路提供 120GB/s 實測頻寬,可支撐 8 節點叢集的高併發吞吐。軟體層面,YRCache 負責快取匹配、生命週期管理與跨層級流動,並相容 LMCache 與 Mooncake 等生態。 據焱融披露的企業實測數據,在 8 張 NVIDIA H20-3e(單卡 141GB HBM)運行 SGLang 與 GLM-5.1 的環境下,導入 YRCache 與 ContextBox 後,於 31K 至 129K 長輸入區間內,首 Token 延遲(TTFT)降低 89% 至 94%,Token 吞吐量提升 3 至 6 倍。 此外,在日前公布的 MLPerf Storage v3.0 評測中(該版本新增了 KV Cache 測試項),焱融 F9000X 全快閃儲存三節點叢集在 3D U-Net 訓練資料供給測試達 544GiB/s 聚合頻寬,並於 Checkpoint 70B 測試取得讀、寫頻寬雙項第一。
讀原始報導
本期分類