跳到主要內容
2026-07-30 日報
研究與評測

無問芯穹公開PDD推論架構

量子位據報導
據量子位報導,無問芯穹公開跨叢集異質推論架構 PDD 與完整技術報告,透過 RLD 中繼及 Token 重算,降低廣域網路傳輸 KV Cache 的延遲。其在 DeepSeek-V4-pro 與真實 Agentic 工作負載測試中,首 Token 延遲最高降低 51.5%,單 Token 成本降低 37.5%。相關結果目前來自單一報導與團隊測試,仍須更多獨立驗證。
讀原始報導

背景

PD 分離(Prefill-Decode Separation)是將大模型推論拆成 Prefill(預填充)與 Decode(解碼)兩個獨立階段,再依各自的計算特性進行最佳化。無問芯穹於 2026 世界人工智慧大會發布 PDD 跨叢集異質推論架構;實測顯示,其首個 Token 延遲降低 51.5%,單 Token 成本降低 37.5%。

來源