跳到主要內容
2026-08-14 日報
前瞻與傳聞

據報輝達推出 NeMo Switchyard 路由方案與 30B MoE 模型,動態分流最高降 74% 成本

TechNews 科技新報單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,輝達(Nvidia)推出 NeMo Switchyard 路由方案與 Nemotron 3.5-30B-A3B-Lightning 模型,旨在透過動態分流降低企業 AI 部署成本。 NeMo Switchyard 運作於推論伺服器 API 與各模型之間作為代理層,依據任務難度、延遲要求及成本,將請求動態分配給較小或本地部署的模型,而非一律送往大型模型。輝達指出,相較於單獨依賴 Claude Opus 4.8,此分流策略最高可降低 74% 的任務完成成本,準確率僅微幅下降約 6 個百分點;同時強調企業應評估「完成任務的總成本」,避免廉價模型因消耗過多 Token 而失去成本優勢。 為配合路由策略,輝達同步釋出兩款模型:Nemotron 3.5-30B-A3B-Lightning 為 300 億參數的 Mixture-of-Experts(MoE)開放權重模型,主打低延遲與通用性;Nemotron Parse 則是專為解析 PDF 圖表、表格與複雜文件脈絡的任務專用模型。 針對大小模型的使用時機,輝達建議導入 AI 代理(AI Agents)與程式碼助理,透過「代理與子代理」的分工模式,讓系統學會將基礎工作指派給較小的任務模型,並由大型前沿模型專注於強大推理與統籌。
讀原始報導

背景

Mixture of Experts (MoE) 是一種機器學習技術,透過多個專家網路分工處理不同任務,以提升整體運算效率。模型路由器則是介於應用程式與語言模型之間的代理層,負責根據需求動態分發與轉譯流量。

來源