模型發布
NVIDIA 推出 Nemotron 3.5 Lightning 模型與 NeMo Switchyard,提升代理式 AI 效率並降低成本
NVIDIA Blog綜合 2 家報導一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

NVIDIA 於週二宣布推出專為代理式 AI(agentic AI)工作負載設計的開源混合專家(mixture-of-experts)模型 Nemotron 3.5 Lightning,以及開源路由函式庫 NeMo Switchyard。
Nemotron 3.5 Lightning 具備 300 億參數,為 Nemotron 3 系列繼 Nemotron 3 Nano 後的最新成員。該模型專為多代理系統中的高運算量特定任務(如程式碼審查、資安監控與帳單問答)打造。NVIDIA 表示,與同級模型相比,其輸出速度提升最高達 4 倍,代理任務完成速度加快 30%。此模型由 Nemotron Coalition 提供評估方法、推論軟體與資料集協助開發,企業可透過 NVIDIA NeMo 針對自有領域資料進行後訓練。
為解決企業全面使用前沿模型導致成本過高的問題,同步推出的 NeMo Switchyard 可在代理工作流程中,將每個請求智慧路由至最適合的模型(涵蓋開源、專有及 NVIDIA 模型),開發者無需重寫應用程式。媒體報導指出,NVIDIA 內部測試顯示此路由機制可將任務成本降至三分之一。
兩項工具的結合旨在建立高效的模型系統架構,由前沿模型(如 Nemotron 3 Ultra 或 GPT-5.6)負責工作流程規劃,並將特定任務交由 Nemotron 3.5 Lightning 執行,以提升跨 PC、工作站、資料中心與雲端的 AI 部署控制力與運行效率。
讀原始報導背景
混合專家模型(MoE)是一種機器學習技術,透過多個專家網路分工處理問題,能在相同的運算預算下大幅擴展模型規模。在多模型協作的系統中,開發者可利用路由機制來管理語言模型的流量,藉此在不同模型的效能、成本與延遲之間取得平衡。
社群討論
社群對小模型發展看法分歧,有人讚賞 nemotron-3.5-lightning:30b-mlx 能在舊 Mac 運行,但也有人認為大模型才是最終解。針對 NeMo Switchyard,開發者質疑跨模型切換時的 prompt caching 機制,並指出 GitHub 標示「非生產環境使用」與新聞稿矛盾。在效能比較上,NVIDIA 被批評圖表刻意漏掉 Qwen,而競品 Meta Muse Glimmer 30B 雖被提及,但網友指出其 active parameters 是 Lightning 的 10 倍,導致同硬體下速度慢約 10 倍。
來源
- Hacker Newsblogs.nvidia.com
- Hacker Newshuggingface.co
- X @ArtificialAnlysnitter.net
- VentureBeatventurebeat.com
- Reddit r/LocalLLaMAreddit.com
- Reddit r/LocalLLaMAreddit.com
- huggingface.co
- en.wikipedia.org
- developer.nvidia.com