跳到主要內容
2026-09-23 日報
開發生態

NVIDIA 推出 PAIR 測試版:整合區域網路算力,自動分配本地多代理推論請求

AI 前線單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,NVIDIA 推出 Personal AI Router(PAIR)測試版,旨在整合區域網路內多台電腦的推論能力,並自動分配 AI 請求,以解決本地多代理(Multi-agent)工作負載導致單一 GPU 效能瓶頸的問題。 PAIR 透過代理接收請求,辨識引擎與模型需求後,選擇符合條件的節點執行並回傳結果。該工具可與 Ollama 及 LM Studio 等本地推論服務無縫整合,開發者無需更改底層架構或代理框架。 在官方展示中,結合 Hermes Desktop、Ollama 與 PAIR,將任務拆分為五個獨立分析,並分配至 RTX Spark、DGX Spark 與 RTX 5090 執行。與單台 RTX Spark 筆記型電腦相比,完成時間縮短約一半。此外,有 Reddit 用戶實測透過 PAIR 將推論任務分配至三張運行 Qwen 3.8 27B 模型的 RTX 5090 顯示卡,能有效維持多 GPU 滿載運作。 系統支援 Windows 11、Linux 與 macOS(含 x64 與 arm64 架構),允許不同作業系統的節點配對。NVIDIA 特別澄清,PAIR 僅負責將單一推論請求分配至可用系統,並不會將多張 GPU 或 VRAM 合併為單一大型加速器。 目前 PAIR 已於 GitHub 開放下載。若使用者需要透過網路共享 GPU 算力或拆分大型模型,報導建議可參考 Petals 或 Mesh LLM 等其他平台。
讀原始報導

背景

隨著大型語言模型在本地端運行的需求增加,如 2023 年推出的開源平台 Ollama 讓使用者能透過本地 GPU 基礎架構執行與管理模型。此外,社群也發展出如 Petals 這類以 BitTorrent 形式分散式執行 Llama 2 (70B) 等大型模型的工具,以解決單一硬體資源不足的挑戰。

來源