跳到主要內容
2026-09-26 日報
模型發布

開源本地決策模型運行工具 Ollaya 發布:相容 TypeSafe API,RTX 4090 端到端推論僅需 10 毫秒

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,開源本地決策模型運行工具 Ollaya 正式發布,主打相容 TypeSafe API 與極低延遲。Ollaya 採用單次前向傳遞(single forward pass)機制回答問題,無需逐字元(token-by-token)生成。實測顯示,在 RTX 4090 上對 Laya 模型進行 5 個問題的請求,透過 HTTP API 的端到端耗時僅約 8 至 10 毫秒,遠低於 TypeSafe Jev 託管 API 的 236 至 276 毫秒中位數。 該工具直接相容 TypeSafe 的 API 格式(`/v1/systemone` 與 `/v1/models`),官方 TypeSafe Python SDK 0.7.1 可在不修改程式碼的情況下直接切換至本地伺服器。目前 Ollaya 支援多款開源決策模型,包含 Convai Innovations 的 Laya、基於 Qwen3.5 的 decider、Qwen 團隊的 qwen3guard 安全護欄模型,以及基於 ModernBERT-large 的 von 等,未來計畫透過 llama.cpp 支援 GGUF 格式的 LLM 決策模型。 Ollaya 採 Apache-2.0 授權,基於 ONNX Runtime 執行,確保資料留存本地且無 token 計費。平台支援 macOS、Windows、Linux 與 Docker 部署;在 Linux、WSL 2 與 Docker 環境下支援 NVIDIA GPU 加速(需 CUDA 13 及 R580 以上驅動),而 Apple、AMD 與 Intel GPU 目前僅支援 CPU 運行。
讀原始報導

社群討論

社群肯定此專案讓開源決策模型能在本地運行並兼容 Jev API,有使用者成功在僅 4GB VRAM 的舊顯卡(GTX 970)上順利部署 Laya 作為替代方案。然而,實測指出 Laya 在複雜查詢的準確度明顯遜於 Jev,且許多人質疑其分類範例過於簡化、缺乏實際應用價值。此外,多數意見認為 Ollama 隨時能原生支援此功能將削弱該專案的生存空間,並對其過度模仿 Ollama 的網站設計提出侵權疑慮。