模型發布
OpenRouter 上線神秘多模態模型 Ox Alpha:具備百萬上下文且完全免費,社群實測勝過 Fable 5
InfoQ 中國多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
OpenRouter 上線代號為「Ox Alpha」(完整標識為 stealth/ox-alpha)的神秘前沿模型。該模型具備 100 萬 Token 上下文窗口,最大輸出長度達 13 萬 Token,支援文本、圖片與影片輸入,但輸出形式僅限文本。
根據官方介紹,Ox Alpha 定位於高效程式開發、複雜推理與長週期 Agent 任務(sustained agentic work)。模型支援工具呼叫、tool_choice 以及 JSON 格式的結構化輸出,不過暫不支援嚴格的 JSON Schema 約束。目前 OpenRouter 頁面顯示,其中位首 Token 延遲約 1.95 秒,輸出速度約每秒 49 Token。
定價方面,Ox Alpha 目前在 OpenRouter 上的輸入與輸出 API 均為免費。此外,OpenCode 宣布將在平台上免費開放該模型一週,並提供每日 100T(萬億)Token 的測試容量,以觀察模型在真實程式碼倉庫與長週期任務中的表現。
雖然官方未公布 SWE-bench 等基準成績,但社群已展開密集測試。在「鵜鶘騎自行車 SVG」生成任務中,使用者對比了 low、high 與 max 三檔推理強度。結果顯示,max 檔位會出現明顯的「過度思考」傾向:單次生成耗時拉長至 124 至 355 秒,Token 消耗最高超過 2.6 萬,但換來的主要是雲朵、太陽等裝飾細節,腳與踏板錯位等核心結構問題並未獲得同等幅度的改善。在另一項包含 10 個具體任務的對比測試中,Ox Alpha 以 80% 的平均通過率排名第一,領先於 Fable 5(65%)、GLM-5.3(62%)、Grok-4.6(62%)與 GPT-5.6 Sol(52%)。
關於模型背後的真實開發商,社群目前有四種主要猜測:
一、小米 MiMo V3:小米先前曾在 OpenRouter 匿名測試具備百萬上下文的 Hunter Alpha(後證實為 MiMo-V2-Pro),且兩者皆主打程式碼與 Agent 任務。
二、騰訊混元 HY 4:基於能支撐如此大規模免費調用的算力基礎設施。
三、Google Gemini:基於其百萬上下文與原生影片輸入特徵。
四、智譜 GLM-5.3:有使用者實測指出,Ox Alpha 在 25 個不同提示詞中的原生 Token 數量與 GLM-5.3 完全匹配,在 50/50 對抗字串測試中與 GLM-5.3 的分詞器匹配度最高,且命名風格與智譜先前的 Pony Alpha 相似。
讀原始報導背景
OpenRouter 是一家美國人工智慧公司,提供統一的應用程式介面(API),讓開發者能存取並路由請求至多個開發商的大型語言模型。為了評估這類模型的程式與推理能力,業界通常會使用 SWE-bench 等標準化基準測試來比較其效能。