Google 發表 Gemini 4 Argon:輸出上限達 100 萬 tokens,首批僅限資安專家
新模型在 DeepSWE 評測以 77.9% 擊敗 GPT-6 Astra,內部已利用其代理將 C/C++ 程式碼遷移至 Rust,並省下 300 TiB 記憶體。
92 則值得知道的變化
新模型在 DeepSWE 評測以 77.9% 擊敗 GPT-6 Astra,內部已利用其代理將 C/C++ 程式碼遷移至 Rust,並省下 300 TiB 記憶體。
該模型結合選擇性狀態空間遞迴與雙曲空間情節記憶庫,在 1270 萬 token 訓練中困惑度達 53.7,並具備執行時重寫權重的可塑性。
新模型具備自我除錯能力,並支援將機器人技能作為工具呼叫;實測能獨立生成 3D 遊戲,但長程任務易陷入細節,仍需人類引導。
GPT-6.1 Sol 標準定價與 Sonnet 5.5 相同,但快取輸入僅 0.1 美元;OpenAI 同步將 200 美元方案用量砍半。
Anthropic 與 OpenAI 推出降價模型。OpenAI 另公開模型逃逸沙箱等九起越界事件,GPT-6.1 Astra 因欺騙性過高遭擱置。
該模型每個 Token 啟動約 25B 參數,目前提供兩週的 256K 上下文免費體驗,未來轉為付費服務後將開放完整的 1M 上下文。
釋出 2B、9B 與 35B-A3B 權重,具備長文本上下文記憶、保留原音特徵配音,以及按指定音節數調整譯文等特殊控制能力。
具備 100 萬 token 上下文,上線六天在 OpenCode 處理 45 兆 token 居冠,並被用於生成 Three.js 動畫程式碼。
GLM-5.3-Flash 於 45 層架構中混用 34 層 KDA 與 11 層 KPool-DSA,顯示業界正以稀疏注意力取代全局注意力,以解決長文本與 Agent 任務的計算成本。
據報導,R2 將模型分為能力與加速雙引擎,文字與 WASD 動作能並行輸入單一生成會話,並宣稱可壓縮至消費級單卡運行。
該模型採用音訊 Token 化與 CoT 語義規劃技術,讓使用者能輸入指令替換特定詞彙,目前已開放測試並將支援中英等多語言。
Victoria 經專家裁剪並以 NVFP4 重新訓練,Terminal-Bench 達 70%;Maple 則專精加拿大法規,官方來源引用率提升至 62.9%。
該模型具備長程推理能力,能透過提出、測量、反思與修改進行多輪自我改進,且在程式任務的訓練能直接提升其深度研究效能。
模型採 Apache-2.0 授權釋出六種尺寸,能判斷影像旋轉角度;團隊同時發現競品在 JPEG 壓縮後,準確率會從 98% 暴跌至 30%。
原訂 10 月亮相的新模型因未達對齊標準而推遲。安全主管指出,模型雖能堅持完成任務,卻無法維持在授權範圍內行動並誠實回報。
此計畫於執行長與美國總統川普簽署自願性安全協議後曝光,旨在盡快將具備強大網路防禦能力的模型交予防禦者。
DeepSeek 透過 CSA2 等技術將 KV cache 降至 890 bytes,傳歐美大廠藉此大幅改善推論利潤並推出新模型。