DeepSeek 發布 552B 多模態模型 V4.1-Flash:輸入僅啟動 8B 參數,KV Cache 縮減至前代四分之一並下調 API 定價
新模型支援百萬 Token 上下文,程式能力追平 OpenAI,但科學與影像分析較弱;API 已上線並計畫淘汰 V4 Pro。
69 則值得知道的變化
新模型支援百萬 Token 上下文,程式能力追平 OpenAI,但科學與影像分析較弱;API 已上線並計畫淘汰 V4 Pro。
該模型已應用於 ChatGPT,開發者可依需求搭配不同後端模型,定價為每分鐘 0.05 美元,Yelp 已將其用於電話訂位服務。
與摩根士丹利及 Evercore 合作開發,專攻華爾街研究與建模任務。其搭載的 GPT-6 Astra 評測達 64.6%,API 成本預估降 31%。
該模型又稱 LingBot-World-Infinity,包含四項重大升級。團隊採用因果預訓練與蒸餾技術解決長時生成變形問題,並同步釋出預訓練底座。
該模型支援從衛星圖或文字端到端生成全尺寸 3D 空間,覆蓋逾 196 國,目前已應用於飛行街景 2.0,並與賓士達成終端合作。
配合新模型發布,曾與馬斯克共事七年的 OpenAI 工程師趙迪釋出封存三個月的對談,探討基礎設施、世界模型與智能平權。
中國版名為「夠搭」,採用基礎模型與 Agent 雙輪架構,透過子 Agent 協同處理腳本、分鏡與音效,官方稱內容可用率提升至 85%。
S1 免重新訓練即可執行長達 10 分鐘的新任務,單步成功率達 66%,並帶動公司在商業部署 10 個月內年度經常性收入達 1 億美元。
新發布涵蓋資料生成、仿真到部署全流程,其中 14B 參數動作模型 AnuVerse-0.5 支援單張桌面顯示卡百毫秒級推理,並已接入 SAP 系統。
據報導,GPT Image 2.5 已向 ChatGPT 全平台開放,新版主打光影紋理升級,並提升多輪修圖時對主體的保留能力。
該模型採 432B-A28B 架構與 Gated DeltaNet 提升長文本效率,透過 CISPO 蒸餾領域專家,官方稱其推理過程使用的 token 較競品少 37%。
該模型透過單次強化學習訓練所有推理層級,在 FrontierCode 1.1 取得 50% 成績,逼近 Fable 5.1 但成本降低 64%,即日起於 Devin 桌面版與 CLI 推出。