跳到主要內容
週報

開源前沿模型接力,AI進入代理治理時代

2026-07-13 ~ 2026-07-193 期日報64 則資訊
YUNNEWS 繁體中文 AI 週報 07.13 – 07.19 Kimi K3 Kimi K3 開源前沿模型接力,AI進入代理治理時代 本週在場 Claude Fable 5DeepSeekOpenAIAnthropicAppleGoogle 64 則 3 期日報 七天收束成一頁

這週對讀者的意義

這週真正的變化不是又多了幾個更強模型,而是開源能力、代理執行與治理要求同時進入下一階段。

主線

開源模型追上前沿

本週最明確的主線是開放權重模型開始在前沿能力與實際開發場景同時施壓:Kimi K3 以 2.8 兆參數、100 萬 token 上下文與原生多模態能力登場,並在 Frontend Code Arena 登頂。它在 Artificial Analysis Intelligence Index 得分 57,顯示中國模型已不只是追求單項評測,而是進入多項能力的近前沿競爭;不過完整權重仍要等到 7 月 27 日前釋出,且整體使用體驗仍落後 Claude。接著 Qwen3.8 預告開放權重,InternLM-S2-Preview-397B 與 Soofi S 也擴大了開源模型的規模、長上下文與代理能力選項。下週要看的是 K3 正式釋出後的實際使用表現,以及 Qwen3.8 是否把這場接力推進到更廣泛的模型比較。

代理從聊天走向執行

多則產品更新共同指向同一個轉變:AI agent 正從回答問題,轉向替使用者登入網站、操作應用程式、跨工作階段持續執行任務。Google AI Mode 開始串接 Instacart、Canva 與 YouTube Music,AWS 則以 Claude 應用閘道集中處理身分、權限、成本與政策;VS Code 的 agent host 也把代理執行與視窗介面拆開,讓工作階段能跨視窗接手。1Password for Claude 進一步把逐次授權帶入代理登入,WAIC 展示的智能體手機與騰訊 SkillPay 則把這種能力延伸到終端操作與付費流程。現在的瓶頸已不只是模型會不會做,而是權限邊界、責任歸屬、成本控制與服務方是否願意提供可被代理呼叫的介面。

算力成為競爭與生意

本週的模型競爭背後,算力供應鏈本身也成為主角:華為展示昇騰 950 超節點,NVIDIA 則以 Vera Rubin 宣布面向代理式 AI 持續後訓練的硬體與軟體策略,強調更高的 intelligence per dollar。Meta 與 Anthropic 洽談大額算力租賃、SpaceX 傳出向美國國防部提供資料中心算力,顯示模型公司、雲端業者、基礎設施持有者與政府需求正在重新排列。Databricks 的估值上升,以及 DeepSeek 融資與國家資本介入的消息,則把 AI 競爭延伸到資本與公司治理層面,但多項交易仍只是報導或洽談,不能視為已落地。接下來應區分已公布的硬體與軟體能力,和仍待確認的採購、租賃及融資安排。

能力提升伴隨安全量測

當模型開始長時間操作工具與工作環境,安全問題也從單次輸出錯誤轉向代理行為本身:Arena 新增事實性排名,讓模型不只比人類偏好,也能按事實性重新排序。OpenAI 的 GPT-Red、GPT-5.6 Sol 的資安測試,以及 Manager Coercion Benchmark,分別把提示詞注入、漏洞修復與代理脅迫行為納入更接近實務的評估;另一項研究則揭示自託管 agent 可能透過合法系統呼叫破壞自己的記憶與設定檔。Linus Torvalds 對 Sashiko 的界線也說明,AI 可以進入工程流程,但生成內容仍須由提交者驗證。這條線目前從『模型更強』走向『模型是否可被監督、衡量與追責』,後續要看這些評測是否真正影響產品配置與部署政策。

AI延伸到物理與多媒體

本週的能力擴張不只發生在語言與程式碼,也開始集中到影像、影片與機器人:Google Vids 新增影片生成與數位化身,研究團隊則釋出影片轉場控制、第一人稱 4D 重建與科學圖表生成方法。具身方向同時出現 RynnBrain 1.1、DA-Nav 的偏航恢復,以及 MoSense 全身柔性觸覺系統,分別處理感知、空間規劃、導航與 Sim-to-Real 落差。現代收購 Boston Dynamics 剩餘股權的消息,則顯示機器人商業化仍在尋找從展示走向量產的路徑。這些進展尚未形成單一平台,但共同把前沿模型的競爭範圍從數位工作延伸到可感知、可移動、可生成的現實任務。

跟上週比

上週沒有刊出條目,本週則在三期內累積 64 則,benchmark、industry、agent 與模型發布等分類全面出現,資訊密度從零直接切換到前沿競賽與產品落地並進。每日最高分先由 Kimi K3 連續主導,再由 Qwen3.8 接棒,顯示本週的節奏已從單一模型發布,轉為開放權重模型接力與代理產品化同步加速。

則數64期數3
評測018產業動態017AI 代理016模型發布014開放權重014產品應用014研究012基礎設施010安全對齊09多模態08開發工具07監管法律06

這週的新面孔

上週一次都沒出現過

跑得最久的線

跨了兩天以上,才算一條線

這週的節奏

每天最上面的那一則

下週盯什麼

Kimi K3 完整權重與訂閱容量恢復

權重預計最遲 7 月 27 日釋出,而需求暴增造成的暫停訂閱將檢驗其實際承載力。

Qwen3.8 正式發布與評測結果

它是本週最後一個高分預告,可能直接改變開放模型的前沿排名。

Claude Fable 5 的方案調整

7 月 20 日起分階段納入 Max 與 Team Premium,將反映高階模型需求與成本如何轉嫁給使用者。

DeepSeek 融資與治理傳聞的後續確認

估值、投票權與 IPO 進度說法不一,後續公告才能釐清資本介入的真實程度。

代理事實性與安全評測是否進入產品

Arena 的事實性排名、GPT-Red 與代理脅迫基準已把可監督性具體化,下一步是看業者是否採用。

這週的重心

評測18產業動態17AI 代理16模型發布14開放權重14產品應用14研究12基礎設施10安全對齊9多模態8開發工具7監管法律6投資併購6定價額度6機器人5晶片硬體3

沒人跟進的

Apple Intelligence 獲准在中國大陸部署,以及歐盟要求 Google 開放 AI 助理互通與搜尋資料,都是會改變 AI 服務分發規則的制度性訊號,但本週沒有形成更多後續。Soofi S、turbovec 與 LingBot-Map 等開放工具也較少被延伸討論,卻顯示開源競爭正從模型權重擴展到推理、索引與 3D 重建基礎設施。

這一週的日報