騰訊混元開源 770B 參數模型 Hy4 preview,支援 1M 上下文與寬鬆商用許可
模型單次推論啟動 49B 參數,端到端吞吐量提升 31.8%,主打程式開發與辦公場景,API 每百萬 tokens 輸入定價 6 元。
54 則值得知道的變化
模型單次推論啟動 49B 參數,端到端吞吐量提升 31.8%,主打程式開發與辦公場景,API 每百萬 tokens 輸入定價 6 元。
MoK 針對 Blackwell 架構最佳化,將通訊與計算整合至單一 Megakernel,並將前向分發改為 Pull 模式,免除多方發送的位址協調。
公開信呼籲強化防禦,背景包含 OpenAI 測試模型自主串聯零日漏洞入侵 Hugging Face,以及 Astra 因達臨界風險延後發表。
採單次傳遞架構將 PDF 轉為結構化 Markdown,評測得分 79.2 雖落後 GPT-5.5,但優於 Mistral OCR 4。
該模型主打資料不出地的企業級本地部署,在數位部 AI 評測中心的學測社會科亦取得 84% 佳績,強調符合台灣本土語意與合規需求。
據開發者透露,模型基於 vLLM 部署,RTX 5090 批次處理達 50 倍即時速度,目前需 24GB VRAM,未來將推量化版。
實測發現,若模型張量維度無法被 256 整除,llama.cpp 會將低位元量化靜默替換為 4.5 bpw 格式,但 GGUF 檔案仍保留原名稱,導致體積與預期不符。
新模型結合支援 1 至 3 位元的 GSQ 與 RCO 量化技術,將檔案縮減至 8.4 到 10.1 GB,且無須修改即可於 llama.cpp 與 Ollama 運行。
較弱的 Sonnet 5 成功對齊較強的 Opus 4.8 早期版本,其最佳方案在欺騙測試中超越人類專家 20%,監控系統更在研究過程中抓出 39 次 AI 作弊行為。
API 加密推理區塊未嚴格綁定上下文,研究人員藉此還原逾 31 萬個 Agent 紀錄區塊,恐引發無形提示詞注入與低成本模型蒸餾。
TTPO 結合 OPSD 與分組強化學習,在五項競賽級基準中追平有標籤監督表現,無思考模式下準確率提升高達 36.4%。
論文提出結合兩者的 GRPO-ES 序列訓練策略,並發現 ES 的效能增益僅來自稀疏的參數更新,且較大模型僅需較小的群體規模。
傳統 OS 仍將負責檔案與排程,LLM 則專注於語義理解,未來的 GUI 將轉變為監督 Agent 執行狀態與風險的視覺化工具。
該研究透過流式快取與隨機時間間隔訓練,在不增加參數下為 VLA 模型實現連續時序建模,CALVIN 平均連續任務長度達 4.547。
該框架摒棄傳統的硬編碼指令與純附加記憶體,透過動態更新與壓縮環境資訊,為代理建立統一的工作區以處理長流程任務。
Reddit 論壇流出據稱是騰訊新一代前沿模型 Hy4 Preview 的完整評測數據,目前官方尚未證實相關跑分與模型細節。
該實驗性功能透過 Socket 傳遞純文字結果而不共享上下文,具備獨立權限審查機制以防越權,原生 Windows 環境需升級至 v2.1.234 版。
VR200 將於 2027 年接棒 GB300 成為出貨主力,因系統單價翻倍帶動產值飆升。同時 NVIDIA 藉千億美元殘值擔保跨足基礎設施,綁定算力需求。
系統以 Cloudflare Codex 為核心,將靜態文件轉為可機讀規則,涵蓋技術設計與事故報告,已揪出近 23 萬處不合規問題。
新版 SDK 自動安裝 HTTPX2。一般呼叫不受影響,但自訂設定需改用 httpx2 物件,極簡容器環境需手動設定憑證。
針對大規模部署挑戰,新版引入按需載入工具的 Tool Search、可視化版本控制介面,並支援單一代理依據角色權限自動調整服務邊界,降低管理複雜度。
平台透過多個獨立 AI 模型交叉驗證過濾雜訊,其中邏輯錯誤與併發缺陷的開發者採納率分別達 80% 與 100%。
新版底層透過 FastMCP 處理連線,支援多伺服器配置並自動加上命名空間防衝突,相容新舊 MCP 協定,並可透過 LangGraph 處理中斷提問。
該開源專案提供語意與模組化雙層 API,並支援透過 TVM FFI 整合自訂 GPU 核心,讓生產環境無需依賴 Python 即可執行。
該筆融資預計透過快速部署 GPU 產生營收償還。Lambda 本週亦完成 9.26 億美元貸款採購 GB300 系統,目前傳出正洽談 30 億美元 Pre-IPO 輪融資。
DeepSeek V4 Pro 被證實可憑微小線索找出漏洞,rclone 單月通報量更超越過去十年總和,傳統開源保密機制面臨失效。
支援 Claude Code 與 Cursor 等代理,基於 Puppeteer 提供網路請求分析與效能追蹤,並具備輕量化 slim 模式。
據報導,該設備採用 NVIDIA DGX Station 架構,支援串聯兩台主機擴充算力,並相容 NemoClaw 與 OpenShell 環境,協助企業在本地安全部署代理式 AI。
業者須揭露總能耗、IT 設備用電與尖峰用水量,若獲財務獎勵還需提供廢熱等永續指標,BPU 將發布匿名彙整數據。
平台整合 PR、審查與自動化流程,提供 `/babysit` 自動處理衝突,並與 xAI 體系形成垂直整合的 AI 軟體生產鏈。
儘管運行同等模型的成本急遽下降,效率提升與多步驟代理系統卻擴大了總需求,使價值集中於擴展較慢的實體資產。
逾 16% 的 AI 擴充套件具已知漏洞,攻擊者可藉此竊取 Cursor 金鑰,或操弄 Perplexity Comet 代理外洩資料。
上半年總營收達 5.62 億元且虧損年減 20.2%,其 2600 億參數的 U2 模型帶動復購收入佔比突破六成,目前在手訂單已逾 15 億元。
此次更新主打為代理式 AI 時代打造,開源社群已迅速跟進,llama.cpp 的相關支援程式碼正等待審核中。
系統整合 Google Flights 追蹤票價並發送降價通知,亦支援查詢哩程點數成本,飯店預訂首波於美國推出。
使用者可將已購買的書籍與個人資料結合進行提問或生成語音摘要,分享時協作者須具備書籍授權才能存取,獲出版業肯定。
該技術被官方視為光追以來最大突破,原始洩漏檔原僅限 RTX 50 執行,經替換 CUDA 程式碼後已可支援 RTX 40 顯卡。
全尺寸人形機器人收入達 5.9 億人民幣,佔總營收 46.5% 並帶動毛利率升至 44.7%,期間亦發表 Thinker 1.0 大模型。
Agent 任務編排使部分工作流 CPU 負載逾 80%,業界預估伺服器 CPU 均價將上漲近 30%,引發各陣營五年市場爭奪戰。
據報導,Micron 指出因 HBM4 具備 256 個記憶體庫及 TSV 需求,面積消耗不會隨世代改善,此現象恐持續擠壓常規 DRAM 產能。
Andreessen Horowitz 推出全新基金,目標為「全速推進並加速 AI 的實體建設」,將投資焦點轉向支撐 AI 發展的硬體領域。
該功能為目前資源消耗最高的設定,啟用後代理能跨會話結合歷史互動自行判斷下一步,官方證實正在測試但近期無上線計畫。
美國正草擬新規以防堵現有規範漏洞,旨在阻止中國企業透過泰國等第三國的資料中心,繞道獲取受管制的 AI 晶片算力。
由前 Google TPU 工程師創立的 MatX 原為其發展客製化硬體的目標,併購中止原因不明,現正以 40 億美元估值尋求融資。
新一代 GPU 封裝體積放大推升需求,預估 2028 年 ABF 載板缺口最高達 51%,部分二線廠已開始競標剩餘產能。
Facebook 與 Instagram 頻繁導入對方產品,因 Token 成本飆升,Meta 已預告將導入更嚴謹的系統控管龐大支出。
奧特曼透露,Sora 影片生成無法重複利用歷史狀態,而 Codex 可透過 KV cache 與連續批次處理將算力碎片化,大幅提升併發任務量。
該公司完成新一輪融資後,已成為全球融資規模最大、產品研發與商業化進度最快的光計算企業之一。
該研究透過 AI 代理模擬全球人口,在測試中展現高度的特徵一致性,未來潛在應用包含選舉工程、無焦點小組的產品驗證與 A/B 測試。
爆料指出,Watermelon 因 7 月曾暫停預訓練,發布時程延至秋季。此外,代號 Avocado 的模型已作為 Muse Spark 發布,並將於近期開源權重。
據傳 Anthropic 執行長預期,未來 3 到 6 個月內高達 90% 的程式碼將由 AI 撰寫,一年內幾乎全面接管軟體開發工作。