Google 推出 Gemini 3.7 Flash 與 Teamwork 多代理框架,成功解決 7 項數學未解難題
Antigravity 付費方案已開放預覽,系統能讓多個 AI 代理在數天內自主提案與審查,並成功打造出從零啟動作業系統的 RISC-V CPU 模擬器。
68 則值得知道的變化
Antigravity 付費方案已開放預覽,系統能讓多個 AI 代理在數天內自主提案與審查,並成功打造出從零啟動作業系統的 RISC-V CPU 模擬器。
為解決 Test-time Scaling 記憶體成本,該方法僅保留指令前綴與最近數千個 token,結合強化學習可處理逾十萬 token 的推論軌跡。
該架構以單一共享核心進行多次迭代,並透過輕量級更新門控調節特徵,支援推論時提早退出以節省算力,訓練程式碼已開源。
該模型將框架定義為四模組協定,能針對任務客製化與自我進化,實測使 GLM-5.2 提升達 20.2 分,表現媲美 Claude Code 等成熟運行環境。
文章指出 ReAct 循環無法應對真實業務的斷線與重啟,建議區分領域現實、業務判斷與軟體運行三種事實,並將 Session 與執行環境解耦以確保任務可交接。
PPE 透過自然語言查詢啟動,由 LLM 協調資料檢索、融合基礎模型並自動訓練。在剛果伊波拉疫區預測中準確率達 83.3%。
數學任務以英文推理表現較佳,文化與安全任務則適合在地語言;模型面對無正解問題時表現下降三至五成,傾向硬答而非主動拒答。
據 Reddit 社群流傳,FrontierMath 已將橢圓曲線秩問題標記為解決。目前尚無細節確認是否由 AI 達成,官方亦未證實。
新架構採混合鍵合垂直整合電路,宣稱提升 41% 能源效率,預計秋季首發於 Kirin 9050,但仍面臨散熱與良率等技術挑戰。
模型總參數達 176B,由 N-gram 負責記憶召回、MoE 負責推理,每次僅啟動 6B 參數,並整合 Gated DeltaNet 與 QSA 機制。
網傳 BixBench3 評測結果指出,目前的前沿 AI 代理已具備重現近半數真實計算生物學研究工作流的能力,此消息尚未獲證實。
該項在 Reddit 社群流傳的未經證實研究指出,AI 代理群體除了傳承文化外,還會在世代交替之間發展出專業的角色分工。
該證明針對具 78 年歷史的數學難題,僅花數天便完成形式化,據稱目前可能尚無人類能完全理解所有細節。