Apple 發表 Agent 共享選擇性持久記憶架構,保留四類上下文使任務完成率達 96%
該架構僅保留任務規格等四類上下文,捨棄推理軌跡以避免干擾,並透過零 Token 資料刷新機制將任務時間縮減 14 倍。
Apple ML一手來源
57 則值得知道的變化
該架構僅保留任務規格等四類上下文,捨棄推理軌跡以避免干擾,並透過零 Token 資料刷新機制將任務時間縮減 14 倍。
新方法引入去噪進度分數與分層遮罩機制,解決擴散模型缺乏時間信用分配與似然估計偏差問題,可隨插即用於任何 GRPO 訓練器。
該技術在訓練軌跡中引入能量指南針評估序列品質,170M 參數模型僅需 8 步推論,效能超越 5 倍大模型的離散生成基準。
報告指出 Agentic AI 將推動數位世界轉向以代理為中心,預期算力集群規模將提升百倍、任務成本下降千倍,並帶動龐大基礎設施投資。
研究發現三元模型零權重佔比高達 51.5%,藉此設計結合位元圖與符號向量的 BITCOS 佈局,取代傳統 5-trit 封裝,有效降低儲存成本。
該框架利用累積的發現歷史作為重播模擬器獲取即時回饋,在演算法、數學最佳化與 GPU 核心工程中,維持發現品質並大幅降低成本。
實驗結合自訂 GRPO 變體與 500 條 GPT-6 Astra 代理軌跡進行蒸餾,使原本無法處理多數查詢的模型,成功超越資料庫預設效能。
小米 Mimo 2.6 的訓練後儀表板已對外公開,網址路徑暗示可能涉及強化學習進展,官方尚未發布該模型或工具的具體細節。