研究與評測
據報導盛大旗下 EverMind 發表三篇自進化 AI 論文:HarnessBank 提升效能達 15.4%,並建構近 10 萬規模技能庫
量子位單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,由盛大集團孵化的 AI 實驗室 EverMind 連續發表三篇論文,針對自進化 AI(Self-Evolving AI)的長期記憶與持續迭代提出全端技術方案。
第一篇論文《HarnessBank》聚焦 Agent 腳手架(Harness)的自我改進。該框架將「提出變更」與「歸因變更」分離,由語言模型負責診斷失敗並提出補丁,隨後交由確定性程式碼邏輯進行採樣與顯著性檢驗,以避免模型自我評估產生的過擬合。系統引入裝備基因庫(HGB),以「改動環節與引入原因(WHERE × WHY)」作為語意座標存檔,而非傳統的以任務為鍵值。實測以 Qwen3.6-27B 為任務 Agent、Claude Opus 4.8 為進化 Agent,在 SWE-bench、Omni-MATH 等七個多樣化基準測試中,HarnessBank 較 GEPA 與 DGM 取得 5.1% 至 15.4% 的一致效能提升,且所有增益均通過配對顯著性檢驗(z≥1.96)。
第二篇論文《SkillCorpus》針對開源技能生態(如 Skill.md 格式)進行規模化管理。團隊從約 82.1 萬個原始技能中,依實用性、強健性與安全性過濾出 96,401 個高品質技能,並建立包含 16 個類別的分類法。將該技能庫與專屬檢索技術整合至自研的 Raven 框架後,Agent 在 SkillsBench 基準測試中獲得最高 7.5 個百分點的效能提升。
第三篇論文《DASH》則針對模型權重的同策略自我蒸餾(OPSD)進行最佳化。傳統 OPSD 對所有局部散度(學生與教師模型的差異)分配相同係數,忽略了錯誤發生的時序上下文;該研究透過分析真實推理軌跡,指出局部散度值與未來散度演變之間關聯極弱,藉此解決傳統方法在處理長序列推理時的訊號分配盲區。
讀原始報導