研究與評測
IBM 比較代理記憶機制 ALTK-Evolve 與 ACE:採選擇性檢索,在 DeepSeek-V3.2 測試省下近六成 Token 並提升準確率
HuggingFace Blog一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

IBM Research 於 HuggingFace 發布代理記憶機制(Agentic memory)ALTK-Evolve 與 ACE 的技術對比。兩者皆透過代理過去的軌跡學習並回饋至推論階段,無需更新權重或人工標註;其中 ACE(Agentic Context Engineering)的相關研究論文甫於 2026 年 3 月 29 日發布。
兩套系統皆拒絕將記憶壓縮或摘要成簡短規則,以避免「簡潔偏見」(brevity bias)與「上下文崩塌」(context collapse),並保留每項指南的支援次數(support count)。在記憶建構上,ACE 透過生成、反思與策展迴圈進行增量更新;ALTK-Evolve 則將近似的教訓分群合併,並提取具備因果歸因的子任務級別指南(分為策略、恢復與最佳化三類)。
核心差異在於交付方式:ACE 在每個步驟皆注入完整的記憶指南,而 ALTK-Evolve 則採選擇性檢索,僅提供少量固定核心指南,並依任務動態挑選相關內容。
在 AppWorld 基準測試中,搭配 DeepSeek-V3.2 模型,ALTK-Evolve 的任務目標完成率(TGC)達 89.3,優於 ACE 的 80.4,且每項任務僅消耗 263K Tokens,約為 ACE(634K)的 40%。若搭配較弱的 gpt-oss-120b 模型,兩者準確率相近(56.0 對 54.8),但 ALTK-Evolve 僅需 116K Tokens,推論成本降至 ACE(777K)的七分之一。
難度分析顯示,ACE 的完整指南在較弱模型處理簡單與中等任務時具優勢,但 ALTK-Evolve 的動態檢索在困難任務中表現更佳,避免過長上下文干擾模型。
讀原始報導背景
大型語言模型(LLM)代理程式在執行多步驟任務時,常因無法穩定使用 API 等操作細節而失敗。近期推出的 ACE(Agentic Context Engineering)與 ALTK-Evolve 系統能將代理程式過去的執行軌跡轉化為可重複使用的經驗法則。這讓模型能在推論階段透過上下文自我改進,完全無需更新權重或依賴人工標註。