研究與評測
研究提出 Consistency Analyzer 診斷工具,將 GPT-4.1 代理的一致性差距減半至 12%
HuggingFace Blog一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

HuggingFace Blog 發布文章探討 AI 代理的一致性問題,並提出 Consistency Analyzer 診斷工具與 ALTK-Evolve 系統的新指南。
研究指出,在 AppWorld 測試中,使用 GPT-4.1 的 ReAct 代理平均成功率(Mean@5)達 77.4%,但五次運行全數成功的比例(Pass^5)僅 53.0%,兩者存在 24.4 個百分點的「一致性差距」,在困難任務中差距更達 30 個百分點。
團隊發現,即使在 temperature 0.0 的設定下,若決策點的機率分佈過於平坦,模型仍易受 GPU 浮點運算或批次處理等微小擾動影響而改變決策。為此,Consistency Analyzer 透過對代理記錄的軌跡進行重採樣(預設 k=5),找出容易翻盤的決策步驟,過程僅需單次追蹤,不需重新端到端執行任務。
將診斷結果轉化為一致性指南後,在不犧牲平均準確率的前提下,成功將一致性差距從 24.4pp 減半至 12.0pp,同任務的 Pass^5 提升 16.0pp,相似任務亦提升 13.0pp。
讀原始報導