研究與評測
程式碼代理框架實證研究:規劃功能為強模型節省成本,規則刪減搭配 LLM 摘要最有效率
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 arXiv 最新提交的論文,研究團隊針對程式碼代理(Coding Agents)的框架(Harness)設計進行實證研究,在 SWE-Bench Verified 與 Terminal-Bench 2.1 基準測試上,針對 4 款模型評估了 176 種涵蓋上下文管理、規劃與動作空間的設定。在上下文管理方面,當上下文視窗預算緊縮時其價值越發明顯,主要效益來自防止上下文溢位;其中「先以規則進行刪減,再由 LLM 進行摘要」的策略效率最高,而讓被刪減內容可復原的機制幾乎未被模型使用,也無法提升準確率。在規劃(Planning)功能上,對於較弱的模型能提供準確率支撐,但對於較強的模型則轉變為節省成本的工具,對準確率影響不大。在動作空間設計上,預先定義的工具能改善 Bash 能力較弱模型的表現;但具備 Bash 能力的模型僅需純 Bash 介面即可有效運作,並在以命令列為主的任務中大幅降低成本。軌跡分析顯示,上下文管理延長了執行軌跡,規劃功能改變了軌跡停止的時機,而動作空間則影響了程式碼撰寫的粒度。
讀原始報導社群討論
社群高度肯定這項實證研究,認為在充滿迷思的 AI 領域中,證明「簡單 harness 或純 bash 環境往往勝過複雜工具」極具價值;數據顯示上下文管理在小視窗下效益顯著(32k 下成功率差距達 35.7 分,128k 僅差 2.7 分),許多開發者也分享透過手動 checkpoint 來節省成本的實務經驗。然而,部分留言質疑該研究未使用 Qwen 或 DeepSeek 等最新前沿模型,且對「bash capable」的定義及「harness」一詞的具體意涵存在分歧。