跳到主要內容
2026-08-01 日報
研究與評測

Reddit 預註冊實驗:同一 4B 模型因 agent harness 設計不同,分類準確率從 60% 到 82%

Reddit r/LocalLLaMA未證實
據 Reddit r/LocalLLaMA 貼文(未經驗證),一項針對「Kubernetes issue → SIG triage」分類任務的預註冊消融實驗,使用同一個 4B 模型、相同的 250 筆標註資料集與評分器,僅改變 agent harness 設計,準確率便在 60% 至 82% 間波動,差距達 22 個百分點;實驗在配備 6GB GPU 的筆記型電腦上執行。測試變因包括規則放置位置、證據順序、回合結構,以及跨回合保留的內容。結果顯示,將明確規則寫入提示詞可提高 13 個百分點;先呈現任務、再提供參考資料可提高 6.5 個百分點;增加一個推理回合反而降低 5 個百分點;每回合清除上下文、改以摘要取代原始證據會降低 12 個百分點;在不同階段間建立全新工作階段則降低 15 個百分點。貼文稱,設計最差的 harness 額外增加一個階段並執行 250 次工具呼叫,最終仍回到裸模型的準確率。作者表示,語料、評分器、預註冊資料與每次執行的設定檔均已公開存檔;結果可在不使用 GPU 的情況下重新評分,但產生新預測仍需 GPU。實驗使用的 eval harness 與結果矩陣收錄於 TGPSKI 的 leather 專案。
讀原始報導
相關主題