研究與評測
Unreal Labs 推出 Unreal Agent 框架,採非同步工具呼叫,實測較 Codex 節省高達 40% 成本
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,Unreal Labs 推出 Unreal Agent 框架,主打透過完全非同步的工具呼叫管理,降低模型在等待與輪詢(polling)工具時的 token 消耗。
官方指出,當發出工具呼叫時,框架會立即附加「進行中」的日誌記錄並在背景執行,完成後再將結果附加到 session log 並呼叫 LLM。此設計允許使用者在工具執行期間隨時介入,並讓 Agent 在模型呼叫之間排程更多工具工作。架構上,Unreal Agent 採用簡單的提示詞與 token 最佳化的工具結果,不包含子代理或工作流程。官方亦提及,現有如 Claude's Agent SDK 等 CLI 導向的 SDK 帶有本地會話與子程序等假設,難以直接部署於生產環境。
在搭配 GPT-6 Astra xhigh 的官方實測中,Unreal Agent 較 Codex 節省高達 40% 成本,較 Pi 節省高達 20%。官方將微小的通過率差異歸因於評測基準的變異性,具體數據如下:
- Terminal-Bench 4.0:Unreal Agent 通過率 57.9%(花費 1428 美元,28 輪對話),Codex 為 57.9%(2350 美元),Pi 為 55.0%(1827 美元,44 輪對話)。
- SWE-Atlas Codebase QnA:Unreal Agent 通過率 65.8%(936 美元),Codex 為 63.3%(1303 美元),Pi 為 64.0%(1033 美元)。
- DeepSWE 1.1:Unreal Agent 通過率 72.4%(1367 美元),Codex 為 69.0%(1633 美元),Pi 為 69.6%(1584 美元)。
- Agents’ Last Exam (ALE-CLI):Unreal Agent 通過率 30.0%(217 美元),Codex 為 29.0%(292 美元),Pi 為 29.0%(262 美元)。
讀原始報導社群討論
社群對此專案的非同步(async)互動模式抱持期待,但大量留言強烈批評「Unreal Agent」的命名極易與 Epic 的 Unreal Engine 混淆,並擔憂商標侵權風險。技術方面,部分開發者質疑非同步工具呼叫如何實質節省 token,並指出首圖將 Astra xhigh 與 Codex Astra max 比較的基準並不合理。另有實測經驗指出,在實際遊戲引擎專案中,單純暴露 Python 腳本並輸出純文字供 Agent 讀取,其效果大幅超越複雜的 MCP 系統。