研究與評測
量子位:聯想 TianxiCode 搭配 DeepSeek-v4.1-Flash,以 71% 登上 SWE-bench-Live Lite 榜首
量子位單一來源
核實資料不足
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
本次未取得足夠原文證據

據量子位報導,聯想天禧 AI 自主研發的程式碼智慧體框架 TianxiCode,搭配 DeepSeek-v4.1-Flash 參加 SWE-bench-Live Lite 評測,以 71% 的問題解決率登上全球第一;報導稱該成績已通過官方審核。由於目前僅有單一來源,相關排名與成績尚待獨立確認。
報導指出,SWE-bench-Live 以真實 GitHub 專案問題為基礎,評估模型與智慧體產生程式碼修補、修復問題的能力,並提供可重現的執行環境。TianxiCode 與 DeepSeek-v4.1-Flash 被指已通過官方「Verified」核驗,提交了完整的智慧體運行軌跡,接受評測輸入、資訊隔離環境,以及是否洩露標準答案、測試案例或結果等檢查。
聯想資料將 DeepSeek-v4.1-Flash定位為負責閱讀程式碼、理解語意與構思解法的模型,TianxiCode則負責跨檔案多跳檢索、上下文管理、自主規劃、多輪工具呼叫、閉環修補與測試驅動自我修正。報導稱,該框架會在隔離環境中執行程式碼,發現錯誤或功能遭破壞後重新修改,直到修補程式通過專案驗收。TianxiCode 未來將應用於聯想 AI 硬體產品。本文由聯想提供,量子位獲授權轉載。
讀原始報導