Kimi K3登Agent Arena第4
Kimi K3 在逾 8,000 場真實代理任務中登上 Agent Arena 第 4 名,追平 Claude Opus 4.8 與 GPT-5.6 Sol,並在確認任務成功率排名第 1。相較 Kimi K2.7 Code 的第 23 名,其代理效能明顯躍升,但可操控性與 Bash 錯誤恢復能力僅分列第 14 與第 17。
23 則值得知道的變化
Kimi K3 在逾 8,000 場真實代理任務中登上 Agent Arena 第 4 名,追平 Claude Opus 4.8 與 GPT-5.6 Sol,並在確認任務成功率排名第 1。相較 Kimi K2.7 Code 的第 23 名,其代理效能明顯躍升,但可操控性與 Bash 錯誤恢復能力僅分列第 14 與第 17。
據愛範兒報導,千問新一代旗艦基座模型 Qwen3.8-Max-Preview 已開放所有使用者體驗,具備 2.4T 參數,最高支援 1M 上下文。透過 Qoder 的實測顯示,其程式生成速度快,但在複雜 3D 場景與 App 仿製任務上的成果不穩定。
據單一來源 Interconnects 報導,Moonshot AI 於 7 月 16 日發布 2.8T 參數 MoE 旗艦模型 Kimi K3,並承諾於 7 月 27 日釋出權重。
Apple ML 發表 RayRoPE,為多視角 Transformer 提供具幾何感知與 SE(3) 不變性的投影射線位置編碼。該方法利用射線上的預測 3D 點與查詢視角投影座標計算多頻率相似度,並可在位置不確定時解析計算期望編碼。
Apple ML 發布 LVSum,這是一套具細緻時間對齊標註的長影片摘要評測基準,收錄橫跨 13 個領域的 72 支影片,平均長度為 16 分鐘,每支影片最多有 10 份含時間參照的人類摘要。評測涵蓋內容相關性、模態一致性與標準自動化指標,結果顯示逐字稿對摘要品質的貢獻遠高於單獨使用視覺影格。
Apple ML 提出 Length Value Model(LenVM),在每個解碼步驟預測剩餘生成長度,並以每個 token 的固定負獎勵建立有界的折扣回報。此方法提供無須標註、密集且可擴展的 token-level 監督訊號;在 LIFEBench 精確長度匹配任務中,7B 模型的長度分數由 30.9 提升至 64.8。