研究與評測
Floatboat 公布全端 Harness 評測:DeepSeek-V4-Flash 跑分全面超越貴 57 倍的 Claude Opus 4.8
InfoQ 中國多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
2026 年 8 月,Floatboat 公布最新評測數據,使用混合定價每百萬 Token 0.175 美元的 DeepSeek-V4-Flash 跑完五項基準測試,成績全面超越價格貴 57.1 倍的 Claude Opus 4.8。數據顯示,同一個模型在 DeepSeek 官方 Harness 上一項未贏,但接入 Floatboat Harness 後取得五項全勝。該系統增益隨任務長度遞增,短程任務提升 1.9%,長程任務 DeepSWE 提升達 23.6%,HLR(Harness Leverage Ratio)從 0.78 倍成長至 3.57 倍。
Floatboat 捨棄傳統網頁對話框,開發整合檔案管理員、編輯器與瀏覽器的桌面用戶端作為 Agent 執行環境。技術架構上,團隊自研 Runtime、Agent Loop、Tools、Infra 及自適應進化系統 FloatSail,並建構原生檔案協定與 GUI-Agent 雙向協定,讓 Agent 能直接理解並修改使用者操作的 GUI 介面。
與主流強迫 Agent 介入的設計不同,Floatboat 採取「不必然經過 Agent」的策略:若任務可用 Workflow 或一般桌面操作完成,Agent 就不會介入,藉此控制成本。針對通用任務場景,該系統額外具備跨應用身分與權限治理、異構狀態與長期記憶,以及不可逆操作的風險控制能力,以應對社會與規則複雜性,這與主要處理技術複雜性的 Coding Harness(如 Claude Code、workbuddy)形成明確的產品分界。
讀原始報導背景
DeepSeek 是一家於 2023 年成立的中國人工智慧公司,專注於開發開源權重的大型語言模型(LLM)。近期通用 Agent 團隊 Floatboat 採用其模型進行測試,證明透過自研的底層架構與作業系統級入口,能讓開源模型在長程複雜任務中發揮超越昂貴閉源模型的表現。
來源
- AI 前線infoq.cn
- en.wikipedia.org