Claude Opus 4.8 Costs 57.1× More, Loses All 5 Benchmarks – Beaten by the Harness Floatboat's V4-Flash model, evaluated by its own Floatboat Evaluation Harness, achieved top rankings on five third-party benchmarks, including first place on Toolathlon (79.62) and third on BrowseComp (87.80), while costing 57.1× less than Claude Opus 4.8, which lost all five benchmarks to the harness. The cost multiplier of 57.1× is based on a 3:1 input-output ratio, with Floatboat set at 1.0×, and the comparison includes 12 models across the benchmarks. 一、本次发布的完整数据 五项第三方基准的实测成绩、按输入输出比折算的成本倍数、每一个对照分数的来源链与 Harness 配置,都在这一节。 1.1 单位成本效率:每 1 美元输出换回多少榜单分 成绩与价格进同一个式子: 榜单真实跑分 ÷ 每百万 Token 输出价 。缺失成绩不补零,也不参与该榜计算。图末六张卡片给出五项基准的逐榜名次与价格榜。 卡片最右一列的 成本倍数 按 8:1 输入输出比折算, 8 × 输入价 + 输出价 / 9 ,以 Floatboat 为 1.0×。全文标题与第二节的 57.1× 出自 3:1 折算,两套比例各自标注,不混算。 图表与卡片默认只列混合成本低于 Floatboat 20 倍的同价位档,成本 ≥20× 的四个高价模型收在按钮之后。 五项基准的单位成本效率,按榜单分列 每 1 美元输出,能换回多少真实榜单分? 统一计算口径 榜单真实跑分 ÷ 每百万 Token 输出价 对比成绩: 按当前榜单动态统计成本倍数:8:1 混合口径 当前结论 色阶 名次在前,灰色更深 名次在后,灰色渐浅 金色为 Floatboat Floatboat 在对比集内的名次 :Toolathlon 第 1/10、BrowseComp 第 3/11、AutomationBench 第 3/12、DeepSWE 第 4/12、Terminal Bench 2.1 第 6/12。以上为各榜完整名次,不受上方同价位档筛选影响。 口径 Floatboat 五项成绩由 Floatboat Evaluation Harness 本次实测。其余模型沿用对应 Benchmark 或厂商公开结果,各家的 Harness、推理配置与数据集版本不尽相同,横向名次因此只用于观察公开成绩区间;同模型的 Harness 对照控制到相同底座与相同输入参数。 成本倍数为 8:1 混合口径 8 × 输入价 + 输出价 / 9 ;全文标题与第二节的 57.1× 为 3:1 混合口径 3 × 输入价 + 输出价 / 4 。两者都是按公开单价折算的估算值,不含缓存命中、长上下文阶梯价与工具调用费,不等于端到端任务成本。 1.2 各模型跑分来源链与 Harness 详表 12 个模型或运行环境在五项基准中的 公开成绩、Harness 配置与比较口径 ,按 8:1 混合成本倍数分两组列出,分组与上方卡片的「成本倍数」列同源。 1.2.1 相对 Floatboat 低于 20× 8 个模型 / 环境,成本倍数 1.0×–18.6×。 | 模型/环境 | BrowseComp 分数 / Harness / 来源 | DeepSWE 分数 / Harness / 来源 | Terminal Bench 2.1 分数 / Harness / 来源 | AutomationBench 分数 / Harness / 来源 | Toolathlon 分数 / Harness / 来源 | 口径说明 | |---|---|---|---|---|---|---| Floatboat / V4-Flash | 87.80 F Floatboat Harness 自研 | 67.25 F Floatboat Harness 自研 | 84.26 F Floatboat Harness 自研 | 27.50 F Floatboat Harness 自研 | 79.62 F Floatboat Harness 自研 | Floatboat 本次发布:五项均由 Floatboat Evaluation Harness 实测。 | DeepSeek V4-Flash 0731 | 映射争议:73.2 D1 未披露/模型标签错配 | 54.4 D2 / 53±4 DS DeepSeek Harness minimal | 82.7 D2 DeepSeek Harness minimal | 25.1 Public D2 DeepSeek Harness minimal | 70.7±0.9 TV / 70.3 D2 DeepSeek Harness minimal(正式对照取 70.7) | A/X:厂商自报为主;Browse 存在标签争议;Toolathlon 官方复测与自报并存。 | V4-Flash Preview | 映射争议:53.5 D1 未披露/模型标签错配 | 7.3 D2 DeepSeek Harness minimal | 61.8 D2 DeepSeek Harness minimal | 10.8 Public D2 DeepSeek Harness minimal | 49.7 D2 / 50.9±1.5 TV DeepSeek Harness minimal | A/X:版本和标签均需显式披露,Verified 新分数与旧版不可直比。 | V4-Pro Preview | 映射争议:80.4 D1 未披露/模型标签错配 | 12.8 D2 DeepSeek Harness minimal | 72.1 D2 DeepSeek Harness minimal | 12.8 Public D2 DeepSeek Harness minimal | 55.9 D2 / 55.9±1.2 TV DeepSeek Harness minimal | A/X:自报与官网 Verified 均有列出,旧模型卡与新版存在变更冲突。 | GPT-5.6 LUNA | 83.3 O OpenAI agentic browsing | 67.2 O / 67±4 DS mini-SWE-agent | 84.7 O / 75.7±1.3 TB Codex CLI / Terminus-2 | 14.9 Private O/AB Zapier 官方 | — | A/X:轻量级底座,Harness 口径不同。 | GLM-5.2 | — | 46.2 D2/G / 44±2 DS mini-SWE-agent | 81.0 D2/G / 82.7 G Terminus-2 / Claude Code | 12.9 Public D2 / 14.0 Private AB DeepSeek Harness minimal / Zapier 官方 | 59.9 D2/K / 59.9±1.9 TV Toolathlon 官方 | A/X:不同 Harness / 数据集口径并存。 | Qwen3.8-Max | 62.0 F 未披露且 Qwen 官网未找到 | 56.6 Q / 57±3 DS mini-SWE-agent | 86.6 Q Qwen Harness | 27.3 Public Q Qwen Harness | 72.5 Q Qwen Harness | A/B/X:厂商自报对照;Toolathlon 尚无官网独立排行榜条目。 | Claude Sonnet 5 | 84.7 AS Anthropic agentic search | 54±4 DS mini-SWE-agent | 80.4 AS / 74.6±1.6 TB mini-SWE-agent / Claude Code | 13.5 Private AS / 14.2 AB Zapier 官方 | 71.6±1.2 TV Toolathlon 官方 | A/X:官网运行配置不同(带置信区间)。 | 1.2.2 相对 Floatboat 达到或超过 20× 4 个模型 / 环境,成本倍数 20.0×–92.9×。Terra 恰为 20.0×,按临界值归入本组。 | 模型/环境 | BrowseComp 分数 / Harness / 来源 | DeepSWE 分数 / Harness / 来源 | Terminal Bench 2.1 分数 / Harness / 来源 | AutomationBench 分数 / Harness / 来源 | Toolathlon 分数 / Harness / 来源 | 口径说明 | |---|---|---|---|---|---|---| GPT-5.6 TERRA | 87.5 O OpenAI agentic browsing | 69.6 O / 70±3 DS mini-SWE-agent | 87.4 O / 78.4±1.3 TB Codex CLI / Terminus-2 | 15.2 Private O/AB Zapier 官方 | — | A/X:Terminal Harness 不同导致分数显著差异。 | Claude Opus 4.8 | 84.3 AO/O Anthropic agentic search | 58.0 D2/G / 59±2 DS DeepSeek Harness minimal / mini-SWE-agent | 82.7 D2/G / 78.9±1.3 TB DeepSeek Harness minimal / Terminus-2 | 27.2 Public D2/Q/K / 15.5 Private AO / 17.2 AB DeepSeek Harness minimal / Zapier 官方 | 76.2 D2/Q/K / 76.2±3.4 TV Toolathlon 官方 | A/X:多份厂商自报及多 Harness 并存。 | GPT-5.6 SOL | 90.4 O OpenAI agentic browsing | 72.7 O / 73±3 DS mini-SWE-agent | 88.8 O / 91.9 O 4-agent Codex CLI | 29.7 Public Q/K / 18.1 Private O/AB AutomationBench 官方 / Zapier 官方 | 74.9 Q/K Toolathlon 官方 | A/X:SOL 为单 agent,Ultra 为 4-agent 混合,不可混同。 | Claude Fable 5 | 88.0 K Kimi agentic browsing | 70.0 Q/K / 70±4 DS mini-SWE-agent | 84.3 AF / 83.8 TB mini-SWE-agent / Claude Code | 29.1 Public Q/K / 17.4 Private O/AB AutomationBench 官方 / Zapier 官方 | 77.9 Q/K Toolathlon 官方 | A/X:包含 fallback 与多 Harness 警告。 | - F Floatboat 本次发布 - Floatboat Evaluation Harness 在五项 Benchmark 上的完整实测成绩。 - M 机器之心报道 《贵 57.1 倍的 Claude Opus 4.8 五项全输,赢它的不是模型,是 Harness》↗ https://mp.weixin.qq.com/s/i 18N4NLYDlb8-unAaC ug 本文叙述、程长分档与 HLR 参照选择规则按该报道口径更新;原始分数仍以各 Benchmark 与厂商来源为准。- D1 DeepSeek V4-Flash/Pro 官方模型卡 HuggingFace 模型卡 ↗ https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash/raw/main/README.md 链接由于未固定 commit 存在版本和标签映射争议。- D2 DeepSeek V4-Flash-0731 官方模型卡 HuggingFace-0731 模型卡 ↗ https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/raw/main/README.md 列出官方 Harness 极简模式下(max 档位、top p=0.95、temperature=1.0)多项对照分。属于自报一手数据(A)。- DS DeepSWE 官方榜 deepswe.datacurve.ai ↗ https://deepswe.datacurve.ai/ Datacurve 官方统一使用 mini-swe-agent 复测成绩(带置信区间)。属于(A)。- Q Qwen3.8 官方发布页 Qwen3.8 Blog ↗ https://qwen.ai/blog?id=qwen3.8 列出 Qwen3.8-Max 自报 Pass@1 72.5% 等。属于自报对照数据(A/B/X)。- G GLM-5.2 官方发布页 智谱 Z.ai Blog ↗ https://z.ai/blog/glm-5.2 作为智谱厂商自报来源。属于(A)。- AO Claude Opus 4.8 官方发布页 Anthropic Opus 4.8 News ↗ https://www.anthropic.com/news/claude-opus-4-8 - AS Claude Sonnet 5 官方发布页 Anthropic Sonnet 5 News ↗ https://www.anthropic.com/news/claude-sonnet-5 - AF Anthropic Fable 5 技术资料 PDF Anthropic Fable PDF ↗ https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf - O OpenAI GPT-5.6 发布及规格说明页 OpenAI GPT-5.6 Index ↗ https://openai.com/index/gpt-5-6/ - TB Terminal-Bench 2.1 官方榜 Terminal-Bench Leaderboard ↗ https://www.tbench.ai/leaderboard/terminal-bench/2.1 - TV Toolathlon-Verified 官方榜 Toolathlon Leaderboard ↗ https://toolathlon.xyz/docs/leaderboard 2026-06-30 起使用的 Verified 新分数序列。- TL Toolathlon 旧版官方榜 - Toolathlon 官方榜底部的 Previous 历史数据,由于任务定义和基础设施不同,与 Verified 序列不具备可比性。 - AB AutomationBench 官方榜 Zapier Benchmarks ↗ https://zapier.com/benchmarks Zapier 官方 1.0.5 私有 held-out 榜,与自研自报的 600 题公开研究集并非同数据集。 二、先看「好」:$0.175 打 $10,五项全部超越 「好」是硬门槛。一个 Agent 工作台如果交付不了真实任务,再便宜也不会有人每天打开它。 过去这道门槛只能用钱换。Floatboat 这份成绩单的意义在于,它把这个交换取消了。 | 基准 | Floatboat V4-Flash $0.175/M | Claude Opus 4.8 $10/M · 贵 57.1× | 分差 | 相对 | |---|---|---|---|---| DeepSWE | 67.25 | 58.0 | +9.25 | +15.9% | Toolathlon | 79.62 | 76.2 | +3.42 | +4.5% | BrowseComp | 87.80 | 84.3 | +3.50 | +4.2% | AutomationBench | 27.50 | 27.2 | +0.30 | +1.1% | Terminal Bench 2.1 | 84.26 | 82.7 | +1.56 | +1.9% | 五项全部超越 Claude Opus 4.8。 即使在增益最小、程长最短的 Terminal Bench 2.1 上,Floatboat 也以 84.26 对 82.7 领先 1.56 分。 差距最大的是 DeepSWE——仓库级全栈代码开发,Floatboat 67.25 对 Opus 4.8 的 58.0,领先 15.9%。而两者的价格差是 57.1 倍。 这里的底座不是什么特调版本。 DeepSeek V4 Flash 是官方 API 谁都能调的模型,$0.14 输入、$0.28 输出。 按 Agent 场景典型的 3:1 输入输出比折算,混合价为 $0.175/M,只有 Opus 4.8 的 1/57。 顺带说「快」:不是推理速度,是这个价格带来的使用方式 先说清口径:本文五项基准都是任务完成质量, 没有延迟或耗时数据,本文不对速度指标作数据声称。 「快」指的是另一件更实际的事—— 你从犹豫要不要用它,变成直接让它跑。 混合价 $0.175/M 意味着一个长程任务的成本可以忽略;跑歪了重跑一次,代价同样可以忽略。而 Opus 4.8 是 $10/M,贵 57.1 倍,很多团队用它时要先掂量这一趟值不值。 当成本低到不需要掂量,Agent 才会被真的用起来,而不是被珍惜着用。 第九节还有另一半:客户端把文件管理器、编辑器、浏览器原生集成在一个窗口里,省掉的是人这一侧反复上传、下载、切应用的往返。这两件事合起来,才是「快」在这份材料里的确切含义。 三、这是 Harness 对 Harness 的单变量实验 一份跨系统对比要能被采信,方法学比结论重要。所以在给出任何 Harness 差值之前,先把对照组的配置摆完整。 - 双方统一使用 DeepSeek-V4-Flash 0731 模型底座 - DeepSeek 官方公开基准中的 Code Agent 任务使用 DeepSeek Harness(即将发布)的极简模式 ,配置为 max 档位、 top p=0.95 、 temperature=1.0 - Floatboat 侧统一在 Floatboat Evaluation Harness 下执行;大部分基准的模型推理由 DeepSeek 官方 API 提供 - 所有任务在 完全隔离、开箱即用的物理沙盒环境 中独立运行 输入参数完全一致 这比「Floatboat 对裸模型 API」更严格,也更有价值: 模型相同、模型厂自己的 Harness 也在场,唯一需要解释的变量就是两套 Harness 的系统工程差异。 因此,54.4、73.2、82.7、25.1、70.7 不是裸模型能力,而是 DeepSeek-V4-Flash + DeepSeek 官方 Harness 的系统成绩;67.25、87.80、84.26、27.50、79.62 则是同一模型接入 Floatboat Harness 后的系统成绩。两者的差值,就是 Floatboat Harness 相对模型厂官方 Harness 造出的增量。 对照组取的是 DeepSeek-V4-Flash-0731 + DeepSeek 官方 Harness 的正式成绩,不是更早的 Preview checkpoint。第一节的表里两行都在——用 Preview 的话,DeepSWE 一项就是 7.3 → 67.25,涨幅 821%,一个漂亮得多的数字,但它混进了模型自身后训练迭代与 Harness 对照变化,不能归给 Floatboat Harness。 四、任务越长程,Harness 增益越大 如果只看「五项都赢了」,这份成绩单还只是一次跑分。真正有信息量的是增益的分布。 同一个 DeepSeek V4 Flash(0731 checkpoint),分别由 DeepSeek 官方 Harness 与 Floatboat Harness 驱动: | 基准 | 任务性质 | DeepSeek 官方 Harness | Floatboat Harness | Harness 差值 | 相对提升 | |---|---|---|---|---|---| Terminal Bench 2.1 | 单环节命令行调试 · 短程 | 82.7 | 84.26 | +1.56 | +1.9% | AutomationBench | 跨 SaaS 多应用流程 · 中程 | 25.1 | 27.50 | +2.40 | +9.6% | Toolathlon | 复杂工具调用与长程交互 · 中长程 | 70.7 | 79.62 | +8.92 | +12.6% | BrowseComp | 多跳检索证据整合 · 中长程 | 73.2 | 87.80 | +14.60 | +19.9% | DeepSWE | 仓库级全栈开发 · 长程 | 54.4 | 67.25 | +12.85 | +23.6% | 1.9% → 9.6% → 12.6% → 19.9% → 23.6%。 五项全部具备官方 Harness 对照。按任务程长从短到长排列,程长分档非递减、增益单调递增,没有例外项。任务链条越长、环节越多、越依赖跨步骤的状态维持和自我修正,Harness 的增益越大;任务越短、越单点、越接近一次性问答,增益越小。 BrowseComp 官方未披露平均步数,它的「中长程」依任务设计判断:多跳检索、搜索首屏无法直接回答、检索链长度事前不可知,且需跨源证据交叉验证。它与 Toolathlon 同属中长程档,同档内按增益排序,两者先后不代表程长差异。 Terminal Bench 2.1 是沙盒里的命令行调试,单环节、闭环短—— 这一项 Floatboat 只涨了 1.9%,但仍以 84.26 对 82.7 超过 Opus 4.8。 短程任务里 Harness 杠杆较小;长程任务里的优势则显著放大。 反过来,Toolathlon 覆盖复杂的工具调用与长程交互决策。Floatboat 79.62,在本次对比集内数值最高,超过 Qwen3.8-Max(贵 14.9×)7.12 分,超过 Opus 4.8(贵 57.1×)3.42 分。由于不同公开结果采用的 Harness 与运行配置不完全相同,这里比较的是本次对比集中的公开数值,不将其表述为统一 Harness 下的官方统考排名。 真实工作恰好是长程的那一类。 用户日常要处理的不是一条命令,是跨文件、跨应用、跨很多步、中途还要改主意的活儿。 五、这五道题都不是自己出的 上面所有数字的分量,取决于题目是谁出的。 | 基准 | 出品方 | 设计 | 程长 | |---|---|---|---| DeepSWE | Datacurve | 113 个完全未泄漏的真实代码库,平均修改 7 个文件、新增 668 行代码,配严密行为校验器 | 长 | BrowseComp | OpenAI 官方 | 需多跳检索、搜索引擎首屏无法直接回答的难题,考验反复修正查询与长文本证据交叉验证 | 中长 | Toolathlon | Toolathlon 团队 | 调用各类系统与本地工具解决复杂实际办公任务,考核多步骤工具决策与复杂状态维持 | 中长 | AutomationBench | Zapier / AA | 模拟 47 个主流 SaaS、近 500 个 API 端点,沙盒中混有干扰与陈旧数据 | 中 | Terminal Bench 2.1 | Harbor Framework | 沙盒终端里的环境配置、环境排错与复杂运维 | 短 | 「113 个完全未泄漏的代码库,平均改 7 个文件、新增 668 行」「47 个 SaaS、近 500 个 API 端点,还混着陈旧数据」—— 这类任务过不去提示词技巧那一关。 它要求真实的文件存取、多步排错、跨应用状态维持,以及在错了之后自己发现并纠正。 这也解释了为什么增益集中在长程任务上:短程任务考模型的单次输出质量,长程任务考的是整个执行系统。 六、Harness 值多少分:一个可以重算的指标 行业开始共识 Model + Harness = Agent 。左半边被反复计量,每次模型发布都附一张榜单。但右半边一直没有数字,连边界都很少被说清。 Floatboat 正在把前沿模型能力,转化为领先的 Agent 产品。这其中除模型本身以外的所有工作,都属于 Harness 的范畴。 这个范畴不小:模型能碰到什么、每一轮循环怎么收敛、工具返回什么、状态存在哪里,全都在里面(第七节会逐层展开)。它长期缺的不是重要性,而是一把尺子。 Floatboat 提出了一个可以跨 Harness、跨模型重算的比值。最容易理解的写法是: 在同一项 Benchmark 上: 换 Harness 的收益 :保持底座模型不变,从基线 Harness 换到待测 Harness 后增加了多少分; 换模型的收益 :从同一个基线系统出发,换到参照模型系统后增加了多少分。 因此, HLR 1,意味着不换模型、只换 Harness 获得的增量,已经超过换到参照模型系统的收益。 本指标默认使用「分数越高越好」的 Benchmark,要求分子与分母采用同一评价口径,并按 Benchmark 分别计算,不跨基准求平均。 本次实验保持 DeepSeek-V4-Flash 不变,以 DeepSeek 官方 Harness 为基线、Floatboat Harness 为待测 Harness。参照系统先按统一规则选择:主参照为 Claude Opus 4.8;若它在某一项不高于基线系统,则改取该项 最便宜的有效参照 ,用一次真实、代价最小的模型升级来标定“换模型的收益”。 以 DeepSWE 为例: - DeepSeek-V4-Flash + DeepSeek 官方 Harness: 54.4 - Claude Opus 4.8 公布成绩: 58.0 ,换模型的收益为 3.6 分 - 同一 DeepSeek 模型放到 Floatboat 上: 67.25 ,换 Harness 的收益为 12.85 分 - HLR DeepSWE= 12.85 ÷ 3.6 = 3.57 ≈ 3.6× 五项完整结果: | 基准 | 参照系统 | 换 Harness 的收益 | 换模型的收益 | HLR | |---|---|---|---|---| Terminal Bench 2.1 | GPT-5.6 Luna | +1.56 | 2.00 | 0.78× | AutomationBench | Claude Opus 4.8 | +2.40 | 2.10 | 1.14× | BrowseComp | Claude Opus 4.8 | +14.60 | 11.10 | 1.32× | Toolathlon | Claude Opus 4.8 | +8.92 | 5.50 | 1.62× | DeepSWE | Claude Opus 4.8 | +12.85 | 3.60 | 3.57× | 0.78× → 1.14× → 1.32× → 1.62× → 3.57×。 按程长从短到长排列,程长分档非递减、HLR 单调递增,没有例外项:越长程,Harness 的杠杆越高。 Terminal Bench 2.1 上,Opus 4.8 与 DeepSeek 官方 Harness 同为 82.7,没有发生模型跃迁,因此不能作为有效参照。按预先声明的规则改取最便宜的有效参照 GPT-5.6 Luna(84.7),得 1.56 ÷ 2.00 = 0.78×。这一项全部有效参照的 HLR 区间为 0.26×–1.42×,本文采用规则固定的唯一取值,不在候选中择优。 HLR 是 Floatboat 提出的新指标,不是行业标准,换参照系统后数值会变化。它的分子和分母都直接取自第一节的成绩表,参照选择规则也已公开, 任何人都可以按“换 Harness 的收益 ÷ 换模型的收益”逐项重算。 七、12.85 分从哪来:一套持续逼近交付标准的系统 12.85 分不是任何单点技巧的产物。提示词工程、上下文压缩、工具重排这类手段的增益通常在 1–3 分量级。要解释一个量级更大的差值,得先回答一个更基本的问题: 长程任务到底是怎么失败的? 答案不是「某一步答错了」。 长程任务的失败,通常是循环没有收敛——它与真正的交付标准越走越远。 走远有两个成因:一是交付标准在任务开始时并没有被完整说出来;二是模型每一轮的微小偏差,会在下一轮把上一轮产物当作前提时持续累积。真实工作不是标准答案题:人的意图往往随着中间产物逐渐清晰,而模型带着逐轮变形的目标继续向前,二十步之后就可能形成方向性错误。 这就是「Proactive」在系统层面真正的含义,也是 Floatboat 的设计起点。 今天不少产品把定时唤醒、自动执行预设动作称为「Proactive Agent」。但那只是 触发器的主动 ,不是 Agent 的主动。真正的 Proactive Agent OS,不在于系统能否在没人点击按钮时开始工作,而在于: 当用户只说出了一个模糊目标,甚至自己也尚未完全知道什么才算好时,Agent 能否在长程任务中不断探索、执行、观察、修正与自我反思,主动识别结果与目标之间的差距。 好的 Harness 不能把第一句话当成一份永远不变的规格书。它必须在一次又一次 Loop 中持续逼近交付标准,必要时引导用户把未曾言明的要求清晰化,再把这些要求真正实现出来。 主动性的高级形态,不是替用户定时执行,而是帮助用户发现自己真正要什么,并把它做到。 这才是 Agent OS 与自动化脚本、聊天机器人之间的分界线。 也正是这条分界线,解释了第四节那组数字为什么按程长排序: 任务越长,未被说明的标准越多,「持续逼近」的价值就越大;任务短到只有一次问答,就没有可逼近的空间。 23.6% 与 1.9% 的差距,量的就是这件事。 这件事需要整个栈都在自己手里 「持续逼近交付标准」听上去像一句设计理念,但它落地需要四层能力同时成立。这也是 AOE Tech Labs 从第一天起就走了当时看起来最不划算的路的原因。 在行业普遍基于 Claude Agent SDK 套壳做应用、几周就能出一个 demo 的时候,他们选择自研整个软件的 Runtime、Agent Loop、Tools、Infra ,以及 FloatSail Evolution System 。这条路慢得多、重得多,在当时看不到回报。 而这四层各自决定了什么,恰好对应长程任务的四种死法: Runtime 决定 Agent 能碰到什么。进程、文件系统、权限、沙盒边界——它划定了模型的手能伸多远。DeepSWE 要平均修改 7 个文件、新增 668 行代码,AutomationBench 要在 47 个 SaaS、近 500 个 API 端点之间穿行,这些任务的前提是真实的读写权和执行权,不是把文本递进去再取出来。 Agent Loop 决定长程任务能否收敛。它不是让模型机械地多跑几轮,而是让每一轮的探索都缩短当前结果与最终交付标准之间的距离:从执行中获得新信息,从观察中发现偏差,从失败中修正路径,从中间产物里反推出用户没有明说的要求;该回退时回退,该追问时追问。对模糊目标,它把标准逐轮问出来、试出来;对模型偏移,它重新对齐目标锚点,判断哪些信息必须原样保留、哪些可以压缩,并在偏差还只是偏差时把它按回去。 前面说的那种「主动」,物理上就住在这一层。 Tools 决定模型能否正确消费结果。工具的粒度、返回结构、错误语义——一个把失败包装成空字符串的工具,会让模型在第 15 步做出一个自信的错误决策。这类问题在单轮问答里看不见,在 20 步任务里是致命的。 Infra 决定失败能否被发现。状态持久化、并发、可观测性——如果一次长程执行的中间状态无法回溯,那连「哪一步坏了」都不知道,优化就无从下手。 这四层里任意一层是别人的,你的上限就是别人的上限。 当 SDK 的 Agent Loop 在第 20 步丢了上下文,套壳者能做的只有换个提示词绕一绕;自研者可以直接改循环。 这是「能不能修」的差别,不是「修得好不好」的差别。 FloatSail Evolution System 解决的是时间维度的问题:模型一年换几代,Harness 不能跟着重写一遍。它让 Runtime、Loop、Tools 与模型适配策略在真实任务反馈中持续演进,并在新模型出现时延续已经形成的系统能力——这也解释了为什么同一套 Harness 能在一个便宜模型上,造出 3.6 倍于两套公开系统差距的增量。 "技术上,只有自己完全可控的系统,才能驾驭高度不可控的模型,实现最大化模型的智能。" —— AOE Tech Labs 团队 这个技术判断与团队构成直接相关:创始人拥有 10 年 OS + AI 创业经历与亿级用户产品经验;两位技术合伙人中,一位拥有模型训练经验,另一位具备 OS 底层技术栈经验。 模型训练、操作系统底层与亿级产品工程三类能力汇合,团队自然会把 Agent 当成系统工程问题,而不是提示词问题或者单纯的模型训练问题。 八、为什么用最便宜的模型跑榜 因为要证明的是 Harness,不是模型。 用顶级模型作底座会得到「高分 + 归因不清」——没人能判断分数来自模型还是 Harness。现在的实验更严格:同一个最便宜的模型,一边接 DeepSeek 官方 Harness,一边接 Floatboat Harness。 模型权重与成本都不变,系统差值直接落在 Harness 上。 这是更严苛的证明条件,不是更容易的那个。 需要澄清的是, Floatboat 是模型中立的产品 ,支持接入各家主流模型。这份榜单只用单一底座是评测方法论的要求,不是产品限制。如果 Harness 只为一个模型做特化,那叫调优,不叫杠杆——杠杆意味着换任何模型都能放大。 九、榜单是下限:真实工作里,客户端表现更优异 有一件事值得说明: 这份成绩是评测环境跑出来的,比用户真实拿到的环境弱。 评测为了可复现而剔除变量,产品为了能干活而叠加能力——两者本来不是同一个东西。 用户实际使用的 Floatboat 客户端,把 文件管理器、文件编辑器、浏览器原生集成进了产品本身 ,并接入 3000 多个在线服务和各类多模态模型。市面上的 Agent 产品几乎千篇一律:进去就是对话框,选一个固定文件夹作项目入口,AI 生成的文档要去别处打开编辑,AI 要用浏览器还得装插件或征用你正在用的浏览器。Floatboat 的绝大部分工作在一个窗口里完成——不需要打开文件选择器上传,不需要决定下载到哪里,拖拽即可。 对 Agent 而言,这些不是界面,是 可调用的工具面 :更多可用工具、更短的环境往返、更完整的执行闭环。 AOE Tech Labs 确认,完整客户端环境下运行同一批基准,成绩高于本文公布的数字,具体分数后续披露。 "产品设计上,只有让人用的舒服,才能最大化人的潜力。" —— AOE Tech Labs 团队 顺着第四节那条规律看,这件事是自洽的: 工具面越宽,长程任务的增益越大。 而真实工作恰好是长程的那一类。所以榜单上的数字是保守下限—— 在实际工作中,客户端的表现要更优异。 那个待披露的差值,可能比榜单本身更有意思。如果 HLR 回答了「Harness 值多少分」,这个差值将回答下一个问题: 工具面值多少分。 回到开头那个判断:榜单证明了「好」,完整客户端扩展了「多」,低成本与更短的环境往返带来「快」,57.1 倍价格差对应「省」。 多、快、好、省同时成立,Agent 工作台才从演示变成每天会打开的东西。 十、现在就能验证:floatboat.ai 上面所有数字都可以自己跑一遍。 入口: floatboat.ai 。AOE Tech Labs 同步推出了基于 DeepSeek 的专版, 首月注册 5 元/1 美金 ,对应的正是这份榜单的测试底座 DeepSeek V4 Flash——你拿到的是同一个模型。 验证路径很短: 用同一个模型,对比它在别处和在 Floatboat 里的表现差距。 同模型、不同 Harness,差值就是答案。 建议直接拿长程任务试,因为那是杠杆最大的一段,也是你日常真正在干的活:让它改一个跑得起来的仓库、把一份真实资料做成可交付的报告、或者把一个模糊的想法交给它,看它能不能帮你把标准想清楚。 而本文的所有分数都来自评测环境。你在 floatboat.ai https://floatboat.ai 拿到的客户端,比跑榜单的那个环境更强。 十一、公司与产品线 AOE Tech Labs Limited ,2025 年底成立,种子轮投资方为红杉与微光创投。 2026 年 1 月 — 发布 Floatboat 客户端,开创 Agent 桌面工作台形态 2026 年 4 月 — 发布 FloatIM,构建人与 Agent、Agent 与 Agent 的协同办公网络 2026 年 5 月 — 发布 FloatSchedule,让 Agent 依据日程主动工作 2026 年 8 月 — 发布 Floatboat Harness 五项评测完整数据:同一个 DeepSeek-V4-Flash 接入后,五项全部超过 Claude Opus 4.8;同步提出 Harness 杠杆率(HLR) 同一个模型,对比它在别处和在 Floatboat 里的表现 模型不变,只换 Harness。拿一个真实的长程任务来试,差值就是答案。 前往 floatboat.ai 验证 ↗ https://floatboat.ai