{"slug": "claude-opus-4-8-costs-57-1x-more-loses-all-5-benchmarks-beaten-by-the-harness", "title": "Claude Opus 4.8 Costs 57.1× More, Loses All 5 Benchmarks – Beaten by the Harness", "summary": "Floatboat's V4-Flash model, evaluated by its own Floatboat Evaluation Harness, achieved top rankings on five third-party benchmarks, including first place on Toolathlon (79.62) and third on BrowseComp (87.80), while costing 57.1× less than Claude Opus 4.8, which lost all five benchmarks to the harness. The cost multiplier of 57.1× is based on a 3:1 input-output ratio, with Floatboat set at 1.0×, and the comparison includes 12 models across the benchmarks.", "body_md": "## 一、本次发布的完整数据\n\n五项第三方基准的实测成绩、按输入输出比折算的成本倍数、每一个对照分数的来源链与 Harness 配置，都在这一节。\n\n### 1.1 单位成本效率：每 1 美元输出换回多少榜单分\n\n成绩与价格进同一个式子：**榜单真实跑分 ÷ 每百万 Token 输出价**。缺失成绩不补零，也不参与该榜计算。图末六张卡片给出五项基准的逐榜名次与价格榜。\n\n卡片最右一列的**成本倍数**按 8:1 输入输出比折算，`(8 × 输入价 + 输出价) / 9`\n\n，以 Floatboat 为 1.0×。全文标题与第二节的 57.1× 出自 3:1 折算，两套比例各自标注，不混算。\n\n图表与卡片默认只列混合成本低于 Floatboat 20 倍的同价位档，成本 ≥20× 的四个高价模型收在按钮之后。\n\n**五项基准的单位成本效率，按榜单分列**\n\n## 每 1 美元输出，能换回多少真实榜单分？\n\n**统一计算口径**榜单真实跑分 ÷ 每百万 Token 输出价\n\n**对比成绩：**按当前榜单动态统计成本倍数：8:1 混合口径\n\n**当前结论**\n\n**色阶**名次在前，灰色更深 名次在后，灰色渐浅 金色为 Floatboat\n\n**Floatboat 在对比集内的名次**：Toolathlon 第 1/10、BrowseComp 第 3/11、AutomationBench 第 3/12、DeepSWE 第 4/12、Terminal Bench 2.1 第 6/12。以上为各榜完整名次，不受上方同价位档筛选影响。\n\n**口径**\n\nFloatboat 五项成绩由 Floatboat Evaluation Harness 本次实测。其余模型沿用对应 Benchmark 或厂商公开结果，各家的 Harness、推理配置与数据集版本不尽相同，横向名次因此只用于观察公开成绩区间；同模型的 Harness 对照控制到相同底座与相同输入参数。\n\n成本倍数为 8:1 混合口径 `(8 × 输入价 + 输出价) / 9`\n\n；全文标题与第二节的 57.1× 为 3:1 混合口径 `(3 × 输入价 + 输出价) / 4`\n\n。两者都是按公开单价折算的估算值，不含缓存命中、长上下文阶梯价与工具调用费，不等于端到端任务成本。\n\n### 1.2 各模型跑分来源链与 Harness 详表\n\n12 个模型或运行环境在五项基准中的**公开成绩、Harness 配置与比较口径**，按 8:1 混合成本倍数分两组列出，分组与上方卡片的「成本倍数」列同源。\n\n#### 1.2.1 相对 Floatboat 低于 20×\n\n8 个模型 / 环境，成本倍数 1.0×–18.6×。\n\n| 模型/环境 | BrowseComp (分数 / Harness / 来源) | DeepSWE (分数 / Harness / 来源) | Terminal Bench 2.1 (分数 / Harness / 来源) | AutomationBench (分数 / Harness / 来源) | Toolathlon (分数 / Harness / 来源) | 口径说明 |\n|---|---|---|---|---|---|---|\nFloatboat / V4-Flash |\n87.80 [F]Floatboat_Harness (自研) |\n67.25 [F]Floatboat_Harness (自研) |\n84.26 [F]Floatboat_Harness (自研) |\n27.50 [F]Floatboat_Harness (自研) |\n79.62 [F]Floatboat_Harness (自研) |\nFloatboat 本次发布：五项均由 Floatboat Evaluation Harness 实测。 |\nDeepSeek V4-Flash 0731 |\n映射争议：73.2 [D1] 未披露/模型标签错配 |\n54.4 [D2] / 53±4 [DS] DeepSeek_Harness_minimal |\n82.7 [D2] DeepSeek_Harness_minimal |\n25.1 Public [D2] DeepSeek_Harness_minimal |\n70.7±0.9 [TV] / 70.3 [D2] DeepSeek_Harness_minimal（正式对照取 70.7） |\nA/X：厂商自报为主；Browse 存在标签争议；Toolathlon 官方复测与自报并存。 |\nV4-Flash Preview |\n映射争议：53.5 [D1] 未披露/模型标签错配 |\n7.3 [D2] DeepSeek_Harness_minimal |\n61.8 [D2] DeepSeek_Harness_minimal |\n10.8 Public [D2] DeepSeek_Harness_minimal |\n49.7 [D2] / 50.9±1.5 [TV] DeepSeek_Harness_minimal |\nA/X：版本和标签均需显式披露，Verified 新分数与旧版不可直比。 |\nV4-Pro Preview |\n映射争议：80.4 [D1] 未披露/模型标签错配 |\n12.8 [D2] DeepSeek_Harness_minimal |\n72.1 [D2] DeepSeek_Harness_minimal |\n12.8 Public [D2] DeepSeek_Harness_minimal |\n55.9 [D2] / 55.9±1.2 [TV] DeepSeek_Harness_minimal |\nA/X：自报与官网 Verified 均有列出，旧模型卡与新版存在变更冲突。 |\nGPT-5.6 LUNA |\n83.3 [O] OpenAI_agentic_browsing |\n67.2 [O] / 67±4 [DS] mini-SWE-agent |\n84.7 [O] / 75.7±1.3 [TB] Codex_CLI / Terminus-2 |\n14.9 Private [O/AB] Zapier 官方 |\n— | A/X：轻量级底座，Harness 口径不同。 |\nGLM-5.2 |\n— | 46.2 [D2/G] / 44±2 [DS] mini-SWE-agent |\n81.0 [D2/G] / 82.7 [G] Terminus-2 / Claude Code |\n12.9 Public [D2] / 14.0 Private [AB] DeepSeek_Harness_minimal / Zapier 官方 |\n59.9 [D2/K] / 59.9±1.9 [TV] Toolathlon 官方 |\nA/X：不同 Harness / 数据集口径并存。 |\nQwen3.8-Max |\n62.0 [F] 未披露且 Qwen 官网未找到 |\n56.6 [Q] / 57±3 [DS] mini-SWE-agent |\n86.6 [Q] Qwen Harness |\n27.3 Public [Q] Qwen Harness |\n72.5 [Q] Qwen Harness |\nA/B/X：厂商自报对照；Toolathlon 尚无官网独立排行榜条目。 |\nClaude Sonnet 5 |\n84.7 [AS] Anthropic_agentic_search |\n54±4 [DS] mini-SWE-agent |\n80.4 [AS] / 74.6±1.6 [TB] mini-SWE-agent / Claude Code |\n13.5 Private [AS] / 14.2 [AB] Zapier 官方 |\n71.6±1.2 [TV] Toolathlon 官方 |\nA/X：官网运行配置不同（带置信区间）。 |\n\n#### 1.2.2 相对 Floatboat 达到或超过 20×\n\n4 个模型 / 环境，成本倍数 20.0×–92.9×。Terra 恰为 20.0×，按临界值归入本组。\n\n| 模型/环境 | BrowseComp (分数 / Harness / 来源) | DeepSWE (分数 / Harness / 来源) | Terminal Bench 2.1 (分数 / Harness / 来源) | AutomationBench (分数 / Harness / 来源) | Toolathlon (分数 / Harness / 来源) | 口径说明 |\n|---|---|---|---|---|---|---|\nGPT-5.6 TERRA |\n87.5 [O] OpenAI_agentic_browsing |\n69.6 [O] / 70±3 [DS] mini-SWE-agent |\n87.4 [O] / 78.4±1.3 [TB] Codex_CLI / Terminus-2 |\n15.2 Private [O/AB] Zapier 官方 |\n— | A/X：Terminal Harness 不同导致分数显著差异。 |\nClaude Opus 4.8 |\n84.3 [AO/O] Anthropic_agentic_search |\n58.0 [D2/G] / 59±2 [DS] DeepSeek_Harness_minimal / mini-SWE-agent |\n82.7 [D2/G] / 78.9±1.3 [TB] DeepSeek_Harness_minimal / Terminus-2 |\n27.2 Public [D2/Q/K] / 15.5 Private [AO] / 17.2 [AB] DeepSeek_Harness_minimal / Zapier 官方 |\n76.2 [D2/Q/K] / 76.2±3.4 [TV] Toolathlon 官方 |\nA/X：多份厂商自报及多 Harness 并存。 |\nGPT-5.6 SOL |\n90.4 [O] OpenAI_agentic_browsing |\n72.7 [O] / 73±3 [DS] mini-SWE-agent |\n88.8 [O] / 91.9 [O] (4-agent) Codex_CLI |\n29.7 Public [Q/K] / 18.1 Private [O/AB] AutomationBench 官方 / Zapier 官方 |\n74.9 [Q/K] Toolathlon 官方 |\nA/X：SOL 为单 agent，Ultra 为 4-agent 混合，不可混同。 |\nClaude Fable 5 |\n88.0 [K] Kimi_agentic_browsing |\n70.0 [Q/K] / 70±4 [DS] mini-SWE-agent |\n84.3 [AF] / 83.8 [TB] mini-SWE-agent / Claude Code |\n29.1 Public [Q/K] / 17.4 Private [O/AB] AutomationBench 官方 / Zapier 官方 |\n77.9 [Q/K] Toolathlon 官方 |\nA/X：包含 fallback 与多 Harness 警告。 |\n\n- [F] Floatboat 本次发布\n- Floatboat Evaluation Harness 在五项 Benchmark 上的完整实测成绩。\n- [M] 机器之心报道\n[《贵 57.1 倍的 Claude Opus 4.8 五项全输，赢它的不是模型，是 Harness》↗](https://mp.weixin.qq.com/s/i_18N4NLYDlb8-unAaC_ug)本文叙述、程长分档与 HLR 参照选择规则按该报道口径更新；原始分数仍以各 Benchmark 与厂商来源为准。- [D1] DeepSeek V4-Flash/Pro 官方模型卡\n[HuggingFace 模型卡 ↗](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash/raw/main/README.md)链接由于未固定 commit 存在版本和标签映射争议。- [D2] DeepSeek V4-Flash-0731 官方模型卡\n[HuggingFace-0731 模型卡 ↗](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/raw/main/README.md)列出官方 Harness 极简模式下（max 档位、top_p=0.95、temperature=1.0）多项对照分。属于自报一手数据（A）。- [DS] DeepSWE 官方榜\n[deepswe.datacurve.ai ↗](https://deepswe.datacurve.ai/)Datacurve 官方统一使用 mini-swe-agent 复测成绩（带置信区间）。属于（A）。- [Q] Qwen3.8 官方发布页\n[Qwen3.8 Blog ↗](https://qwen.ai/blog?id=qwen3.8)列出 Qwen3.8-Max 自报 Pass@1 72.5% 等。属于自报对照数据（A/B/X）。- [G] GLM-5.2 官方发布页\n[智谱 Z.ai Blog ↗](https://z.ai/blog/glm-5.2)作为智谱厂商自报来源。属于（A）。- [AO] Claude Opus 4.8 官方发布页\n[Anthropic Opus 4.8 News ↗](https://www.anthropic.com/news/claude-opus-4-8)- [AS] Claude Sonnet 5 官方发布页\n[Anthropic Sonnet 5 News ↗](https://www.anthropic.com/news/claude-sonnet-5)- [AF] Anthropic Fable 5 技术资料 PDF\n[Anthropic Fable PDF ↗](https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf)- [O] OpenAI GPT-5.6 发布及规格说明页\n[OpenAI GPT-5.6 Index ↗](https://openai.com/index/gpt-5-6/)- [TB] Terminal-Bench 2.1 官方榜\n[Terminal-Bench Leaderboard ↗](https://www.tbench.ai/leaderboard/terminal-bench/2.1)- [TV] Toolathlon-Verified 官方榜\n[Toolathlon Leaderboard ↗](https://toolathlon.xyz/docs/leaderboard)2026-06-30 起使用的 Verified 新分数序列。- [TL] Toolathlon 旧版官方榜\n- Toolathlon 官方榜底部的 Previous 历史数据，由于任务定义和基础设施不同，与 Verified 序列不具备可比性。\n- [AB] AutomationBench 官方榜\n[Zapier Benchmarks ↗](https://zapier.com/benchmarks)Zapier 官方 1.0.5 私有 held-out 榜，与自研自报的 600 题公开研究集并非同数据集。\n\n## 二、先看「好」：$0.175 打 $10，五项全部超越\n\n「好」是硬门槛。一个 Agent 工作台如果交付不了真实任务，再便宜也不会有人每天打开它。\n\n过去这道门槛只能用钱换。Floatboat 这份成绩单的意义在于，它把这个交换取消了。\n\n| 基准 | Floatboat (V4-Flash) $0.175/M |\nClaude Opus 4.8 $10/M · 贵 57.1× |\n分差 | 相对 |\n|---|---|---|---|---|\nDeepSWE |\n67.25 |\n58.0 | +9.25 |\n+15.9% |\nToolathlon |\n79.62 |\n76.2 | +3.42 |\n+4.5% |\nBrowseComp |\n87.80 |\n84.3 | +3.50 |\n+4.2% |\nAutomationBench |\n27.50 |\n27.2 | +0.30 |\n+1.1% |\nTerminal Bench 2.1 |\n84.26 |\n82.7 | +1.56 |\n+1.9% |\n\n**五项全部超越 Claude Opus 4.8。**即使在增益最小、程长最短的 Terminal Bench 2.1 上，Floatboat 也以 84.26 对 82.7 领先 1.56 分。\n\n差距最大的是 DeepSWE——仓库级全栈代码开发，Floatboat 67.25 对 Opus 4.8 的 58.0，领先 15.9%。而两者的价格差是 57.1 倍。\n\n这里的底座不是什么特调版本。**DeepSeek V4 Flash 是官方 API 谁都能调的模型，$0.14 输入、$0.28 输出。**按 Agent 场景典型的 3:1 输入输出比折算，混合价为 $0.175/M，只有 Opus 4.8 的 1/57。\n\n### 顺带说「快」：不是推理速度，是这个价格带来的使用方式\n\n先说清口径：本文五项基准都是任务完成质量，**没有延迟或耗时数据，本文不对速度指标作数据声称。**\n\n「快」指的是另一件更实际的事——**你从犹豫要不要用它，变成直接让它跑。**混合价 $0.175/M 意味着一个长程任务的成本可以忽略；跑歪了重跑一次，代价同样可以忽略。而 Opus 4.8 是 $10/M，贵 57.1 倍，很多团队用它时要先掂量这一趟值不值。**当成本低到不需要掂量，Agent 才会被真的用起来，而不是被珍惜着用。**\n\n第九节还有另一半：客户端把文件管理器、编辑器、浏览器原生集成在一个窗口里，省掉的是人这一侧反复上传、下载、切应用的往返。这两件事合起来，才是「快」在这份材料里的确切含义。\n\n## 三、这是 Harness 对 Harness 的单变量实验\n\n一份跨系统对比要能被采信，方法学比结论重要。所以在给出任何 Harness 差值之前，先把对照组的配置摆完整。\n\n- 双方统一使用\n**DeepSeek-V4-Flash 0731**模型底座 - DeepSeek 官方公开基准中的 Code Agent 任务使用\n**DeepSeek Harness（即将发布）的极简模式**，配置为`max`\n\n档位、`top_p=0.95`\n\n、`temperature=1.0`\n\n- Floatboat 侧统一在\n**Floatboat Evaluation Harness**下执行；大部分基准的模型推理由 DeepSeek 官方 API 提供 - 所有任务在\n**完全隔离、开箱即用的物理沙盒环境**中独立运行 **输入参数完全一致**\n\n这比「Floatboat 对裸模型 API」更严格，也更有价值：**模型相同、模型厂自己的 Harness 也在场，唯一需要解释的变量就是两套 Harness 的系统工程差异。**\n\n因此，54.4、73.2、82.7、25.1、70.7 不是裸模型能力，而是 **DeepSeek-V4-Flash + DeepSeek 官方 Harness** 的系统成绩；67.25、87.80、84.26、27.50、79.62 则是同一模型接入 Floatboat Harness 后的系统成绩。两者的差值，就是 Floatboat Harness 相对模型厂官方 Harness 造出的增量。\n\n对照组取的是 DeepSeek-V4-Flash-0731 + DeepSeek 官方 Harness 的正式成绩，不是更早的 Preview checkpoint。第一节的表里两行都在——用 Preview 的话，DeepSWE 一项就是 7.3 → 67.25，涨幅 821%，一个漂亮得多的数字，但它混进了模型自身后训练迭代与 Harness 对照变化，不能归给 Floatboat Harness。\n\n## 四、任务越长程，Harness 增益越大\n\n如果只看「五项都赢了」，这份成绩单还只是一次跑分。真正有信息量的是增益的分布。\n\n同一个 DeepSeek V4 Flash（0731 checkpoint），分别由 DeepSeek 官方 Harness 与 Floatboat Harness 驱动：\n\n| 基准 | 任务性质 | DeepSeek 官方 Harness | Floatboat Harness | Harness 差值 | 相对提升 |\n|---|---|---|---|---|---|\nTerminal Bench 2.1 |\n单环节命令行调试 · 短程 |\n82.7 | 84.26 |\n+1.56 | +1.9% |\nAutomationBench |\n跨 SaaS 多应用流程 · 中程 |\n25.1 | 27.50 |\n+2.40 | +9.6% |\nToolathlon |\n复杂工具调用与长程交互 · 中长程 |\n70.7 | 79.62 |\n+8.92 | +12.6% |\nBrowseComp |\n多跳检索证据整合 · 中长程 |\n73.2 | 87.80 |\n+14.60 | +19.9% |\nDeepSWE |\n仓库级全栈开发 · 长程 |\n54.4 | 67.25 |\n+12.85 | +23.6% |\n\n**1.9% → 9.6% → 12.6% → 19.9% → 23.6%。**\n\n五项全部具备官方 Harness 对照。按任务程长从短到长排列，程长分档非递减、增益单调递增，没有例外项。任务链条越长、环节越多、越依赖跨步骤的状态维持和自我修正，Harness 的增益越大；任务越短、越单点、越接近一次性问答，增益越小。\n\nBrowseComp 官方未披露平均步数，它的「中长程」依任务设计判断：多跳检索、搜索首屏无法直接回答、检索链长度事前不可知，且需跨源证据交叉验证。它与 Toolathlon 同属中长程档，同档内按增益排序，两者先后不代表程长差异。\n\nTerminal Bench 2.1 是沙盒里的命令行调试，单环节、闭环短——**这一项 Floatboat 只涨了 1.9%，但仍以 84.26 对 82.7 超过 Opus 4.8。**短程任务里 Harness 杠杆较小；长程任务里的优势则显著放大。\n\n反过来，Toolathlon 覆盖复杂的工具调用与长程交互决策。Floatboat 79.62，在本次对比集内数值最高，超过 Qwen3.8-Max（贵 14.9×）7.12 分，超过 Opus 4.8（贵 57.1×）3.42 分。由于不同公开结果采用的 Harness 与运行配置不完全相同，这里比较的是本次对比集中的公开数值，不将其表述为统一 Harness 下的官方统考排名。\n\n**真实工作恰好是长程的那一类。**用户日常要处理的不是一条命令，是跨文件、跨应用、跨很多步、中途还要改主意的活儿。\n\n## 五、这五道题都不是自己出的\n\n上面所有数字的分量，取决于题目是谁出的。\n\n| 基准 | 出品方 | 设计 | 程长 |\n|---|---|---|---|\nDeepSWE |\nDatacurve |\n113 个完全未泄漏的真实代码库，平均修改 7 个文件、新增 668 行代码，配严密行为校验器 |\n长 |\nBrowseComp |\nOpenAI 官方 |\n需多跳检索、搜索引擎首屏无法直接回答的难题，考验反复修正查询与长文本证据交叉验证 | 中长 |\nToolathlon |\nToolathlon 团队 |\n调用各类系统与本地工具解决复杂实际办公任务，考核多步骤工具决策与复杂状态维持 | 中长 |\nAutomationBench |\nZapier / AA |\n模拟 47 个主流 SaaS、近 500 个 API 端点，沙盒中混有干扰与陈旧数据 |\n中 |\nTerminal Bench 2.1 |\nHarbor Framework |\n沙盒终端里的环境配置、环境排错与复杂运维 | 短 |\n\n「113 个完全未泄漏的代码库，平均改 7 个文件、新增 668 行」「47 个 SaaS、近 500 个 API 端点，还混着陈旧数据」——**这类任务过不去提示词技巧那一关。**它要求真实的文件存取、多步排错、跨应用状态维持，以及在错了之后自己发现并纠正。\n\n这也解释了为什么增益集中在长程任务上：短程任务考模型的单次输出质量，长程任务考的是整个执行系统。\n\n## 六、Harness 值多少分：一个可以重算的指标\n\n行业开始共识 **Model + Harness = Agent**。左半边被反复计量，每次模型发布都附一张榜单。但右半边一直没有数字，连边界都很少被说清。\n\n**Floatboat 正在把前沿模型能力，转化为领先的 Agent 产品。这其中除模型本身以外的所有工作，都属于 Harness 的范畴。**\n\n这个范畴不小：模型能碰到什么、每一轮循环怎么收敛、工具返回什么、状态存在哪里，全都在里面（第七节会逐层展开）。它长期缺的不是重要性，而是一把尺子。\n\nFloatboat 提出了一个可以跨 Harness、跨模型重算的比值。最容易理解的写法是：\n\n在同一项 Benchmark 上：\n\n**换 Harness 的收益**：保持底座模型不变，从基线 Harness 换到待测 Harness 后增加了多少分；**换模型的收益**：从同一个基线系统出发，换到参照模型系统后增加了多少分。\n\n因此，**HLR > 1，意味着不换模型、只换 Harness 获得的增量，已经超过换到参照模型系统的收益。**\n\n本指标默认使用「分数越高越好」的 Benchmark，要求分子与分母采用同一评价口径，并按 Benchmark 分别计算，不跨基准求平均。\n\n本次实验保持 DeepSeek-V4-Flash 不变，以 DeepSeek 官方 Harness 为基线、Floatboat Harness 为待测 Harness。参照系统先按统一规则选择：主参照为 Claude Opus 4.8；若它在某一项不高于基线系统，则改取该项**最便宜的有效参照**，用一次真实、代价最小的模型升级来标定“换模型的收益”。\n\n以 DeepSWE 为例：\n\n- DeepSeek-V4-Flash + DeepSeek 官方 Harness：\n**54.4** - Claude Opus 4.8 公布成绩：\n**58.0**，换模型的收益为** 3.6 分** - 同一 DeepSeek 模型放到 Floatboat 上：\n**67.25**，换 Harness 的收益为** 12.85 分** - HLR\nDeepSWE= 12.85 ÷ 3.6 = 3.57 ≈**3.6×**\n\n五项完整结果：\n\n| 基准 | 参照系统 | 换 Harness 的收益 | 换模型的收益 | HLR |\n|---|---|---|---|---|\nTerminal Bench 2.1 |\nGPT-5.6 Luna | +1.56 | 2.00 | 0.78× |\nAutomationBench |\nClaude Opus 4.8 | +2.40 | 2.10 | 1.14× |\nBrowseComp |\nClaude Opus 4.8 | +14.60 | 11.10 | 1.32× |\nToolathlon |\nClaude Opus 4.8 | +8.92 | 5.50 | 1.62× |\nDeepSWE |\nClaude Opus 4.8 | +12.85 | 3.60 | 3.57× |\n\n**0.78× → 1.14× → 1.32× → 1.62× → 3.57×。**按程长从短到长排列，程长分档非递减、HLR 单调递增，没有例外项：越长程，Harness 的杠杆越高。\n\nTerminal Bench 2.1 上，Opus 4.8 与 DeepSeek 官方 Harness 同为 82.7，没有发生模型跃迁，因此不能作为有效参照。按预先声明的规则改取最便宜的有效参照 GPT-5.6 Luna（84.7），得 1.56 ÷ 2.00 = 0.78×。这一项全部有效参照的 HLR 区间为 0.26×–1.42×，本文采用规则固定的唯一取值，不在候选中择优。\n\nHLR 是 Floatboat 提出的新指标，不是行业标准，换参照系统后数值会变化。它的分子和分母都直接取自第一节的成绩表，参照选择规则也已公开，**任何人都可以按“换 Harness 的收益 ÷ 换模型的收益”逐项重算。**\n\n## 七、12.85 分从哪来：一套持续逼近交付标准的系统\n\n12.85 分不是任何单点技巧的产物。提示词工程、上下文压缩、工具重排这类手段的增益通常在 1–3 分量级。要解释一个量级更大的差值，得先回答一个更基本的问题：**长程任务到底是怎么失败的？**\n\n答案不是「某一步答错了」。\n\n**长程任务的失败，通常是循环没有收敛——它与真正的交付标准越走越远。**走远有两个成因：一是交付标准在任务开始时并没有被完整说出来；二是模型每一轮的微小偏差，会在下一轮把上一轮产物当作前提时持续累积。真实工作不是标准答案题：人的意图往往随着中间产物逐渐清晰，而模型带着逐轮变形的目标继续向前，二十步之后就可能形成方向性错误。\n\n**这就是「Proactive」在系统层面真正的含义，也是 Floatboat 的设计起点。**\n\n今天不少产品把定时唤醒、自动执行预设动作称为「Proactive Agent」。但那只是**触发器的主动**，不是 Agent 的主动。真正的 Proactive Agent OS，不在于系统能否在没人点击按钮时开始工作，而在于：**当用户只说出了一个模糊目标，甚至自己也尚未完全知道什么才算好时，Agent 能否在长程任务中不断探索、执行、观察、修正与自我反思，主动识别结果与目标之间的差距。**\n\n好的 Harness 不能把第一句话当成一份永远不变的规格书。它必须在一次又一次 Loop 中持续逼近交付标准，必要时引导用户把未曾言明的要求清晰化，再把这些要求真正实现出来。\n\n**主动性的高级形态，不是替用户定时执行，而是帮助用户发现自己真正要什么，并把它做到。**这才是 Agent OS 与自动化脚本、聊天机器人之间的分界线。\n\n也正是这条分界线，解释了第四节那组数字为什么按程长排序：**任务越长，未被说明的标准越多，「持续逼近」的价值就越大；任务短到只有一次问答，就没有可逼近的空间。** 23.6% 与 1.9% 的差距，量的就是这件事。\n\n### 这件事需要整个栈都在自己手里\n\n「持续逼近交付标准」听上去像一句设计理念，但它落地需要四层能力同时成立。这也是 AOE Tech Labs 从第一天起就走了当时看起来最不划算的路的原因。\n\n在行业普遍基于 Claude Agent SDK 套壳做应用、几周就能出一个 demo 的时候，他们选择自研整个软件的 **Runtime、Agent Loop、Tools、Infra**，以及 **FloatSail(Evolution System)**。这条路慢得多、重得多，在当时看不到回报。\n\n而这四层各自决定了什么，恰好对应长程任务的四种死法：\n\n**Runtime** 决定 Agent 能碰到什么。进程、文件系统、权限、沙盒边界——它划定了模型的手能伸多远。DeepSWE 要平均修改 7 个文件、新增 668 行代码，AutomationBench 要在 47 个 SaaS、近 500 个 API 端点之间穿行，这些任务的前提是真实的读写权和执行权，不是把文本递进去再取出来。\n\n**Agent Loop** 决定长程任务能否收敛。它不是让模型机械地多跑几轮，而是让每一轮的探索都缩短当前结果与最终交付标准之间的距离：从执行中获得新信息，从观察中发现偏差，从失败中修正路径，从中间产物里反推出用户没有明说的要求；该回退时回退，该追问时追问。对模糊目标，它把标准逐轮问出来、试出来；对模型偏移，它重新对齐目标锚点，判断哪些信息必须原样保留、哪些可以压缩，并在偏差还只是偏差时把它按回去。**前面说的那种「主动」，物理上就住在这一层。**\n\n**Tools** 决定模型能否正确消费结果。工具的粒度、返回结构、错误语义——一个把失败包装成空字符串的工具，会让模型在第 15 步做出一个自信的错误决策。这类问题在单轮问答里看不见，在 20 步任务里是致命的。\n\n**Infra** 决定失败能否被发现。状态持久化、并发、可观测性——如果一次长程执行的中间状态无法回溯，那连「哪一步坏了」都不知道，优化就无从下手。\n\n**这四层里任意一层是别人的，你的上限就是别人的上限。**当 SDK 的 Agent Loop 在第 20 步丢了上下文，套壳者能做的只有换个提示词绕一绕；自研者可以直接改循环。**这是「能不能修」的差别，不是「修得好不好」的差别。**\n\n**FloatSail(Evolution System)** 解决的是时间维度的问题：模型一年换几代，Harness 不能跟着重写一遍。它让 Runtime、Loop、Tools 与模型适配策略在真实任务反馈中持续演进，并在新模型出现时延续已经形成的系统能力——这也解释了为什么同一套 Harness 能在一个便宜模型上，造出 3.6 倍于两套公开系统差距的增量。\n\n\"技术上，只有自己完全可控的系统，才能驾驭高度不可控的模型，实现最大化模型的智能。\" —— AOE Tech Labs 团队\n\n这个技术判断与团队构成直接相关：创始人拥有 10 年 OS + AI 创业经历与亿级用户产品经验；两位技术合伙人中，一位拥有模型训练经验，另一位具备 OS 底层技术栈经验。**模型训练、操作系统底层与亿级产品工程三类能力汇合，团队自然会把 Agent 当成系统工程问题，而不是提示词问题或者单纯的模型训练问题。**\n\n## 八、为什么用最便宜的模型跑榜\n\n因为要证明的是 Harness，不是模型。\n\n用顶级模型作底座会得到「高分 + 归因不清」——没人能判断分数来自模型还是 Harness。现在的实验更严格：同一个最便宜的模型，一边接 DeepSeek 官方 Harness，一边接 Floatboat Harness。**模型权重与成本都不变，系统差值直接落在 Harness 上。**这是更严苛的证明条件，不是更容易的那个。\n\n需要澄清的是，**Floatboat 是模型中立的产品**，支持接入各家主流模型。这份榜单只用单一底座是评测方法论的要求，不是产品限制。如果 Harness 只为一个模型做特化，那叫调优，不叫杠杆——杠杆意味着换任何模型都能放大。\n\n## 九、榜单是下限：真实工作里，客户端表现更优异\n\n有一件事值得说明：**这份成绩是评测环境跑出来的，比用户真实拿到的环境弱。**\n\n评测为了可复现而剔除变量，产品为了能干活而叠加能力——两者本来不是同一个东西。\n\n用户实际使用的 Floatboat 客户端，把**文件管理器、文件编辑器、浏览器原生集成进了产品本身**，并接入 3000 多个在线服务和各类多模态模型。市面上的 Agent 产品几乎千篇一律：进去就是对话框，选一个固定文件夹作项目入口，AI 生成的文档要去别处打开编辑，AI 要用浏览器还得装插件或征用你正在用的浏览器。Floatboat 的绝大部分工作在一个窗口里完成——不需要打开文件选择器上传，不需要决定下载到哪里，拖拽即可。\n\n对 Agent 而言，这些不是界面，是**可调用的工具面**：更多可用工具、更短的环境往返、更完整的执行闭环。** AOE Tech Labs 确认，完整客户端环境下运行同一批基准，成绩高于本文公布的数字，具体分数后续披露。**\n\n\"产品设计上，只有让人用的舒服，才能最大化人的潜力。\" —— AOE Tech Labs 团队\n\n顺着第四节那条规律看，这件事是自洽的：**工具面越宽，长程任务的增益越大。**而真实工作恰好是长程的那一类。所以榜单上的数字是保守下限——**在实际工作中，客户端的表现要更优异。**\n\n那个待披露的差值，可能比榜单本身更有意思。如果 HLR 回答了「Harness 值多少分」，这个差值将回答下一个问题：**工具面值多少分。**\n\n回到开头那个判断：榜单证明了「好」，完整客户端扩展了「多」，低成本与更短的环境往返带来「快」，57.1 倍价格差对应「省」。**多、快、好、省同时成立，Agent 工作台才从演示变成每天会打开的东西。**\n\n## 十、现在就能验证：floatboat.ai\n\n上面所有数字都可以自己跑一遍。\n\n**入口： floatboat.ai**。AOE Tech Labs 同步推出了基于 DeepSeek 的专版，\n\n**首月注册 5 元/1 美金**，对应的正是这份榜单的测试底座 DeepSeek V4 Flash——你拿到的是同一个模型。\n\n验证路径很短：**用同一个模型，对比它在别处和在 Floatboat 里的表现差距。**同模型、不同 Harness，差值就是答案。\n\n建议直接拿长程任务试，因为那是杠杆最大的一段，也是你日常真正在干的活：让它改一个跑得起来的仓库、把一份真实资料做成可交付的报告、或者把一个模糊的想法交给它，看它能不能帮你把标准想清楚。\n\n而本文的所有分数都来自评测环境。你在 [floatboat.ai](https://floatboat.ai) 拿到的客户端，比跑榜单的那个环境更强。\n\n## 十一、公司与产品线\n\n**AOE Tech Labs Limited**，2025 年底成立，种子轮投资方为红杉与微光创投。\n\n**2026 年 1 月**— 发布 Floatboat 客户端，开创 Agent 桌面工作台形态** 2026 年 4 月**— 发布 FloatIM，构建人与 Agent、Agent 与 Agent 的协同办公网络** 2026 年 5 月**— 发布 FloatSchedule，让 Agent 依据日程主动工作** 2026 年 8 月**— 发布 Floatboat Harness 五项评测完整数据：同一个 DeepSeek-V4-Flash 接入后，五项全部超过 Claude Opus 4.8；同步提出 Harness 杠杆率（HLR）\n\n## 同一个模型，对比它在别处和在 Floatboat 里的表现\n\n模型不变，只换 Harness。拿一个真实的长程任务来试，差值就是答案。\n\n[前往 floatboat.ai 验证 ↗](https://floatboat.ai)", "url": "https://wpnews.pro/news/claude-opus-4-8-costs-57-1x-more-loses-all-5-benchmarks-beaten-by-the-harness", "canonical_source": "https://floatboat.ai/news/harness-benchmark", "published_at": "2026-08-11 10:59:53+00:00", "updated_at": "2026-08-11 11:12:13.774960+00:00", "lang": "en", "topics": ["artificial-intelligence", "machine-learning", "ai-products", "ai-research"], "entities": ["Floatboat", "Floatboat Evaluation Harness", "Claude Opus 4.8", "DeepSeek V4-Flash", "GPT-5.6 LUNA", "GLM-5.2", "Qwen3.8-Max", "Claude Sonnet 5"], "alternates": {"html": "https://wpnews.pro/news/claude-opus-4-8-costs-57-1x-more-loses-all-5-benchmarks-beaten-by-the-harness", "markdown": "https://wpnews.pro/news/claude-opus-4-8-costs-57-1x-more-loses-all-5-benchmarks-beaten-by-the-harness.md", "text": "https://wpnews.pro/news/claude-opus-4-8-costs-57-1x-more-loses-all-5-benchmarks-beaten-by-the-harness.txt", "jsonld": "https://wpnews.pro/news/claude-opus-4-8-costs-57-1x-more-loses-all-5-benchmarks-beaten-by-the-harness.jsonld"}}