cd /news/artificial-intelligence/claude-opus-4-8-costs-57-1x-more-los… · home topics artificial-intelligence article
[ARTICLE · art-91834] src=floatboat.ai ↗ pub= topic=artificial-intelligence verified=true sentiment=· neutral

Claude Opus 4.8 Costs 57.1× More, Loses All 5 Benchmarks – Beaten by the Harness

Floatboat's V4-Flash model, evaluated by its own Floatboat Evaluation Harness, achieved top rankings on five third-party benchmarks, including first place on Toolathlon (79.62) and third on BrowseComp (87.80), while costing 57.1× less than Claude Opus 4.8, which lost all five benchmarks to the harness. The cost multiplier of 57.1× is based on a 3:1 input-output ratio, with Floatboat set at 1.0×, and the comparison includes 12 models across the benchmarks.

read9 min views1 publishedAug 11, 2026
Claude Opus 4.8 Costs 57.1× More, Loses All 5 Benchmarks – Beaten by the Harness
Image: source

一、本次发布的完整数据 #

五项第三方基准的实测成绩、按输入输出比折算的成本倍数、每一个对照分数的来源链与 Harness 配置,都在这一节。

1.1 单位成本效率:每 1 美元输出换回多少榜单分

成绩与价格进同一个式子:榜单真实跑分 ÷ 每百万 Token 输出价。缺失成绩不补零,也不参与该榜计算。图末六张卡片给出五项基准的逐榜名次与价格榜。

卡片最右一列的成本倍数按 8:1 输入输出比折算,(8 × 输入价 + 输出价) / 9 ,以 Floatboat 为 1.0×。全文标题与第二节的 57.1× 出自 3:1 折算,两套比例各自标注,不混算。

图表与卡片默认只列混合成本低于 Floatboat 20 倍的同价位档,成本 ≥20× 的四个高价模型收在按钮之后。

五项基准的单位成本效率,按榜单分列

每 1 美元输出,能换回多少真实榜单分? #

统一计算口径榜单真实跑分 ÷ 每百万 Token 输出价

**对比成绩:**按当前榜单动态统计成本倍数:8:1 混合口径

当前结论

色阶名次在前,灰色更深 名次在后,灰色渐浅 金色为 Floatboat

Floatboat 在对比集内的名次:Toolathlon 第 1/10、BrowseComp 第 3/11、AutomationBench 第 3/12、DeepSWE 第 4/12、Terminal Bench 2.1 第 6/12。以上为各榜完整名次,不受上方同价位档筛选影响。

口径

Floatboat 五项成绩由 Floatboat Evaluation Harness 本次实测。其余模型沿用对应 Benchmark 或厂商公开结果,各家的 Harness、推理配置与数据集版本不尽相同,横向名次因此只用于观察公开成绩区间;同模型的 Harness 对照控制到相同底座与相同输入参数。

成本倍数为 8:1 混合口径 `(8 × 输入价 + 输出价) / 9`

;全文标题与第二节的 57.1× 为 3:1 混合口径 `(3 × 输入价 + 输出价) / 4`

。两者都是按公开单价折算的估算值,不含缓存命中、长上下文阶梯价与工具调用费,不等于端到端任务成本。

1.2 各模型跑分来源链与 Harness 详表

12 个模型或运行环境在五项基准中的公开成绩、Harness 配置与比较口径,按 8:1 混合成本倍数分两组列出,分组与上方卡片的「成本倍数」列同源。

1.2.1 相对 Floatboat 低于 20×

8 个模型 / 环境,成本倍数 1.0×–18.6×。

| 模型/环境 | BrowseComp (分数 / Harness / 来源) | DeepSWE (分数 / Harness / 来源) | Terminal Bench 2.1 (分数 / Harness / 来源) | AutomationBench (分数 / Harness / 来源) | Toolathlon (分数 / Harness / 来源) | 口径说明 |
|---|---|---|---|---|---|---|

Floatboat / V4-Flash |

87.80 [F]Floatboat_Harness (自研) |
67.25 [F]Floatboat_Harness (自研) |
84.26 [F]Floatboat_Harness (自研) |
27.50 [F]Floatboat_Harness (自研) |
79.62 [F]Floatboat_Harness (自研) |

Floatboat 本次发布:五项均由 Floatboat Evaluation Harness 实测。 | DeepSeek V4-Flash 0731 |

映射争议:73.2 [D1] 未披露/模型标签错配 |
54.4 [D2] / 53±4 [DS] DeepSeek_Harness_minimal |
82.7 [D2] DeepSeek_Harness_minimal |

25.1 Public [D2] DeepSeek_Harness_minimal | 70.7±0.9 [TV] / 70.3 [D2] DeepSeek_Harness_minimal(正式对照取 70.7) | A/X:厂商自报为主;Browse 存在标签争议;Toolathlon 官方复测与自报并存。 | V4-Flash Preview |

映射争议:53.5 [D1] 未披露/模型标签错配 |
7.3 [D2] DeepSeek_Harness_minimal |
61.8 [D2] DeepSeek_Harness_minimal |

10.8 Public [D2] DeepSeek_Harness_minimal | 49.7 [D2] / 50.9±1.5 [TV] DeepSeek_Harness_minimal | A/X:版本和标签均需显式披露,Verified 新分数与旧版不可直比。 | V4-Pro Preview |

映射争议:80.4 [D1] 未披露/模型标签错配 |
12.8 [D2] DeepSeek_Harness_minimal |
72.1 [D2] DeepSeek_Harness_minimal |

12.8 Public [D2] DeepSeek_Harness_minimal | 55.9 [D2] / 55.9±1.2 [TV] DeepSeek_Harness_minimal | A/X:自报与官网 Verified 均有列出,旧模型卡与新版存在变更冲突。 | GPT-5.6 LUNA |

83.3 [O] OpenAI_agentic_browsing |
67.2 [O] / 67±4 [DS] mini-SWE-agent |
84.7 [O] / 75.7±1.3 [TB] Codex_CLI / Terminus-2 |
14.9 Private [O/AB] Zapier 官方 |

— | A/X:轻量级底座,Harness 口径不同。 | GLM-5.2 |

— | 46.2 [D2/G] / 44±2 [DS] mini-SWE-agent |
81.0 [D2/G] / 82.7 [G] Terminus-2 / Claude Code |
12.9 Public [D2] / 14.0 Private [AB] DeepSeek_Harness_minimal / Zapier 官方 |
59.9 [D2/K] / 59.9±1.9 [TV] Toolathlon 官方 |

A/X:不同 Harness / 数据集口径并存。 | Qwen3.8-Max |

62.0 [F] 未披露且 Qwen 官网未找到 |
56.6 [Q] / 57±3 [DS] mini-SWE-agent |
86.6 [Q] Qwen Harness |
27.3 Public [Q] Qwen Harness |
72.5 [Q] Qwen Harness |

A/B/X:厂商自报对照;Toolathlon 尚无官网独立排行榜条目。 | Claude Sonnet 5 |

84.7 [AS] Anthropic_agentic_search |
54±4 [DS] mini-SWE-agent |
80.4 [AS] / 74.6±1.6 [TB] mini-SWE-agent / Claude Code |
13.5 Private [AS] / 14.2 [AB] Zapier 官方 |
71.6±1.2 [TV] Toolathlon 官方 |

A/X:官网运行配置不同(带置信区间)。 |

1.2.2 相对 Floatboat 达到或超过 20×

4 个模型 / 环境,成本倍数 20.0×–92.9×。Terra 恰为 20.0×,按临界值归入本组。

| 模型/环境 | BrowseComp (分数 / Harness / 来源) | DeepSWE (分数 / Harness / 来源) | Terminal Bench 2.1 (分数 / Harness / 来源) | AutomationBench (分数 / Harness / 来源) | Toolathlon (分数 / Harness / 来源) | 口径说明 |
|---|---|---|---|---|---|---|

GPT-5.6 TERRA |

87.5 [O] OpenAI_agentic_browsing |
69.6 [O] / 70±3 [DS] mini-SWE-agent |
87.4 [O] / 78.4±1.3 [TB] Codex_CLI / Terminus-2 |
15.2 Private [O/AB] Zapier 官方 |

— | A/X:Terminal Harness 不同导致分数显著差异。 | Claude Opus 4.8 |

84.3 [AO/O] Anthropic_agentic_search |
58.0 [D2/G] / 59±2 [DS] DeepSeek_Harness_minimal / mini-SWE-agent |
82.7 [D2/G] / 78.9±1.3 [TB] DeepSeek_Harness_minimal / Terminus-2 |
27.2 Public [D2/Q/K] / 15.5 Private [AO] / 17.2 [AB] DeepSeek_Harness_minimal / Zapier 官方 |
76.2 [D2/Q/K] / 76.2±3.4 [TV] Toolathlon 官方 |

A/X:多份厂商自报及多 Harness 并存。 | GPT-5.6 SOL |

90.4 [O] OpenAI_agentic_browsing |
72.7 [O] / 73±3 [DS] mini-SWE-agent |
88.8 [O] / 91.9 [O] (4-agent) Codex_CLI |
29.7 Public [Q/K] / 18.1 Private [O/AB] AutomationBench 官方 / Zapier 官方 |
74.9 [Q/K] Toolathlon 官方 |

A/X:SOL 为单 agent,Ultra 为 4-agent 混合,不可混同。 | Claude Fable 5 |

88.0 [K] Kimi_agentic_browsing |
70.0 [Q/K] / 70±4 [DS] mini-SWE-agent |
84.3 [AF] / 83.8 [TB] mini-SWE-agent / Claude Code |
29.1 Public [Q/K] / 17.4 Private [O/AB] AutomationBench 官方 / Zapier 官方 |
77.9 [Q/K] Toolathlon 官方 |

A/X:包含 fallback 与多 Harness 警告。 |

  • [F] Floatboat 本次发布
  • Floatboat Evaluation Harness 在五项 Benchmark 上的完整实测成绩。
- [M] 机器之心报道
[《贵 57.1 倍的 Claude Opus 4.8 五项全输,赢它的不是模型,是 Harness》↗](https://mp.weixin.qq.com/s/i_18N4NLYDlb8-unAaC_ug)本文叙述、程长分档与 HLR 参照选择规则按该报道口径更新;原始分数仍以各 Benchmark 与厂商来源为准。- [D1] DeepSeek V4-Flash/Pro 官方模型卡
[HuggingFace 模型卡 ↗](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash/raw/main/README.md)链接由于未固定 commit 存在版本和标签映射争议。- [D2] DeepSeek V4-Flash-0731 官方模型卡
[HuggingFace-0731 模型卡 ↗](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/raw/main/README.md)列出官方 Harness 极简模式下(max 档位、top_p=0.95、temperature=1.0)多项对照分。属于自报一手数据(A)。- [DS] DeepSWE 官方榜
[deepswe.datacurve.ai ↗](https://deepswe.datacurve.ai/)Datacurve 官方统一使用 mini-swe-agent 复测成绩(带置信区间)。属于(A)。- [Q] Qwen3.8 官方发布页
[Qwen3.8 Blog ↗](https://qwen.ai/blog?id=qwen3.8)列出 Qwen3.8-Max 自报 Pass@1 72.5% 等。属于自报对照数据(A/B/X)。- [G] GLM-5.2 官方发布页
[智谱 Z.ai Blog ↗](https://z.ai/blog/glm-5.2)作为智谱厂商自报来源。属于(A)。- [AO] Claude Opus 4.8 官方发布页
[Anthropic Opus 4.8 News ↗](https://www.anthropic.com/news/claude-opus-4-8)- [AS] Claude Sonnet 5 官方发布页
[Anthropic Sonnet 5 News ↗](https://www.anthropic.com/news/claude-sonnet-5)- [AF] Anthropic Fable 5 技术资料 PDF
[Anthropic Fable PDF ↗](https://www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf)- [O] OpenAI GPT-5.6 发布及规格说明页
[OpenAI GPT-5.6 Index ↗](https://openai.com/index/gpt-5-6/)- [TB] Terminal-Bench 2.1 官方榜
[Terminal-Bench Leaderboard ↗](https://www.tbench.ai/leaderboard/terminal-bench/2.1)- [TV] Toolathlon-Verified 官方榜
[Toolathlon Leaderboard ↗](https://toolathlon.xyz/docs/leaderboard)2026-06-30 起使用的 Verified 新分数序列。- [TL] Toolathlon 旧版官方榜
  • Toolathlon 官方榜底部的 Previous 历史数据,由于任务定义和基础设施不同,与 Verified 序列不具备可比性。
- [AB] AutomationBench 官方榜
[Zapier Benchmarks ↗](https://zapier.com/benchmarks)Zapier 官方 1.0.5 私有 held-out 榜,与自研自报的 600 题公开研究集并非同数据集。

二、先看「好」:$0.175 打 $10,五项全部超越 #

「好」是硬门槛。一个 Agent 工作台如果交付不了真实任务,再便宜也不会有人每天打开它。

过去这道门槛只能用钱换。Floatboat 这份成绩单的意义在于,它把这个交换取消了。

| 基准 | Floatboat (V4-Flash) $0.175/M | Claude Opus 4.8 $10/M · 贵 57.1× | 分差 | 相对 | |---|---|---|---|---| DeepSWE | 67.25 | 58.0 | +9.25 | +15.9% | Toolathlon | 79.62 | 76.2 | +3.42 | +4.5% | BrowseComp | 87.80 | 84.3 | +3.50 | +4.2% | AutomationBench | 27.50 | 27.2 | +0.30 | +1.1% | Terminal Bench 2.1 | 84.26 | 82.7 | +1.56 | +1.9% |

**五项全部超越 Claude Opus 4.8。**即使在增益最小、程长最短的 Terminal Bench 2.1 上,Floatboat 也以 84.26 对 82.7 领先 1.56 分。

差距最大的是 DeepSWE——仓库级全栈代码开发,Floatboat 67.25 对 Opus 4.8 的 58.0,领先 15.9%。而两者的价格差是 57.1 倍。

这里的底座不是什么特调版本。**DeepSeek V4 Flash 是官方 API 谁都能调的模型,$0.14 输入、$0.28 输出。**按 Agent 场景典型的 3:1 输入输出比折算,混合价为 $0.175/M,只有 Opus 4.8 的 1/57。

顺带说「快」:不是推理速度,是这个价格带来的使用方式

先说清口径:本文五项基准都是任务完成质量,没有延迟或耗时数据,本文不对速度指标作数据声称。

「快」指的是另一件更实际的事——**你从犹豫要不要用它,变成直接让它跑。**混合价 $0.175/M 意味着一个长程任务的成本可以忽略;跑歪了重跑一次,代价同样可以忽略。而 Opus 4.8 是 $10/M,贵 57.1 倍,很多团队用它时要先掂量这一趟值不值。当成本低到不需要掂量,Agent 才会被真的用起来,而不是被珍惜着用。

第九节还有另一半:客户端把文件管理器、编辑器、浏览器原生集成在一个窗口里,省掉的是人这一侧反复上传、下载、切应用的往返。这两件事合起来,才是「快」在这份材料里的确切含义。

三、这是 Harness 对 Harness 的单变量实验 #

一份跨系统对比要能被采信,方法学比结论重要。所以在给出任何 Harness 差值之前,先把对照组的配置摆完整。

  • 双方统一使用 DeepSeek-V4-Flash 0731模型底座 - DeepSeek 官方公开基准中的 Code Agent 任务使用 DeepSeek Harness(即将发布)的极简模式,配置为max

档位、top_p=0.95

temperature=1.0

  • Floatboat 侧统一在 Floatboat Evaluation Harness下执行;大部分基准的模型推理由 DeepSeek 官方 API 提供 - 所有任务在 完全隔离、开箱即用的物理沙盒环境中独立运行 输入参数完全一致

这比「Floatboat 对裸模型 API」更严格,也更有价值:模型相同、模型厂自己的 Harness 也在场,唯一需要解释的变量就是两套 Harness 的系统工程差异。

因此,54.4、73.2、82.7、25.1、70.7 不是裸模型能力,而是 DeepSeek-V4-Flash + DeepSeek 官方 Harness 的系统成绩;67.25、87.80、84.26、27.50、79.62 则是同一模型接入 Floatboat Harness 后的系统成绩。两者的差值,就是 Floatboat Harness 相对模型厂官方 Harness 造出的增量。

对照组取的是 DeepSeek-V4-Flash-0731 + DeepSeek 官方 Harness 的正式成绩,不是更早的 Preview checkpoint。第一节的表里两行都在——用 Preview 的话,DeepSWE 一项就是 7.3 → 67.25,涨幅 821%,一个漂亮得多的数字,但它混进了模型自身后训练迭代与 Harness 对照变化,不能归给 Floatboat Harness。

四、任务越长程,Harness 增益越大 #

如果只看「五项都赢了」,这份成绩单还只是一次跑分。真正有信息量的是增益的分布。

同一个 DeepSeek V4 Flash(0731 checkpoint),分别由 DeepSeek 官方 Harness 与 Floatboat Harness 驱动:

基准 任务性质 DeepSeek 官方 Harness Floatboat Harness Harness 差值 相对提升
Terminal Bench 2.1
单环节命令行调试 · 短程
82.7 84.26
+1.56 +1.9%
AutomationBench
跨 SaaS 多应用流程 · 中程
25.1 27.50
+2.40 +9.6%
Toolathlon
复杂工具调用与长程交互 · 中长程
70.7 79.62
+8.92 +12.6%
BrowseComp
多跳检索证据整合 · 中长程
73.2 87.80
+14.60 +19.9%
DeepSWE
仓库级全栈开发 · 长程
54.4 67.25
+12.85 +23.6%

1.9% → 9.6% → 12.6% → 19.9% → 23.6%。

五项全部具备官方 Harness 对照。按任务程长从短到长排列,程长分档非递减、增益单调递增,没有例外项。任务链条越长、环节越多、越依赖跨步骤的状态维持和自我修正,Harness 的增益越大;任务越短、越单点、越接近一次性问答,增益越小。

BrowseComp 官方未披露平均步数,它的「中长程」依任务设计判断:多跳检索、搜索首屏无法直接回答、检索链长度事前不可知,且需跨源证据交叉验证。它与 Toolathlon 同属中长程档,同档内按增益排序,两者先后不代表程长差异。

Terminal Bench 2.1 是沙盒里的命令行调试,单环节、闭环短——**这一项 Floatboat 只涨了 1.9%,但仍以 84.26 对 82.7 超过 Opus 4.8。**短程任务里 Harness 杠杆较小;长程任务里的优势则显著放大。

反过来,Toolathlon 覆盖复杂的工具调用与长程交互决策。Floatboat 79.62,在本次对比集内数值最高,超过 Qwen3.8-Max(贵 14.9×)7.12 分,超过 Opus 4.8(贵 57.1×)3.42 分。由于不同公开结果采用的 Harness 与运行配置不完全相同,这里比较的是本次对比集中的公开数值,不将其表述为统一 Harness 下的官方统考排名。

**真实工作恰好是长程的那一类。**用户日常要处理的不是一条命令,是跨文件、跨应用、跨很多步、中途还要改主意的活儿。

五、这五道题都不是自己出的 #

上面所有数字的分量,取决于题目是谁出的。

基准 出品方 设计 程长
DeepSWE
Datacurve
113 个完全未泄漏的真实代码库,平均修改 7 个文件、新增 668 行代码,配严密行为校验器
BrowseComp
OpenAI 官方
需多跳检索、搜索引擎首屏无法直接回答的难题,考验反复修正查询与长文本证据交叉验证 中长
Toolathlon
Toolathlon 团队
调用各类系统与本地工具解决复杂实际办公任务,考核多步骤工具决策与复杂状态维持 中长
AutomationBench
Zapier / AA
模拟 47 个主流 SaaS、近 500 个 API 端点,沙盒中混有干扰与陈旧数据
Terminal Bench 2.1
Harbor Framework
沙盒终端里的环境配置、环境排错与复杂运维

「113 个完全未泄漏的代码库,平均改 7 个文件、新增 668 行」「47 个 SaaS、近 500 个 API 端点,还混着陈旧数据」——**这类任务过不去提示词技巧那一关。**它要求真实的文件存取、多步排错、跨应用状态维持,以及在错了之后自己发现并纠正。

这也解释了为什么增益集中在长程任务上:短程任务考模型的单次输出质量,长程任务考的是整个执行系统。

六、Harness 值多少分:一个可以重算的指标 #

行业开始共识 Model + Harness = Agent。左半边被反复计量,每次模型发布都附一张榜单。但右半边一直没有数字,连边界都很少被说清。

Floatboat 正在把前沿模型能力,转化为领先的 Agent 产品。这其中除模型本身以外的所有工作,都属于 Harness 的范畴。

这个范畴不小:模型能碰到什么、每一轮循环怎么收敛、工具返回什么、状态存在哪里,全都在里面(第七节会逐层展开)。它长期缺的不是重要性,而是一把尺子。

Floatboat 提出了一个可以跨 Harness、跨模型重算的比值。最容易理解的写法是:

在同一项 Benchmark 上:

换 Harness 的收益:保持底座模型不变,从基线 Harness 换到待测 Harness 后增加了多少分;换模型的收益:从同一个基线系统出发,换到参照模型系统后增加了多少分。

因此,HLR > 1,意味着不换模型、只换 Harness 获得的增量,已经超过换到参照模型系统的收益。

本指标默认使用「分数越高越好」的 Benchmark,要求分子与分母采用同一评价口径,并按 Benchmark 分别计算,不跨基准求平均。

本次实验保持 DeepSeek-V4-Flash 不变,以 DeepSeek 官方 Harness 为基线、Floatboat Harness 为待测 Harness。参照系统先按统一规则选择:主参照为 Claude Opus 4.8;若它在某一项不高于基线系统,则改取该项最便宜的有效参照,用一次真实、代价最小的模型升级来标定“换模型的收益”。

以 DeepSWE 为例:

  • DeepSeek-V4-Flash + DeepSeek 官方 Harness: 54.4 - Claude Opus 4.8 公布成绩: 58.0,换模型的收益为** 3.6 分** - 同一 DeepSeek 模型放到 Floatboat 上: 67.25,换 Harness 的收益为** 12.85 分** - HLR

DeepSWE= 12.85 ÷ 3.6 = 3.57 ≈3.6× 五项完整结果:

基准 参照系统 换 Harness 的收益 换模型的收益 HLR
Terminal Bench 2.1
GPT-5.6 Luna +1.56 2.00 0.78×
AutomationBench
Claude Opus 4.8 +2.40 2.10 1.14×
BrowseComp
Claude Opus 4.8 +14.60 11.10 1.32×
Toolathlon
Claude Opus 4.8 +8.92 5.50 1.62×
DeepSWE
Claude Opus 4.8 +12.85 3.60 3.57×

**0.78× → 1.14× → 1.32× → 1.62× → 3.57×。**按程长从短到长排列,程长分档非递减、HLR 单调递增,没有例外项:越长程,Harness 的杠杆越高。

Terminal Bench 2.1 上,Opus 4.8 与 DeepSeek 官方 Harness 同为 82.7,没有发生模型跃迁,因此不能作为有效参照。按预先声明的规则改取最便宜的有效参照 GPT-5.6 Luna(84.7),得 1.56 ÷ 2.00 = 0.78×。这一项全部有效参照的 HLR 区间为 0.26×–1.42×,本文采用规则固定的唯一取值,不在候选中择优。

HLR 是 Floatboat 提出的新指标,不是行业标准,换参照系统后数值会变化。它的分子和分母都直接取自第一节的成绩表,参照选择规则也已公开,任何人都可以按“换 Harness 的收益 ÷ 换模型的收益”逐项重算。

七、12.85 分从哪来:一套持续逼近交付标准的系统 #

12.85 分不是任何单点技巧的产物。提示词工程、上下文压缩、工具重排这类手段的增益通常在 1–3 分量级。要解释一个量级更大的差值,得先回答一个更基本的问题:长程任务到底是怎么失败的?

答案不是「某一步答错了」。

**长程任务的失败,通常是循环没有收敛——它与真正的交付标准越走越远。**走远有两个成因:一是交付标准在任务开始时并没有被完整说出来;二是模型每一轮的微小偏差,会在下一轮把上一轮产物当作前提时持续累积。真实工作不是标准答案题:人的意图往往随着中间产物逐渐清晰,而模型带着逐轮变形的目标继续向前,二十步之后就可能形成方向性错误。

这就是「Proactive」在系统层面真正的含义,也是 Floatboat 的设计起点。

今天不少产品把定时唤醒、自动执行预设动作称为「Proactive Agent」。但那只是触发器的主动,不是 Agent 的主动。真正的 Proactive Agent OS,不在于系统能否在没人点击按钮时开始工作,而在于:当用户只说出了一个模糊目标,甚至自己也尚未完全知道什么才算好时,Agent 能否在长程任务中不断探索、执行、观察、修正与自我反思,主动识别结果与目标之间的差距。

好的 Harness 不能把第一句话当成一份永远不变的规格书。它必须在一次又一次 Loop 中持续逼近交付标准,必要时引导用户把未曾言明的要求清晰化,再把这些要求真正实现出来。

**主动性的高级形态,不是替用户定时执行,而是帮助用户发现自己真正要什么,并把它做到。**这才是 Agent OS 与自动化脚本、聊天机器人之间的分界线。

也正是这条分界线,解释了第四节那组数字为什么按程长排序:任务越长,未被说明的标准越多,「持续逼近」的价值就越大;任务短到只有一次问答,就没有可逼近的空间。 23.6% 与 1.9% 的差距,量的就是这件事。

这件事需要整个栈都在自己手里

「持续逼近交付标准」听上去像一句设计理念,但它落地需要四层能力同时成立。这也是 AOE Tech Labs 从第一天起就走了当时看起来最不划算的路的原因。

在行业普遍基于 Claude Agent SDK 套壳做应用、几周就能出一个 demo 的时候,他们选择自研整个软件的 Runtime、Agent Loop、Tools、Infra,以及 FloatSail(Evolution System)。这条路慢得多、重得多,在当时看不到回报。

而这四层各自决定了什么,恰好对应长程任务的四种死法:

Runtime 决定 Agent 能碰到什么。进程、文件系统、权限、沙盒边界——它划定了模型的手能伸多远。DeepSWE 要平均修改 7 个文件、新增 668 行代码,AutomationBench 要在 47 个 SaaS、近 500 个 API 端点之间穿行,这些任务的前提是真实的读写权和执行权,不是把文本递进去再取出来。

Agent Loop 决定长程任务能否收敛。它不是让模型机械地多跑几轮,而是让每一轮的探索都缩短当前结果与最终交付标准之间的距离:从执行中获得新信息,从观察中发现偏差,从失败中修正路径,从中间产物里反推出用户没有明说的要求;该回退时回退,该追问时追问。对模糊目标,它把标准逐轮问出来、试出来;对模型偏移,它重新对齐目标锚点,判断哪些信息必须原样保留、哪些可以压缩,并在偏差还只是偏差时把它按回去。前面说的那种「主动」,物理上就住在这一层。

Tools 决定模型能否正确消费结果。工具的粒度、返回结构、错误语义——一个把失败包装成空字符串的工具,会让模型在第 15 步做出一个自信的错误决策。这类问题在单轮问答里看不见,在 20 步任务里是致命的。

Infra 决定失败能否被发现。状态持久化、并发、可观测性——如果一次长程执行的中间状态无法回溯,那连「哪一步坏了」都不知道,优化就无从下手。

**这四层里任意一层是别人的,你的上限就是别人的上限。**当 SDK 的 Agent Loop 在第 20 步丢了上下文,套壳者能做的只有换个提示词绕一绕;自研者可以直接改循环。这是「能不能修」的差别,不是「修得好不好」的差别。

FloatSail(Evolution System) 解决的是时间维度的问题:模型一年换几代,Harness 不能跟着重写一遍。它让 Runtime、Loop、Tools 与模型适配策略在真实任务反馈中持续演进,并在新模型出现时延续已经形成的系统能力——这也解释了为什么同一套 Harness 能在一个便宜模型上,造出 3.6 倍于两套公开系统差距的增量。

"技术上,只有自己完全可控的系统,才能驾驭高度不可控的模型,实现最大化模型的智能。" —— AOE Tech Labs 团队

这个技术判断与团队构成直接相关:创始人拥有 10 年 OS + AI 创业经历与亿级用户产品经验;两位技术合伙人中,一位拥有模型训练经验,另一位具备 OS 底层技术栈经验。模型训练、操作系统底层与亿级产品工程三类能力汇合,团队自然会把 Agent 当成系统工程问题,而不是提示词问题或者单纯的模型训练问题。

八、为什么用最便宜的模型跑榜 #

因为要证明的是 Harness,不是模型。

用顶级模型作底座会得到「高分 + 归因不清」——没人能判断分数来自模型还是 Harness。现在的实验更严格:同一个最便宜的模型,一边接 DeepSeek 官方 Harness,一边接 Floatboat Harness。**模型权重与成本都不变,系统差值直接落在 Harness 上。**这是更严苛的证明条件,不是更容易的那个。

需要澄清的是,Floatboat 是模型中立的产品,支持接入各家主流模型。这份榜单只用单一底座是评测方法论的要求,不是产品限制。如果 Harness 只为一个模型做特化,那叫调优,不叫杠杆——杠杆意味着换任何模型都能放大。

九、榜单是下限:真实工作里,客户端表现更优异 #

有一件事值得说明:这份成绩是评测环境跑出来的,比用户真实拿到的环境弱。

评测为了可复现而剔除变量,产品为了能干活而叠加能力——两者本来不是同一个东西。

用户实际使用的 Floatboat 客户端,把文件管理器、文件编辑器、浏览器原生集成进了产品本身,并接入 3000 多个在线服务和各类多模态模型。市面上的 Agent 产品几乎千篇一律:进去就是对话框,选一个固定文件夹作项目入口,AI 生成的文档要去别处打开编辑,AI 要用浏览器还得装插件或征用你正在用的浏览器。Floatboat 的绝大部分工作在一个窗口里完成——不需要打开文件选择器上传,不需要决定下载到哪里,拖拽即可。

对 Agent 而言,这些不是界面,是可调用的工具面:更多可用工具、更短的环境往返、更完整的执行闭环。** AOE Tech Labs 确认,完整客户端环境下运行同一批基准,成绩高于本文公布的数字,具体分数后续披露。**

"产品设计上,只有让人用的舒服,才能最大化人的潜力。" —— AOE Tech Labs 团队

顺着第四节那条规律看,这件事是自洽的:**工具面越宽,长程任务的增益越大。**而真实工作恰好是长程的那一类。所以榜单上的数字是保守下限——在实际工作中,客户端的表现要更优异。

那个待披露的差值,可能比榜单本身更有意思。如果 HLR 回答了「Harness 值多少分」,这个差值将回答下一个问题:工具面值多少分。

回到开头那个判断:榜单证明了「好」,完整客户端扩展了「多」,低成本与更短的环境往返带来「快」,57.1 倍价格差对应「省」。多、快、好、省同时成立,Agent 工作台才从演示变成每天会打开的东西。

十、现在就能验证:floatboat.ai #

上面所有数字都可以自己跑一遍。

入口: floatboat.ai。AOE Tech Labs 同步推出了基于 DeepSeek 的专版,

首月注册 5 元/1 美金,对应的正是这份榜单的测试底座 DeepSeek V4 Flash——你拿到的是同一个模型。

验证路径很短:**用同一个模型,对比它在别处和在 Floatboat 里的表现差距。**同模型、不同 Harness,差值就是答案。

建议直接拿长程任务试,因为那是杠杆最大的一段,也是你日常真正在干的活:让它改一个跑得起来的仓库、把一份真实资料做成可交付的报告、或者把一个模糊的想法交给它,看它能不能帮你把标准想清楚。

而本文的所有分数都来自评测环境。你在 floatboat.ai 拿到的客户端,比跑榜单的那个环境更强。

十一、公司与产品线 #

AOE Tech Labs Limited,2025 年底成立,种子轮投资方为红杉与微光创投。

2026 年 1 月— 发布 Floatboat 客户端,开创 Agent 桌面工作台形态** 2026 年 4 月**— 发布 FloatIM,构建人与 Agent、Agent 与 Agent 的协同办公网络** 2026 年 5 月**— 发布 FloatSchedule,让 Agent 依据日程主动工作** 2026 年 8 月**— 发布 Floatboat Harness 五项评测完整数据:同一个 DeepSeek-V4-Flash 接入后,五项全部超过 Claude Opus 4.8;同步提出 Harness 杠杆率(HLR)

同一个模型,对比它在别处和在 Floatboat 里的表现 #

模型不变,只换 Harness。拿一个真实的长程任务来试,差值就是答案。

前往 floatboat.ai 验证 ↗

── more in #artificial-intelligence 4 stories · sorted by recency
── more on @floatboat 3 stories trending now
sponsored brought to you by zahid.host 4,200+ EU-deployed projects
reading about agents? ship yours in a single git push.

Run your AI side-project on zahid.host

EU-based hosting, git-push deploys, automatic HTTPS, no cold starts. Free tier with a custom domain — perfect for shipping the agent you just read about.

$git push zahid main
Live at https://your-agent.zahid.host
Get free account → Pricing
from €0/mo · no card required
LIVE [news/claude-opus-4-8-cost…] indexed:0 read:9min 2026-08-11 ·