Floatboat Harness:AI Agent性能超越高价模型57倍

当智能办公助手还在两难境地中徘徊——要么能干活但成本高到不敢放开用,要么便宜却连基础任务都完成不好时,Floatboat带来的一组评测数据,终于撕开了这个行业痛点的口子。
作为一家专注办公场景的AI团队,AOE Tech Labs此前已经推出了三款标志性产品:年初的Floatboat客户端将文件管理器、编辑器与浏览器整合为Agent运行环境,4月的FloatIM搭建起人与Agent、Agent与Agent的跨上下文办公网络,5月的FloatSchedule让Agent可以脱离人工指令按日程自动执行。这三款产品均围绕真实办公需求打造,但其核心底层技术并非界面创新,而是名为Harness的底层系统。
2026年8月7日,该团队公开了Floatboat Harness的第三方基准测试结果:基于市面常见的DeepSeek-V4-Flash模型(混合调用成本约0.175美元每百万token),五项基准测试成绩全面超过了Claude Opus 4.8——后者的混合调用成本高达10美元每百万token,前者仅为后者的1/57。
很多人第一眼会觉得这只是「低价模型追上旗舰」的老戏码,但数据本身否定了这个解读。同一套DeepSeek-V4-Flash模型,在模型厂商官方的Harness系统中,DeepSWE任务得分仅为54.4,低于Claude Opus 4.8的58.0;而接入Floatboat Harness后,同模型的得分提升至67.25。在Terminal Bench 2.1测试中,官方Harness与Opus 4.8打成平手,其余四项测试全部落后,而接入Floatboat Harness后实现五项全胜。模型权重与调用成本完全不变,唯一的变量就是Harness系统。
为了保证结论的可信度,本次测试采用了严格的单变量对照设计:双方统一使用DeepSeek-V4-Flash 0731正式版模型,官方基准测试使用模型厂商公开的DeepSeek Harness极简模式,Floatboat侧则在专属评估Harness下执行,所有任务在隔离沙盒中运行,输入参数完全一致。值得注意的是,本次对照的基线并非裸模型API,而是模型厂商自带的Harness系统,这让测试的严谨性远超普通的产品对比。同时团队选择了正式版模型而非预览版,避免了模型自身迭代带来的干扰,确保分数差异完全来自Harness系统的优化。
团队选择低价模型作为测试底座,恰恰是为了让归因更清晰。如果使用顶级模型测试,高分结果可能来自模型本身而非Harness;而锁定低价模型后,分数差异只能来自Harness系统,这是更严苛的证明方式。产品本身的Harness系统支持接入所有主流模型,本次仅选择单一底座是为了满足测试方法论的要求。
如果只看到「五项全胜」,这只是一次普通的跑分。真正有价值的是成绩增益的分布规律:按任务长度从短到长排序,Floatboat Harness的增益从1.9%逐步提升至23.6%——任务越长、环节越多、越依赖跨步骤的上下文维持与自我修正,Harness的优势越明显。这完全符合真实办公场景的特点:日常工作不是单次问答,而是跨文件、跨应用、多步骤且可能中途调整方向的复杂任务。
五项测试中仅BrowseComp未公开平均步数,其「中长程」定位基于任务设计判断:需要多跳检索、跨源证据交叉验证,单次任务的检索与核验轮次与Toolathlon相当,同属中长程任务区间。
本次测试使用的五项基准均来自第三方公开评测,没有一项是团队自行出题,其中BrowseComp更是来自OpenAI官方。在OpenAI官方的BrowseComp榜单中,Floatboat系统的87.80分超过了GPT-5.6 Terra、Claude Sonnet 5、Opus 4.8等多款旗舰模型。这类测试要求真实的文件存取、多步排错、跨应用状态维持与自主纠错,单纯的提示词技巧无法通过这类测试,恰好验证了Harness系统的实际落地能力。
为了量化Harness的价值,团队提出了HLR(Harness Leverage Ratio,Harness杠杆率)指标:HLR = 换Harness的收益 / 换模型的收益。其中分子是模型不变、仅更换Harness带来的分数提升,分母是Harness不变、升级到更强参照模型带来的公开分数跨度。当HLR>1时,意味着仅更换Harness获得的收益,超过了升级到参照模型的整体性能提升。
以DeepSWE任务为例:官方Harness系统得分54.4,Claude Opus 4.8公开得分58.0,两者差距仅3.6分;而同一模型接入Floatboat Harness后得分67.25,提升了12.85分。计算可得HLR_DeepSWE=12.85/3.6≈3.6×,也就是说仅更换Harness获得的收益,是升级到Opus 4.8的3.6倍。
参照系统的选择有明确的规则:主参照统一使用Claude Opus 4.8;如果该模型在某一项测试中未超过基线系统,则改用该项最便宜的有效参照,确保分母代表的是用户真实会选择的、代价最小的模型升级路径。比如在Terminal Bench测试中,Opus 4.8与官方Harness得分完全一致,没有发生模型性能跃迁,因此改用GPT-5.6 Luna作为参照,最终得到0.78×的HLR值。团队公开了该项测试的全部有效参照区间,确保数据的透明度。
要解释12.85分的巨大分数提升,需要先理解长程AI任务的核心失败逻辑:长程任务的失败往往不是某一步答错了,而是整个执行循环没有收敛,逐渐偏离交付标准。这种偏离来自两个方面:一是用户的交付标准在任务开始时并未完全清晰,真实工作不是标准化考题,用户的意图会随着中间产物逐步明确;二是模型生成的固有偏差,每一轮输出的微小偏差会在多轮迭代中累积成方向性错误,最初的任务要求会被逐渐稀释,模型带着变形的目标持续执行,最终产出与需求南辕北辙。
偏移不需要主动出错就能致命:每一步看起来都合理,但组合起来却完全偏离了最初的目标。
这也解释了团队对「主动Agent」的定义:当前不少产品将定时唤醒、自动执行预设动作称为主动Agent,但在团队看来这只是「触发器的主动」,而非Agent的真正主动。真正的主动Agent操作系统,应该能够在用户仅提出模糊目标、甚至自己也不清楚具体标准时,在长程任务中持续探索、执行、观察、修正与自我反思,主动识别结果与目标之间的差距。团队将这种能力总结为:主动性的高级形态,不是替用户定时执行,而是帮助用户发现自己真正要什么,并把它做到。
要实现「持续逼近交付标准」的能力,需要四层核心能力同时落地。在行业普遍基于第三方SDK套壳开发Agent应用的当下,AOE Tech Labs选择自研Runtime、Agent Loop、Tools与Infra四层系统,以及FloatSail进化系统,这条路虽然更慢更重,但却是唯一能保证可控性的路径。
- Runtime决定Agent能访问的资源边界,包括进程、文件系统、权限与沙盒环境,复杂的办公任务需要真实的读写与执行权限,而非仅文本交互;
- Agent Loop决定长程任务能否收敛,它不是简单的多轮调用,而是通过每一轮执行获取新信息、发现偏差、修正路径,从中间产物中反推用户未明确说明的需求,确保每一步都向交付目标靠近;
- Tools决定模型能否正确消费执行结果,工具的粒度、返回结构与错误语义都会影响长程任务的执行,一个返回空字符串的失败工具,会在多轮任务中导致致命错误;
- Infra决定失败能否被追溯与优化,状态持久化、并发支持与可观测性,让长程执行的中间状态可回溯,才能针对性地优化系统。
四层能力中任意一层依赖第三方,上限就被锁定为第三方的水平。当第三方SDK的Agent Loop在第20轮丢失上下文时,套壳开发者只能通过调整提示词绕开问题,而自研团队可以直接修改循环逻辑,这是「能不能修」与「修得好不好」的本质区别。FloatSail进化系统则解决了模型迭代与任务复杂度提升的问题,让Runtime、Loop、Tools与模型适配策略能够在真实任务反馈中持续演进,保证系统能力的延续性。
「技术上,只有自己完全可控的系统,才能驾驭高度不可控的模型,实现最大化模型的智能。」 —— AOE Tech Labs 团队
本次公开的评测数据其实是保守的下限。为了保证测试的可复现性,评测环境剔除了部分变量,而用户实际使用的Floatboat客户端集成了文件管理器、文件编辑器与浏览器原生功能,并接入了超过3000个在线服务与多模态模型。当前多数Agent产品仅提供对话框界面,需要手动选择文件夹、在外部编辑AI生成的文档、额外安装浏览器插件,而Floatboat的所有操作都可在一个窗口内完成,无需来回切换应用,拖拽即可完成文件上传与保存。
对Agent系统来说,这些集成的功能并非简单的界面优化,而是可调用的工具面:更丰富的可用工具、更短的环境往返、更完整的执行闭环。团队确认,完整客户端环境下的测试成绩会高于本次公开的数据,具体分数将在后续披露。
「产品设计上,只有让人用的舒服,才能最大化人的潜力。」 —— AOE Tech Labs 团队
按照任务长度的增益规律,工具面越丰富、用户使用越流畅,长程任务的增益就越大,而真实办公场景恰好都是长程任务,因此本次评测的成绩只是真实使用效果的保守值。待公开的客户端环境成绩差值,将回答另一个关键问题:优秀的人机交互设计能带来多少性能提升。
最后回到成本与效率的维度,本次测试的意义不止于省钱。五项测试均围绕任务完成质量,并未涉及延迟与速度数据,但成本优势带来的使用场景改变同样关键:单次长程任务的成本可以忽略不计,跑歪了可以直接重跑,无需担心成本压力。而Opus 4.8高达57.1倍的成本,让多数团队在使用时不得不反复掂量「这一次调用是否值得」。只有当使用成本低到无需权衡,Agent才能真正进入日常工作,而非被小心翼翼地试用。
这里的「快」还包括交互效率的提升:客户端省去了寻找文件、上传下载、切换应用的往返时间。总周转时间从来不是仅指首token延迟,找到文件的时间、Agent直接读写保存的效率、多工具同环境的协同能力、失败后回退重跑的成本,这些共同构成了真实使用中的「快」。
多、快、好、省,这四个维度在本次数据中首次同时落地:任务覆盖更全面、交互效率更高、五项基准成绩更优、成本仅为对手的1/57。只有同时满足这四点,AI Agent工作台才能真正走出演示阶段,进入日常办公场景。
所有公开的数据都可以自行复算。测试入口为floatboat.ai,团队同步推出了基于DeepSeek的专版,首月注册仅需5元对应1美金额度,使用的正是本次测试的DeepSeek V4 Flash模型。验证路径非常简单:使用同一模型,对比它在其他系统与Floatboat中的表现差异,同模型、不同Harness的分数差,就是Harness带来的价值提升。建议直接尝试长程任务,这是Harness优势最明显的场景,比如让AI修改一个可运行的代码仓库、将一份真实资料整理为可交付的报告,或是将模糊的想法交给AI,看它能否帮你明确交付标准并逐步落地。

