文章摘要
近期,DeepSeek-V4-Flash-0731发布并开源。专业机构将其接入四款智能体测试框架,开展30项真实智能体任务测试。结果显示,不同框架在成功率、单次任务成本、端到端运行速度表现有差异,且无一款框架能在所有指标占优。因此,选择框架应根据自身看重的指标,而非单一综合排名。

近期,DeepSeek-V4-Flash-0731正式发布并开源,这款模型总参数量达284B但仅激活13B,在Agent基准测试中的表现反超了V4-Pro-Preview版本。

有专业机构开展了一组对照测试,将DeepSeek V4 Flash接入四款不同的智能体测试框架,分别为Claude Code、Codex、OpenCode以及Oh My Pi,让它们同步运行30项真实智能体任务。测试结果显示,不同框架下的任务成功率相差3个,单次任务的成本差距接近3倍,端到端运行速度的差异更是达到2.2倍。

这30项任务并非预设的简单测试题,而是对接了Gmail、Sheets、Airtable、GitHub、Slack、Calendar、Notion、PagerDuty等多款日常办公工具的真实多步工作流,覆盖账目整理、审计、批量编辑与数据同步等场景。任务的判定标准十分严格,只有当所有预设检查项全部通过时,才算任务成功完成。

三大维度下的表现差异

成功率(满分30分):

  • Oh My Pi以17/30的成绩位居第一
  • Claude Code和Codex均取得16/30的成绩
  • OpenCode以14/30的成绩垫底

最反直觉的一点是,有7个任务的最终成败完全取决于所使用的框架——同一模型更换框架后,任务结果会从通过变为不通过,或是反过来。

单次成功任务的成本(按运行时API官方报价估算):

  • OpenCode仅需$0.073,是四款框架中最便宜的
  • Codex的成本为$0.081
  • Oh My Pi的成本为$0.103
  • Claude Code成本最高,达到$0.195,约是最便宜的OpenCode的2.7倍

四款框架的单次成功任务成本均低于$0.20,测试方特别提醒,若DeepSeek后续调整定价,这个成本格局可能会发生变化。

每任务中位耗时(端到端钟表时间):

  • Claude Code以122.7s的成绩成为最快的框架
  • OpenCode耗时129.7s,紧随其后
  • Codex的耗时为245.0s
  • 最慢的是Oh My Pi,平均耗时达到272.4s

没有全能的最优框架

将三个维度的测试结果放在一起对比,会发现一个出人意料的结论:没有任何一款框架能在所有指标上都占据优势。速度最快的Claude Code成本最高,而成功率最高的Oh My Pi恰恰是速度最慢的,最便宜的OpenCode则在成功率上垫底。

结论很直接:智能体测试框架的选择本身就会影响3个任务的成败、带来近3倍的成本差异和2.2倍的速度差距,因此应当根据自身最看重的指标来选择框架,而非依赖单一的综合排名。

Composio - We ran DeepSeek V4 Flash through 4 agent harnesses (Claude Code, Codex, OpenCode, Oh My Pi) on 30 agentic tasks
https://x.com/composio/status/2085330847951970801
以上内容不代表本平台立场,仅供读者参考