半年内AI智能体token用量激增14倍,人类仅增2.8倍

2026年2月6日,人类最后一次在token使用上跑赢AI。当天,全球主流模型网关平台上,智能体的token消耗量首次追平了人类用户的使用总量。
仅仅半年之后,两者的差距已经拉大到五倍。根据平台统计数据,截至8月10日,智能体类的token用量从0.51万亿增长至7.3万亿,涨幅达到14倍;而人类用户的token使用量仅增长至1.4万亿,涨幅仅为2.8倍。
负责统计的平台同时对接了近70家模型供应商与开发者,每周需要处理超过28万亿的token请求。据该平台负责人估算,这部分流量大约占据全球AI推理总量的1%,其中一半的请求来自美国地区。
不看你是谁,只看你怎么用
那么平台是如何区分哪些请求来自人类,哪些来自智能体的?这套统计逻辑并不依赖用户身份,而是通过API密钥追踪使用行为:通过工具调用频率、两次响应的间隔时长、单轮对话的来回次数等七项信号进行加权打分,最终将流量划分为智能体、混合模式和人类用户三类。
之所以可以通过行为模式区分,核心逻辑非常直观:人类使用AI时通常是一问一答,中间需要阅读、思考、手动输入,节奏相对缓慢;而智能体则会持续调用工具、循环执行任务,这种高强度的运行节奏完全不符合人类的使用习惯。因此这套统计模型虽然是估算,但整体方向具备很高的准确性。
需要明确的是,token统计的并非使用AI的用户数量,而是AI替人类完成工作的深度。一个简单的人类用户请求,如今可能触发数十轮模型调用和工具调用,背后的token消耗量远超单次对话的账面数据。
一个Agent任务,顶一百次聊天
人类与智能体的使用逻辑有着本质区别。人类的单次AI交互通常是打开对话框、输入一段提示词、等待回复、复制结果后关闭窗口,整个过程可能只有不到十轮对话,token消耗量最多只有数千。
但智能体的运行模式完全不同:只需要给它一个明确的目标,它就会自主完成读取文件、调用工具、生成结果、迭代修改等一系列流程,直到任务完整收尾。人类用户只需要在初始提示词中填充完整的目标、规范和上下文信息,后续模型就会基于这份上下文进行增量式的读写操作。当人类还在手动进行一问一答的交互时,智能体已经可以仅凭一条初始指令持续运行一整天。
因此同一个用户,上午还在手动复制粘贴对话结果,下午使用智能体完成相同任务时,token消耗量会直接提升一个数量级。正如行业观察人士指出的,真正带来token使用量级跃升的,是人类开始让智能体进行长时间的自主运行。
再便宜的token,也能烧穿预算
看到智能体token用量14倍的涨幅,很多人第一反应是成本会大幅飙升,但实际情况并非如此。该平台相关负责人补充说明,智能体天然具备多轮交互的特性,单次智能体请求中近70%的token来自缓存的上下文提示,而缓存部分的计价通常远低于全新输入的token。
具体来说,智能体在运行过程中,第一次会将完整的上下文包括代码规范、操作手册、工具清单等加载到模型中,支付一次全价;后续的每一轮交互只会进行增量更新,命中缓存的部分仅需要按照正常输入价格的一小部分计费。也就是说,智能体token用量的陡峭增长曲线中,近七成都是被反复复用的同一段上下文内容。另有行业报告指出,缓存token几乎贡献了智能体token用量的全部增量,部分统计口径下这一比例甚至超过85%。
即便单价有所降低,但架不住用量的狂飙式增长。某出行平台的技术负责人Praveen Neppalli Naga曾透露,公司工程师仅用四个月就消耗完了全年的Claude Code预算;他本人一场两小时的技术演示,就花费了1200美元的token费用。单价打三折、用量涨14倍,两者相乘后的总成本涨幅并不难估算。
另有咨询机构算了一笔更直观的账:同样一次客服交互,2023年的成本约为0.04美元,到2026年已经涨到约1.2美元,涨幅达到30倍。这并非因为模型本身涨价,而是因为交互模式发生了变化:过去只是简单的一问一答,而现在客户的同一个问题背后,系统需要查询工单、调整库存、翻阅历史记录,经过十几轮迭代才能生成最终回复。相同的任务,只是执行方式变了,成本就出现了大幅上涨。
据投资机构高盛估算,到2030年,智能体AI可能会让全球token消耗量提升24倍。当一项成本在半年内暴涨14倍,企业必然会开始精细化控制成本,这也让开源权重模型和低价token服务重新受到关注。
另外需要注意的是,缓存token虽然单价低廉,但会占用大量内存。智能体可以连续运行数小时而无需重新初始化,正是因为内存承载了完整的上下文信息,这也是近期高带宽内存供应紧张的重要原因之一。
分水岭不在你用哪个模型
很多人会认为,降低成本的方法是更换更便宜的模型,但真正的分水岭并不在于使用哪一款模型。同一个AI模型,如果只是被当作搜索框使用,单日token消耗量可能只有数千;但如果将其接入企业的文件系统、工具链,并搭建可持续运行的自动化流程,单日token消耗量可以轻松达到数千万。
真正的差距不在于模型本身,而在于是否将AI融入到真实的业务流程中。一组来自行业统计的数据可以直观体现这一鸿沟:使用AI程度最深的10%的企业,每名活跃用户的token输出量是普通企业的8.3倍,而在今年年初,这个差距还仅为2.6倍,半年时间差距扩大了三倍以上。
拉开差距的并非模型性能,而是配套的落地能力。在同一份统计中,头部企业的活跃用户每周有21%会使用插件功能,普通企业的这一比例仅为9%;智能体技能的采用率则是19%对3%,而在该模型厂商的内部团队中,这一比例高达95%。将日常重复的工作打包成可复用的智能体技能,可以避免每次任务都从零开始摸索,减少重复搜索和返工的次数,直接节省成本。
token花了,谁来验收
即便成本控制得再精细,智能体的大规模应用依然存在一个容易被忽略的风险:任务的验收与审核。智能体流量的暴涨并不意味着AI完全实现了自主行动,绝大多数任务依然是由人类发起的,中间往往还需要人工审批环节。
有企业开发者提到,他们服务的企业客户从未想过完全放手让智能体自主运行,采购、发送、签字等关键环节都需要回到人工审核。但问题在于,当智能体的运行效率提升后,人工审核的节奏往往跟不上自动化的速度。
有从业者分享过一个典型案例:他们的智能体删除了广告账户中的18个视频,直到整整一天之后才被相关人员发现。这并非模型出现了严重错误,而是根本没有人去监控这一环节的执行情况。token消耗量可以在半年内暴涨14倍,但负责审核的人手却不可能同步增长,这或许是本轮智能体增长中最容易被忽视、也最昂贵的隐性成本。
未来重复的执行性工作必然会被AI大量替代,但真正稀缺的依然是验证、判断以及决定哪些工作值得去做的能力。AI已经成为token的主要消费方,但截至目前,它依然无法替人类完成最终的签字确认。未来企业真正需要面对的问题,不再是是否使用AI,而是当AI替人类完成了大量执行工作后,谁来验收成果、谁来拍板下一步的行动方向。

