文章摘要
近期AI行业发展逻辑发生转变,从早期鼓励最大化token用量、探索创新的Token-Maxxing阶段,转向追求综合成本可控的Token-Minimizing时代。目前国内外多家厂商推出兼具性能、速度与成本优势的轻量化Flash大模型,成为高性价比主力,推动原本投入产出比不佳的常规AI任务实现规模化落地,重塑了AI应用选型逻辑。

近期的行业峰会上,多位从业者分享了AI模型选型的最新变化,这让我们得以窥见AI行业的新一轮逻辑转变。

如今不少AI厂商都推出了轻量化的Flash版本大模型,这类产品兼具性能、速度与成本优势,让原本投入产出比不理想的常规任务也能实现规模化落地。从国内的DeepSeek V4.1-Flash、GLM-5.3-Flash,到海外的Gemini 3.8 Flash,这类模型正成为各厂商主推的高性价比主力产品,帮助团队把那些不需要顶级旗舰模型出马的任务,变得切实可行。

这背后折射出AI行业的一次重要转向:从Token-Maxxing到Token-Minimizing的思潮更迭。

Token-Maxxing阶段

Token-Maxxing这个概念在今年上半年开始被广泛讨论,直白来说就是最大化Token使用量,尽可能多地发起并发请求、拓展应用场景,国内还有个形象的说法叫“全民养虾”。当时有头部科技企业内部推出了按Token用量排名的内部看板,还会授予专属称号,本质是鼓励员工优先尝试使用AI工具。

在行业发展早期,大厂们的思路很明确:即便AI代理无法100%完成任务,通过并行探索多种方案也能帮助团队积累经验,宁可浪费一些计算资源,也不要错过潜在的创新机会——毕竟如果探索出能节省半年开发周期的方案,整体收益远大于投入。但这种模式很快出现了偏差:有人开始无意义地消耗Token,比如编写脚本让多个Agent并行运行毫无价值的任务,甚至将公司的Token资源中转牟利,这引发了行业的深度反思。

我们该如何更高效地分配AI算力资源?Token的使用本质是智力资源的分配,应该投入到真正有价值的任务中,而非为了炫耀使用量而造成浪费。由此,行业开始转向新的发展逻辑。

Token-Minimizing时代

Token-Minimizing的核心是精细化核算每份智力产出的综合成本。企业都希望员工充分使用AI工具,但预算终归有限,这一理念要求压低每份合格交付的总成本,也就是综合人力与Token消耗的整体成本。如果为了节省100元的Token支出,却额外耗费了1万元的人力成本,显然是得不偿失的。

随着更多模型达到可用标准,厂商顺势推出了这类轻量化Flash模型,它们的通用标准大致包括:

  • 性能基准不低于Opus 4.6
  • 售价仅为头部模型的1/10以内
  • 响应速度可达100 token/s甚至更快

比如DeepSeek V4.1-Flash的售价仅为Opus 4.8的1/10,而GLM-5.3-Flash更是做到了仅为Opus 4.8的1/40,在当时的市场中竞争力极强。这也带来了一个朴素的市场问题:如果没有特殊需求,用户为什么要选择高价的旗舰模型?一个模型不需要赢过所有对手,但必须在市场中找到属于自己的精准定位。

因此,AI模型的竞争开始朝着两个方向延伸:一是继续向上突破,探索此前无法完成的复杂任务;二是向左深耕,用更低的成本完成已经能够实现的常规任务。

行业峰会的真实讨论

在近期的行业峰会上,多个团队都谈到了模型选型的显著变化。过去企业优先选择规模最大、性能最强的模型,而如今不少轻量化模型已经能够达到业务要求的基准线,此时成本与响应速度就成了重要的选型因素。

这种变化也说明,Token-Minimizing不能仅仅理解为单纯节省Token。相关技术负责人表示,当用户规模扩大后,推理成本会大幅上升,而C端应用还有一个现实问题:用户不会无限等待。即便模型在基准测试中仅慢几秒,放到实际产品中,等待5秒就可能流失大量用户。

当轻量化模型能够达到业务基准线后,选型的核心已经从“谁最聪明”转变为“谁能在足够聪明的前提下,更快、更便宜、更稳定地完成任务”,真正的关键是端到端的任务成功率。如果只是单轮回答又快又便宜,但最终没能完成任务,那么节省的Token也毫无意义。

峰会上还介绍了一款针对金融领域的增强模型,它沿用了轻量化Flash架构,总参数124B,激活参数5.1B,通过金融语料训练、领域微调与工具优化,强化了信息检索、研究推理、估值建模与研报撰写能力,还能够生成可追溯数据、保留公式且支持继续编辑的研究文件。比如在演示中,该模型可以读取财报和一份包含7张工作表、5000余个公式的Excel文件,将季度预测值更新为实际披露数据,同时处理公式切换、跨表依赖与图表调整,最终返回仍可编辑的工作簿。

顺着这个案例可以进一步思考:越来越多的任务会变得足够便宜,以至于不需要专人全程跟进。虽然Flash模型能够降低单次执行的成本,但如果每次都需要研究员手动发现变化、反复检查,依然会造成浪费。未来的工作模式或许可以是:将常规核心任务交给自动化检验工具,仅将无法通过检验的任务交给专业人员处理。

蚂蚁集团联合相关机构推出的专业评测基准,就体现了这种精细化的思路。该评测由50余名金融专业人士深度参与设计,从结果、过程与证据三个维度,系统评估AI输出是否准确完整、研究口径与计算是否合理,以及关键数据能否回溯至权威来源。

在这个体系中,金融机构可以将模型接入自身的数据与工具环境,快速定位问题所在,这背后的核心理念正是Token-Minimizing。对于金融这类需要严格把关的行业,除了在高频调用中节省Token,还要有效降低复核与返工的时间成本,这才是真正的Token-Minimizing。毕竟在金融场景中,人力复核的成本往往远高于Token消耗。

还有团队谈到了一个反直觉的行业现象,当前不少基准测试会鼓励模型“尽量回答”,即便不知道答案也要猜测,因为猜中就能得分,直接拒绝回答反而不得分,这种设计让模型更像“讨好型选手”。但真实的业务场景并非如此。

比如在金融评测中,有些模型遇到不确定的问题时,会一口气给出数十种不同口径的答案,从基准测试的角度看可能覆盖了正确答案,但真正的研究员不可能拿着数十个互相冲突的判断来做决策。因此在严肃场景中,团队反而会提高对拒答的奖励,在不确定的时候,宁愿直接告诉用户无法给出准确答案。

这其实也是另一种形式的Token-Minimizing:不是少消耗几个Token,而是少制造一次错误,减少后续专人修正错误所花费的时间。该评测的候选题目经过了严格的多轮审核:从专家编写、独立复答、交叉验证、Rubric审核、压力测试到一致性检查,最终仅保留123道任务。

最终的行业判断

站在五年前的视角来看,如今的AI发展充满魔幻色彩,人工智能正在自我递归迭代,不断催生新的可落地需求。而真实世界最终会告诉AI模型,真正的成功是“把事情做成”。

我们甚至可以做出一个假设:即便当下性能顶尖的旗舰模型,也未必能胜过六个月后的轻量化Flash版本模型。随着模型整体性能的不断提升,加上并非所有厂商都能占据头部生态位,未来会有越来越多以Flash为名的轻量化模型推出。对于所有常规任务来说,其实没有必要为旗舰模型的溢价买单。

原本需要人工或顶级旗舰模型处理、投入产出比不佳的任务,如今终于有了规模化落地的可能。简而言之,旗舰模型告诉我们哪些任务可以交给AI,而轻量化Flash模型则告诉我们哪些任务值得交给AI。

以上内容不代表本平台立场,仅供读者参考