文章摘要
全球大模型市场迎来转折点,过去两月开源大模型Token调用占比从28%跃升至62%,反超闭源模型成主流。英伟达加速布局开源赛道,目标沉淀利润于硬件底座。大模型竞争白热化,节奏从“半年一代”缩至“两周一轮”,“性价比”成闭源厂商难题。闭源厂商领先窗口期缩短,开源模型从“可用”迈向“值得大规模商用”,颠覆传统商业模式。

全球大模型市场正在迎来历史性的转折点。过去两个月内,在服务数百万开发者的主流AI部署平台上,开源大模型的Token调用占比从28%跃升至62%,首次在全球范围内反超闭源模型,成为行业的主流选择。更值得注意的是,这一轮反超恰逢闭源厂商密集推出旗舰新品:即便OpenAI、Anthropic等头部厂商接连发布新模型、频繁降价试图抵御开源冲击,新增的Token调用量依然更多地流向了开源阵营。

行业巨头英伟达也在加速布局开源赛道。近期有消息显示,英伟达将向Poolside支付60亿美元技术授权费用,同时追加10亿美元股权投资,并收编该公司超过100名核心工程师,将其纳入自家开源大模型产品线Nemotron团队,目标是打造可与DeepSeek、Kimi等主流开源模型抗衡的前沿产品。这一动作并非临时起意:早在今年3月,英伟达就牵头成立了Nemotron Coalition,集结了Mistral、Perplexity等一众模型与智能体领域的头部团队,共享算力与数据资源;7月,英伟达高管公开表态,强调AI行业的领导力离不开开放的产业体系;8月,英伟达还推出了开源的Nemotron 3.5 Lightning混合专家模型,深度绑定自家CUDA与TensorRT-LLM算力基座。不难看出,英伟达的核心目标并非追求单一模型的跑分第一,而是通过降低开源模型的推理成本,让全球AI应用的Token消耗量大幅提升,最终将行业利润沉淀在自身的硬件底座上。

根据主流AI部署平台的公开数据,开源模型的Token份额增长曲线几乎呈陡直上扬态势:今年4月,开放权重模型的Token占比仅约11%;到6月下旬,这一数字升至28.4%,当时开源模型仅占据不到4%的API支出,却承担了近三分之一的调用量;到8月22日,开源模型的Token占比进一步冲到62%,正式反超闭源模型成为市场主流。其中,DeepSeek单独拿下了22.6%的Token份额,智谱GLM-5.2上线后短短两周,日Token消耗量就增长了约50倍。更关键的是,这一轮反超并非建立在闭源模型增长放缓的基础上:有投资人指出,7月OpenAI和Anthropic的绝对Token调用量仍在加速增长。也就是说,在闭源模型更新最激进、降价幅度最大的阶段,它们依然丢掉了市场领先的身位。

复盘过去半年开源与闭源两大阵营的交锋,可以发现大模型的竞争节奏已经从“半年一代”被压缩到了“两周一轮”的白热化模式。今年4月起,DeepSeek V4、Qwen3.6、Kimi K2.6等开源模型将竞争重点从通用问答转向代码开发与智能体场景;随后GLM-5.2、Kimi K3、DeepSeek V4 Pro、GLM-5.3等产品持续强化长程任务与工具调用能力,相关厂商在8月开放了多款旗舰级开源模型权重。过去开源阵营追赶的核心是模型能力,如今争夺的已经是真正消耗大量Token的生产级工作流。闭源巨头也在同步调整防御策略:5到6月,Anthropic用Opus 4.8、Fable 5守住前沿阵地,又迅速以Sonnet 5将高阶智能体能力下放至更亲民的价位;7月,OpenAI发布GPT-5.6系列,首次将“单位美元性能”作为核心卖点,Anthropic随即跟进将Opus 5的价格腰斩;8月,谷歌Gemini 3.7 Flash距上一代产品仅三周就推出,价格再次砍半。“性价比”这一曾专属开源阵营的核心优势,如今已经成为闭源厂商必须直面的命题。

仅Fireworks一家开源推理平台,目前日均Token处理量就超过40万亿,约为OpenAI今年3月底API吞吐量的整整两倍。行业研究机构判断,最近两个月是开源智能体模型的爆发期:2025年的DeepSeek R1更多承担边缘测试任务,未规模化进入产生经济价值的工作流;而到2026年,多款开源模型已经能够承担代码开发、智能体等生产级任务,这也正是头部闭源厂商年度经常性收入暴涨的核心腹地。

这一轮市场转向的直观注脚,正是Anthropic旗舰模型Fable5的市场遇冷。根据行业统计数据,Fable5作为品牌旗下性能最强、定价最高的旗舰产品,发布两个多月后仅占据合作企业客户模型总支出的11.4%,按Token计算的占比更是只有约6%;而7月底上线的更低价位版本Opus5,很快就在企业支出规模上反超了Fable5。这打破了行业过往的惯例:以往新旗舰模型发布后,企业客户通常会默认迁移到最新最强的版本。

如果仅将这场变革归结为“开源更便宜”,显然低估了其背后的行业底层逻辑变化。过往闭源模型的商业逻辑建立在一个稳定假设之上:率先推出行业领先的SOTA模型,就能凭借能力优势获得最多用户、Token和定价权,再将“智能溢价”投入下一代前沿模型的研发。但如今这套逻辑的前提正在松动:模型能力的领先优势依然存在,但能够将这种优势变现的时间窗口正在快速缩短。行业研究机构将大模型的发展划分为三个阶段:早期扩容阶段、推理能力阶段和智能体阶段,他们发现了一个清晰的规律:每当闭源实验室率先推出新一代技术范式,开源模型追上该水平的时间大约会缩短一半。比如在早期扩容阶段,Llama 2与GPT-3.5的综合能力差距一度达到35.8分;到推理能力阶段,o1模型与开源模型的初始差距缩小到12.1分,DeepSeek R1仅用8.5个月就完成了追赶;进入智能体阶段,Kimi K2.6用4.8个月就追平了Opus 4.5,GLM-5.2也在6个月内追平了GPT-5.2。这意味着,闭源厂商依然可以率先抵达技术前沿,但独占前沿技术的窗口已经从一年甚至更长压缩到了短短数月。企业客户也开始重新计算投入产出比:为了仅领先5%的模型能力,是否值得支付数倍乃至十倍的成本?更值得关注的是,智能体应用的兴起进一步放大了这种成本差异。一次完整的智能体工作流程可能包含数十甚至上百轮模型调用,原本几分钱的API差价,在亿级Token的规模化调用面前,会直接影响产品的整体成本结构和毛利率。

过去半年,开源模型完成了一次比跑分登顶更重要的跨越:从“可用”升级到“值得大规模商用”。这也是为什么62%的市场占比具有标志性意义——行业首次出现最强能力、最大Token量和最高收入不再绑定在同一个模型身上的情况。开源模型不再需要全面成为行业第一,只要与前沿模型的差距缩小到“足够好用”的水平,巨大的成本优势就足以吸引海量的Token迁移过来。这也彻底推翻了过往统治大模型行业的商业模式:不再是只要持续打造最强智能就能收取最高的智能溢价。

以上内容不代表本平台立场,仅供读者参考