文章摘要
本文是对头部开源AI平台Ollama CEO的深度访谈,其提出,随着token成本持续走低,AI行业竞争逻辑发生根本转变,未来闭源前沿模型与开源模型将形成分工协作格局,开源将承担绝大多数企业日常token消耗;当token逐步走向充裕,行业真正稀缺的资源将变为模型编排、场景适配的判断力,AI基础设施重构正开启。

当AI模型的token成本持续走低,整个行业的竞争逻辑正在发生根本性转变。近期针对开源AI生态的深度访谈中,头部平台Ollama的CEO分享的行业数据与判断,为我们拆解当前AI基础设施的重构路径提供了清晰视角。

从降本到控权:企业AI转型的核心逻辑

Ollama的CEO指出,成本是企业转向开源模型的直接驱动力,但真正的核心目标是获得控制权——将模型定制为适配自身业务的专属工具。成本只是短期问题,解决成本压力后,企业才能聚焦于真正的业务价值落地。

多数企业的AI落地路径呈现出清晰的阶段性特征:第一阶段先对接闭源API实现基础功能,暂时忽略成本;第二阶段随着token消耗量攀升,成本压力显现,开始寻求降本方案;第三阶段成本得到控制后,却发现通用模型无法精准匹配自身业务场景,于是开始考虑微调模型或部署开源方案。只有走到第三阶段,企业才算真正进入AI能力建设的深水区。

从“能用”到“好用”再到“可控”的路径无法跳过,很多企业试图直接跳过前两个阶段,但技术积累与业务理解的沉淀需要时间。开源模型并非省钱捷径,而是需要企业配套自身AI基础设施能力的战略选择,真正走通这条路的企业,背后都拥有对AI技术有深刻理解的专业团队,这本身就是一道技术门槛。

Token消耗量激增的底层逻辑:编程智能体的产业突破

访谈中展示的Ollama云端token用量曲线显示,从年初到访谈录制时,整体token用量增长了150倍,更值得关注的是人均周token消耗量同样呈现指数级增长,这说明增长并非来自用户数量增加,而是每个用户的使用量快速提升。

这一趋势背后有两个关键节点:一是今年年初,多款主流开源模型的能力提升,足以驱动编程智能体的运行。编程智能体的token消耗量远高于普通对话,因为需要反复调用工具、检索代码、编写测试用例、执行命令,单个任务可能消耗数十万token。二是今年四月,开源编程智能体框架崛起,后续相关项目跟进,让长时间自动化任务的能力从开发者群体扩展到非技术人员,财务、市场、销售等岗位都能使用这套能力。上下文窗口从128K扩展到百万token级别,也是这一波爆发的重要基础,长上下文直接决定了智能体能够处理的任务复杂度与链路长度。

编程智能体本质上是一套将复杂任务分解、执行、验证的通用能力框架,当这套能力向非技术人员开放时,才标志着AI生产力革命真正落地。开源模型的能力跃升,不仅是技术里程碑,更是产业发展的关键节点。

模型微调:不是追赶潮流,而是适配模型迭代节奏

访谈中主持人提到,2024年初模型微调曾掀起热潮,之后热度回落,不少企业担心投入微调的工作会被新版模型取代,如今微调又重回视野,这究竟是新的周期还是真正站稳了脚跟?

Ollama的CEO给出了直接的判断:开源模型的迭代节奏只会越来越快。以当年夏天的DeepSeek Flash模型为例,其迭代次数已达三次,而过往类似的迭代周期通常需要六个月。节奏加快确实让自定义微调的难度提升,刚完成模型适配就迎来新版本更新,部分前期工作可能白费。但与此同时,微调的工具链也在同步优化,让想要开展微调的团队能够更快跟上模型迭代的节奏。

从底层逻辑来看,模型微调的核心价值并非让模型变得更通用更聪明,而是让模型更好地适配企业自身的业务语言、数据格式与输出规范。这种业务特异性的需求不会因为基础模型性能提升而消失,因此微调不会退出历史舞台,但其定位将发生转变:从追求通用能力提升的手段,变为专注业务适配的精细化工具。能够在快速迭代节奏中持续跟进微调的团队,反而能够建立起真正的竞争壁垒,因为这种业务适配的积累是循序渐进的,而非从零开始。

开源模型的独特优势:并非所有场景闭源模型都能覆盖

访谈中一个较少被讨论的细节极具价值:当被问及哪些场景下开源模型相比闭源模型拥有压倒性优势时,安全测试是最典型的答案。

逻辑清晰易懂:如果让闭源模型协助完成产品渗透测试,大概率会被拒绝,因为闭源模型的安全策略偏向保守,难以区分使用者是专业安全研究员还是存在其他意图。而在开源社区可以找到专门为安全研究训练的模型,在合规使用场景下能够更好地完成这类任务。这并非说开源模型没有安全边界,而是其安全策略更贴合专业使用场景,而非一刀切地限制使用。

这一现象背后指向了更宏观的行业问题:闭源模型的安全策略本质上是面向最大公约数用户设计的,为了通用场景下的安全保障,牺牲了专业用户的使用灵活性。但真实世界的需求是分层的,部分专业场景需要模型能够完成闭源模型不允许的操作。此时开源模型不仅是更经济的选择,更是不可替代的工具。

Ollama的定位:开源生态的基础衔接层

有观点将Ollama类比为传统操作系统,需要深度整合驱动、硬件与应用层,是整个开源AI生态的衔接纽带。Ollama的CEO认同这一比喻,并解释其核心工作是将三类要素打包整合:适配模型的推理框架与SDK、确保模型可用稳定且云端容量充足的模型资源、以及保证模型运行速度的硬件与推理服务资源。

这项工作看似简单,实则面临“组合爆炸”的复杂度:每一款新模型都有独特的架构变化与工具调用机制,需要确保在不同硬件、不同推理引擎上都能稳定运行,且往往只能在模型发布前24小时拿到最终版本,基本需要在应急状态下完成适配。以某多模态大模型的发布为例,Ollama不仅要支持模型本身的运行,还要同步更新适配新能力的推理框架,让开发者在发布当天就能正常使用。

这种定位的护城河远比想象中深厚,并非来自独特的技术创新,而是积累了一套处理复杂适配场景的工程经验与操作规范。开发者信任Ollama的核心原因在于:每次新模型发布,只需调用Ollama的API就能顺利获取token服务,体验稳定可靠。这种“即开即用”的体验,是通过无数次高强度的工程工作积累而来的。

开源与闭源的长期格局:合伙人与助理的分工协作

Ollama的CEO对开源与闭源模型的长期格局判断,是本次访谈最具价值的洞察之一。他预测,企业内部绝大多数的token消耗——约80%到90%——最终将流向开源模型,但这并不意味着80%到90%的AI预算会投入开源模型,因为开源模型的token成本极低,企业可能仅花费10%到20%的预算,就能完成绝大多数的任务量。

他用律师事务所的分工做比喻:合伙人负责最复杂、最关键的决策,将具体工作交给助理执行。闭源前沿模型就像合伙人,负责处理真正高难度的问题;开源模型则像助理,承担大量日常任务。二者并非竞争关系,而是协作分工。这与云计算时代的行业格局十分相似:既有专有数据库服务,也有大量开源数据库用户,最终两者共存,各占合适的市场位置,而非一方完全取代另一方。

这一分工模式将越来越精细化,未来企业的AI基础设施很可能会通过智能路由层进行调度:简单任务自动分配到本地开源模型或低成本云端开源模型,复杂任务则路由到前沿闭源模型。这个路由层将成为下一波AI基础设施创业的核心战场,因为它决定了整个企业AI体系的效率与成本结构。

本地与云端的混合部署:硬件升级推动本地算力回归

Ollama的CEO对本地与云端模型的分工有着清晰的判断:难度较低、流程相对固定的任务,比如标准化的文档处理工作流,本地模型即可高效完成,成本近乎为零;而对于编程智能体这类需要解决复杂问题、编写代码、执行测试的高难度任务,仍需要云端大模型的支持。

他提到一组重新定义本地部署边界的数据:Qwen 3 38B模型在编程基准测试中的表现已接近顶级闭源模型,且可以在中配MacBook上运行。与此同时,桌面级工作站硬件可提供128GB统一内存,能够运行20B到120B参数的模型,多台设备堆叠甚至可以运行400B级别的模型。Ollama从本地部署起家,因编程智能体的需求转向云端服务,但他预判随着硬件能力提升,需求最终会回归本地。当桌面设备具备顶级算力时,本地运行能够实现更低延迟的开发循环,就像早期代码自动补全工具的即时体验一样。

“本地-云端-再回本地”的路径值得重点关注,这说明本地部署并非退而求其次的选择,而是等待硬件性能达到临界点的自然结果。这也指向一个更宏观的趋势:AI算力不会永远集中在云端,随着边缘硬件的普及,企业对数据主权与低延迟的需求将愈发明确,这一趋势对AI基础设施格局的影响,或将不亚于当年从集中式主机到个人电脑的迁移。

轻量化模型:当token成本足够低廉,竞争逻辑彻底改变

访谈中提到一类被严重低估的模型:轻量化快速模型,以DeepSeek Flash为代表,这类模型的特点是token成本极低、推理速度极快,能够满足80%的日常任务需求。他认为这类模型的出现标志着一个关键拐点:token将变得接近无限供应。他以早期ChatGPT为例,当时用户无需顾虑token使用量,可以直接按需使用,开源模型正在朝着这个方向发展。

更值得关注的是这类模型带来的编排效应:低成本的轻量化模型不仅降低了单个任务的成本,更开启了新的架构思路——将多个轻量化模型协同配合,各自处理不同的子任务,组合起来解决原本需要大模型才能完成的复杂问题。这种编排方式不仅成本更低,且由于任务分解更细致,每一步的结果更可预测、可验证,整体可靠性反而更高。

轻量化模型的出现,实际上将AI的使用门槛从“能否承担成本”的经济问题,转变为“能否设计合理的任务分解与编排逻辑”的工程问题。前者是资金约束,后者是能力约束。这一转变为初创企业带来了真正的机会窗口:大型企业在token预算上拥有天然优势,但在编排能力上并无护城河,谁能设计出最高效的任务分解逻辑,就能以最低成本实现最优效果。

单一通用模型还是协同编排:市场需求已给出答案

早期关于通用人工智能的讨论中,曾有人预测会出现一款“神级模型”覆盖所有场景。Ollama的CEO对此给出了务实的判断:对于多数企业应用场景,当模型达到“足够好用”的水平后,用户就会停止追求更强的模型,他们需要的不是更聪明,而是更快、更便宜、更稳定。真正需要顶级模型的场景确实存在,但占比并不高。

他提到一个极具代表性的细节:某垂直领域模型在网页开发场景中成为表现最佳的方案,引发了市场震动。这说明行业竞争的维度已经从整体智力水平的比拼,转向特定垂直场景的专精能力。在某个具体领域做到极致,比在所有任务上做到平均优秀更有价值,也更容易实现差异化,这对深耕垂直场景的团队来说是明确的信号。

综合来看,“单一通用模型统一所有场景”的叙事本质上是商业宣传,而非真实的市场需求。真实需求是分层的:不同复杂度的任务需要不同级别的模型,不同业务场景需要不同专精方向的模型。编排能力才是这个时代的核心竞争力,而非单个模型的绝对性能。这也正是Ollama这类基础设施服务商的护城河不断加深的原因:随着模型数量持续增加,统一调度模型的能力价值会愈发突出。

模型选择:不仅是技术问题,更是信任与合规问题

访谈中讨论了企业选择模型时的决策逻辑,这部分内容十分务实。企业可以大致分为两类:一类不太在意模型来源,更关注模型的运行环境是否安全可控;另一类则会认真考虑模型来源,不仅关注安全问题,还包括模型的输出风格,比如对话语气、对特定话题的处理是否符合企业的沟通风格与价值观。

他举了一个真实案例:芬兰一家电厂使用开源模型监测电力系统电涌峰值,保障电网稳定运行。在这类关键任务场景中,对模型全链路的可解释性与可审计性是不可妥协的硬性要求。训练数据完全透明可查的开源模型,正是这类场景的刚需。对于安全问题,他表示财富500强企业的IT与安全团队拥有丰富的经验,开源软件的安全审计是他们长期开展的工作,从大型开源库到开源模型,处理逻辑一脉相承,通过系统级的安全检测机制,多数安全问题都可以得到有效管控。

这一问题在未来会愈发重要,并将从模糊的政策讨论转变为具体的采购决策标准。值得关注的信号是:Ollama的数据显示,云端大规模token消耗中,来自中国的开源模型占据主导地位,这背后是能力驱动的选择,而非政治因素。开发者选择模型的核心标准,始终是在目标任务中的表现、速度与成本,能力才是市场选择的最终依据。

Ollama的创业历程:两年探索,两周破局

Ollama的CEO分享了团队的创业历程,其价值不亚于对行业的判断。他与联合创始人此前曾在Docker工作,之后创立公司并参与了某创业孵化项目,但最初的业务方向与后来的Ollama完全不同,当时团队聚焦于Kubernetes的安全工具。在之后的近两年时间里,团队在多个方向上摸索,始终没有找到让用户真正兴奋的产品,一度陷入迷茫。他坦言,那段时间最可怕的不是没有增长,而是不确定自己是否真的在解决真实存在的问题。

真正的转折点充满戏剧性:团队在内部会议上决定抛弃过往所有尝试,重新思考如果从零开始会做什么。最终浮现出两个方向:一是做所有大语言模型的统一接入网关,二是发挥团队在系统工程方面的经验,帮助开源模型真正实现稳定运行。团队选择了第二个方向,并设定两周的时间验证可行性。就在两周期限即将结束时,新版开源模型发布,团队立刻推出第一版Ollama,用户量在短短几天内就超过了过往所有产品的总和。

他坦言,如果当时能在早期孵化阶段就开展这项工作会更好,但受限于当时的行业环境并不具备条件。这其中蕴含着重要的创业逻辑:时机本身不可控,但当机会出现时,能否以轻量化的执行力快速抓住,才是关键。团队仅用两周就推出第一版产品的高效执行能力,正是那个关键节点上的核心竞争力。

从Reddit上的小众爱好者工具,到被85%的财富500强企业使用,Ollama的崛起只用了不到两年时间。团队解释了快速增长的原因:开源模型无需申请权限即可开始使用,对企业内部的IT开发者来说是低摩擦的入口。早期爱好者与企业开发者选择Ollama的核心原因高度重合:可以直接开始使用,无需复杂的审批流程。而大语言模型本身无状态的特性,也让从个人用户到企业用户的迁移比数据库工具更加顺畅。

行业整体判断

完整梳理本次访谈的内容,可以得出一个清晰的结论:开源模型的崛起,本质上是AI使用权的重新分配。过去,使用顶级AI服务存在诸多门槛:需要承担高昂的token成本、接受闭源模型的安全限制、依赖少数大厂的发布节奏。如今,开源模型正在将这些权力下放:企业可以自主部署、定制模型、掌控数据,同时大幅降低使用成本。

Ollama的CEO提出的“开源模型的token正在走向丰盛”这一判断,被严重低估。当token成本足够低廉时,AI使用的决策逻辑将从“我能否负担得起”转变为“我该如何更好地使用”,这是质的转变。前者受资源约束,后者受能力约束。在新的行业范式中,真正稀缺的不再是token,而是能够合理设计任务、编排模型、在正确场景选择正确模型的判断力。

这种判断力无法直接通过资金购买。随着开源模型性能持续提升、轻量化模型让token成本趋近于零、本地算力逐步回归,这场AI基础设施的重构才刚刚拉开序幕。未来真正的竞争,将发生在token服务之上的能力层。

以上内容不代表本平台立场,仅供读者参考