词元无限:构建企业AI研发全链路的Agent基础设施

成立仅一年的词元无限,近期完成了新一轮数亿元融资,本轮由临芯投资领投,老股东华控基金追加投资,至此这家专注企业软件工程的AI Agent基础设施公司,已经完成三轮融资。
公司创始人杨萍,曾主导过数万人级研发体系的AI化改造,参与打造过多款企业级研发工具,2025年离职创办词元无限。她创业的核心判断正是:AI代码生成的最大机遇并非面向个人的C端工具,而是To B领域的软件工程现场。
一年过去,这个判断正在成为行业共识。过去一年,AI生成代码的能力已经得到充分验证,部分开发者的编码效率能达到传统方式的10倍以上。但一个现实矛盾愈发凸显:企业真正关注的整体交付效率,并没有同步实现10倍的提升。有大厂研发负责人公开分享过一组数据:即便个体提效能做到10倍,激进使用AI工具的部门,整体研发提效也仅约60%。
中间流失的效率究竟去了哪里?答案藏在软件工程的全链路中。软件研发绝非仅靠写代码就能完成,从需求理解、架构设计、代码评审、测试验证到上线发布、长期维护,任何一个环节出现卡顿,都会抵消前期的代码生成效率。
企业级场景的特殊性进一步放大了这个问题:动辄几十万、上百万行的存量代码库、盘根错节的调用依赖,加上严格的测试评审与安全要求,比如银行场景中90%以上的开发工作都是存量系统迭代而非从零搭建新应用。这也解释了为何通用Agent平台进入严肃业务场景后,往往难以发挥作用。
对企业来说,AI生成了多少行代码并非核心关注点,真正的问题在于:需求能否更快上线?系统稳定性与交付质量能否得到保障?这笔AI投入的ROI是否划算?
企业付费逻辑:以结果为核心
AI Coding早期的吸引力在于实现了代码编写的自动化,从Copilot、Cursor到Claude Code等多款工具,都证明了大模型可以显著提升个人开发者的编码效率。但软件研发是完整的流程,单个工具的提效无法覆盖全链路的需求。
个人用户可能会为兴趣和效率买单,但企业客户永远主要为结果买单。我们的技术要为结果服务,产品要为结果服务,最终落到客户现场的能力,也要为结果服务。
杨萍用日常就餐打比方:走进餐馆,顾客不会关心一碗面的制作过程,只要最终端上来的食物符合预期、口感合格即可。软件研发也是同理,企业不会为代码本身付费,而是为软件解决的问题、稳定运行的服务买单。
基于这个逻辑,词元无限调整了商业模式,不再单纯售卖使用席位、API调用次数或Token消耗,而是转向“结果即服务(Result-as-a-Service)”。传统的计量方式无法回答“AI到底为企业交付了什么”这一核心问题,而新的模式直接锚定最终交付结果。
词元无限给客户的提效目标也十分务实:不追求“人人10倍”的个体效率,而是通过统一的Agent Infra与Harness框架,实现团队整体提效2倍,并逐步向3倍、4倍推进。对百人乃至上千人的研发组织来说,这是极具吸引力的真实价值。
这也将AI Coding的竞争焦点向前推进了一步:第一阶段比拼的是谁写代码更快,进入企业级场景后,比拼的是谁的交付更稳定可靠。在银行、保险、政企、大型软件服务商等严肃场景中,企业并非不敢尝试AI,而是无法接受不可控、不可审计、不可解释的Agent直接接入生产系统。
为此,词元无限为企业级AI Agent基础设施定下了三个核心关键词:全自主、高安全、自进化。
全自主意味着企业可以完全掌控自身的AI基础设施:词元无限从设计之初就保持模型中立,不绑定任何单一模型,支持全套私有化部署,代码、数据与业务流程全部运行在企业自有环境中,让企业拥有完整的数据主权与产品主权。
高安全则体现在对Agent运行边界的系统性管控:Agent接入研发生产系统时,必须明确权限、数据与能力调用的边界。词元无限的安全体系覆盖权限管控、数据隔离到操作审计的完整链路,确保过程可追踪、风险可阻断。
自进化指向AI能力的持续生长:词元无限的平台并非一次性交付的工具,每一次落地反馈与业务上下文理解都会回流到产品中,在真实任务与代码评审中持续沉淀企业专属的工程知识,让Agent越用越熟悉客户的系统、流程与标准。
这一理念与2026世界人工智能大会释放的行业风向高度契合:AI要更快落地千行百业,必须将安全、可靠、可控放在更重要的位置。
七层产品构建的金字塔体系
词元无限的产品体系呈现清晰的金字塔结构,共计七款核心产品,覆盖企业研发全流程。
第一层:直接落地的业务Agent
该层从AI编码与测试两个高频刚需场景切入,两款核心产品分别对应不同的业务角色。
InfCode是面向企业级复杂代码开发的“数字程序员”,可覆盖存量代码理解、任务拆解、代码生成、代码评审与测试生成全流程,将业务需求转化为可执行的代码变更。
InfTest则是“数字测试工程师”,负责质量验证与质量门禁,覆盖单元测试、接口测试、回归测试等多层场景,可自动生成测试用例、执行测试、分析缺陷,并与开发Agent实现联动。
InfCode与InfTest之间还设计了“生成—测试—对抗”的闭环机制:当模型能力不足以一次性解决复杂问题时,通过代码生成与测试的互相迭代,将“抽卡式”的不确定过程转化为可靠交付,正如CTO王伟所说,让复杂任务的交付变得可预期。
选择编码与测试作为切入点,正是因为这两个场景高频、刚需且结果易于验证,恰好契合“以结果为核心”的商业逻辑。
第二层:工程理解与能力沉淀
该层相当于企业的“数字架构师团队”,包含三款核心产品,负责梳理企业系统与沉淀工程经验。
DeepMap的核心能力是读懂企业的复杂存量系统:通读全部代码仓与文档,围绕代码库构建结构化知识图谱,梳理系统架构、调用链路与工程语义,相当于为企业的整个信息系统绘制一张精准地图。在企业场景中存量系统占绝对主导的背景下,DeepMap的需求格外旺盛。
HarnessAgent则像常驻现场的技术架构师,可将企业流程、工程规范、专家经验与真实任务反馈,沉淀为对其他Agent的约束规则。约80%的Harness规则可由Agent自动生成,经人工确认后即可成为团队统一规范。
CodeReview承担代码质量与风险校验职责,基于工程上下文与企业规范,评审每一次代码变更,识别潜在风险。
这三款产品形成完整闭环:先理解系统现状,再沉淀专属规则,最后用规则约束并优化每一次代码变更。对企业软件研发来说,关键上下文不仅存在于代码中,还包括历史文档、流程规范、评审习惯与资深工程师的判断,词元无限希望将这些经验沉淀为企业专属的Harness,让Agent越用越懂这家企业。
这背后离不开多项自研的技术细节:比如针对不同编程语言构建抽象语法树(AST)实现检索增强,在大规模企业级代码库上的效果优于通用框架的文本相似度检索;同时采用项目级、用户级、团队级的分级记忆设计,且对企业强调透明可控、可审查、可编辑。这些细节正是通用Agent难以覆盖的领域。
第三层:模型与Token治理
TokenHub负责模型路由、Token调度与成本优化:将复杂任务分配给能力更强的模型,简单任务路由至更轻量的模型;同时处理上下文治理与缓存复用,减少重复推理与无效消耗。在代码生成任务中,TokenHub的智能路由能力可将Token成本降低25%以上,同时为客户提供透明账单,清晰展示每个Token的消耗位置与价值,实现可解释、可度量。
塔尖:InfOne数字负责人
InfOne是企业级研发体系的“数字负责人”。在词元无限的设想中,未来企业内部将同时运行需求、设计、开发、测试、运维等多类Agent,而InfOne的核心职责是将这些能力映射为可治理、可度量的Agent角色,定义职责、目标与成本,调度各Agent协同工作,并衡量最终的投入产出比。这套能力的最终目标是:让少数人带着一组Agent,完成过去一个团队才能达成的工作。
整体来看,词元无限交付的并非单个“会写代码的工具”,而是一支可治理的数字员工团队,覆盖从基础编码到全局调度的全流程研发能力。
如何应对模型迭代的挑战?
所有Agent相关的创业公司都无法回避一个灵魂拷问:模型迭代速度极快,几个月就会有新的突破,公司研发的产品会不会被下一代模型直接替代?
CTO王伟的回答基于第一性原理,采用严谨的技术分析:并非通过试错应对模型迭代,而是从Transformer架构的技术原理出发进行白盒分析。
我们不用“走一步看一步”的方式应对模型迭代,而是从Transformer架构的技术原理出发,做白盒分析。
通过分析,AI能力被分为两类:一类是短期可能被模型突破、吸收的能力,比如部分Harness规则知识,会被模型学习内化;另一类是短期内难以突破的基础范式级难题,比如真正的无限上下文、自主学习机制。
王伟将这套判断总结为“水涨船高”论:
作为Agent和Agent Infra公司,必须想清楚:哪些能力会随着模型能力上涨而水涨船高,哪些会被模型吃掉。只有想清楚这件事,才有可能不被算法的巨浪吞没。
基于这一框架,多模型协同是模型厂商难以复制的核心优势。通过将不同能力、不同成本的模型按任务组合,让严谨的模型负责严格执行、发散的模型负责创造性任务、成本敏感的任务交给轻量模型,如同用不同水平的员工搭建高效团队,创造超越单一基础模型的价值。而模型厂商本身很难做好这件事,没有厂商会在自家模型之上认真调度竞品模型。
兼具模型与工程经验的团队
聊完产品与技术,再看词元无限的核心团队。外界最容易注意到的企业与名校标签,但团队的结缘并非来自大厂或名校,而是源于一场技术竞赛。
2024年上半年的SWE-Bench早期榜单竞赛中,杨萍与王伟带领的团队分别位列全球第二与第三,因工程理念契合结缘,2025年两人决定共同创业。
CEO杨萍曾主导数万人级研发体系的AI化改造,参与搭建头部科技企业的软件开发体系、工具链、质量体系与AI效能体系。CTO王伟毕业于清华计算机系,是姚班第一批学生,职业生涯先后就职于外企世界五百强、国内分布式系统架构师团队、具身机器人独角兽公司,负责AI Infra与机器人算法工作。首席科学家袁源是北京航空航天大学教授、博导,师从中国科学院院士张钹,同时是北航复杂关键软件环境全国重点实验室的核心成员。
这些背景背后,是词元无限的两大核心优势:一是模型原生能力,可深入解决Agent、上下文、模型路由、多模型协同与推理成本等技术问题;二是深厚的软件工程经验,清楚企业软件绝非演示Demo,需要长期维护、跨团队协作、严格的测试评审,且必须对最终结果负责。一端对接企业软件工程现场,一端掌握模型原生能力,词元无限的业务恰好落在两个赛道的交汇点。
深耕硬核赛道,拒绝短期红利
采访中杨萍曾提到:“要做硬核的事情,而非摘低垂的果实。”如果仅开发一款更易用的Coding插件,产品边界清晰,增长路径也更偏向工具类产品。但选择进入企业研发现场,就必须直面更复杂的问题:客户流程各不相同、历史系统迁移难度大、测试评审要求严格、安全边界必须严格守住。
王伟还提到国内SaaS领域长期存在的“阿喀琉斯之踵”:单点工具容易开发,但商业天花板有限;整套平台的价值更高,却容易陷入客户适配的困境,最终演变为无穷无尽的定制化开发。企业级AI Agent基础设施同样面临这一挑战,而词元无限的解法是“AI Native FDE”模式。
FDE即前置部署工程师,会进入客户现场,先找到最具价值且易于验证结果的场景,再将InfCode、InfTest、HarnessAgent、TokenHub等产品能力组合,跑通交付闭环。但这套模式与传统定制开发有本质区别:词元无限的FDE是带着Agent一起工作的,现场沉淀的流程、规则、测试反馈与专家经验会进入Harness,反哺产品体系;在打透行业标杆后,再培训合作伙伴的FDE团队实现规模化复制,而非无限扩张自身的交付人力。
这形成了一套“企业Harness飞轮”:每一个客户项目结束后,留下的不仅是单次交付结果,还有可复用的上下文、路由规则、评测集、行业模板与工程经验。当然,飞轮有明确的红线:合规场景下客户数据绝不对外流出,可跨客户复用的仅为抽象、脱敏后的工程经验,具体业务流程严格禁止跨客户迁移。
任务完成越多,系统越熟悉该企业的需求;行业覆盖越深,平台越能抽象出可复制的方法,这正是“自进化”理念的真正落地方式。
资本的判断也集中在这两个方向。华控基金认为,2026年将成为AI从对话工具转向生产力引擎的关键拐点,AI要将Token消耗转化为严肃场景中的真实生产力,对创业公司的AI原生能力与企业级全流程软件工程能力都提出了更高要求。在他们看来,词元无限在过去半年快速升级战略、迭代产品,并获得神州信息、飞书等产业生态伙伴的认可,已经成长为国内企业级AI基础设施领域的重要玩家。
临芯投资则更关注产业落地:AI下半场的核心在于产业落地,而编程智能体是衡量企业研发生产力的重要标准。除了团队的AI经验与技术背景,他们同样看重InfCode等产品在技术评测、私有化部署、数据合规以及金融、制造等场景中的落地潜力。
因此,词元无限从创立之初就没有将自己定位为AI Coding工具公司,编码与测试仅仅是入口——它们足够高频、刚需且易于验证结果。一旦这条路径跑通,后续的延伸空间将十分广阔:研发、测试、运维、安全乃至更多业务流程,都会被Agent重新组织,最终指向一条Agentic软件智能生产线。
到那时,企业需要的不再只是单个会写代码的Agent,而是一套能管理Agent、调度Token、沉淀经验、衡量结果的智能基础设施。这也是“词元经济”被行业讨论的原因:在企业场景中,Token不能仅停留在账单上,而要转化为真实的任务推进——代码被修改完成、测试顺利执行、缺陷得到修复,最终通过客户验收。
当AI真正接入生产系统,如何让Token消耗转化为可验收的结果、让Agent从工具升级为数字员工、让单次执行沉淀为企业专属的智能资产,将成为新的基础设施命题。
写代码变简单之后,软件工程领域真正硬核的挑战才刚刚开始。而词元无限押注的,正是这一全新的赛道起点。

