文章摘要
国内首份企业级通用Agent技术IDC评测发布,评测采用近百道真实办公场景任务开展测评,中国电信自研的TeleAgent凭借优异表现跻身国内前三,该产品2026年7月正式上线,上线月余用户规模已近120万,依托电信资源与互联网化研发思路适配企业落地需求。

据行业观察最新披露,国内首份企业级通用Agent技术评估报告出炉,中国电信自研的TeleAgent凭借亮眼表现跻身国内前三。

不同于传统大模型评测通过数学、代码等单项打分的方式,本次IDC评测采用了近百道非公开的真实办公场景任务,核心考察Agent能否端到端完成实际工作。评测覆盖了日常办公场景如邮件处理、日程协调、文档整理,也包含高复杂度任务如长上下文处理、多步骤循环操作、复杂PPT生成、表格数据清洗、浏览器自动化操作等,部分任务难度贴近真实业务,比如要求Agent处理3755行脏数据,或是从3万字的材料中提炼核心内容并生成11页PPT。完成所有任务后,评测团队还会核验系统运行状态和最终产出文件,确认Agent是否真正达成目标。

本次评测中,TeleAgent的常规任务得分3.49分,复杂任务得分3.36分;在九项能力维度中,任务表现拿到满分5分,成本效率更是成为本次测评的最高分。值得一提的是,这款产品正式上线时间并不算长:2026年4月TeleAgent桌面端才进入内部试用阶段,同年7月V1.0版本正式对外发布,短短一个多月的时间,用户规模就已经接近120万。

从测试结果来看,多数通用Agent已经能够完成基础的复杂任务,但随着任务复杂度提升、上下文长度增加、工具调用次数增多,不同产品在交付质量和资源消耗上的差距会被迅速放大。IDC在报告中指出,当前通用Agent的表现差异,已经很难单纯用底层模型能力来解释,模型外围的整套工程执行系统,也就是报告中提到的Agent Harness,才是决定产品最终体验的关键。

首先是上下文管理能力。Agent在长时间运行过程中,会不断积累打开的文件、工具返回结果、历史对话内容,很容易出现Token膨胀的问题,但过度压缩又可能导致Agent遗忘初始任务目标。TeleAgent采用了分级处理机制:先对价值较低的旧工具输出进行轻量剪枝,如果上下文仍然过长,则通过专门的压缩模型对整段内容进行优化;同时系统会实时监测上下文窗口余量,一旦接近上限就自动触发压缩,再继续执行后续任务,目前TeleAgent的上下文窗口已经突破400K。此外,针对企业办公跨天、跨项目的特点,TeleAgent还搭载了autoDream长期记忆系统,会定期整理近期对话内容,将新信息与已有记忆合并,让项目背景、用户习惯和个人偏好能够跨会话保留,用户再次打开产品时无需重复解释任务背景。

在底层架构上,中国电信没有直接复用现成的Coding Agent框架适配办公场景,而是基于约3万行自研Go代码打造了TeleAgent的核心内核,团队还专门针对Windows PowerShell、麒麟、统信等多系统做了兼容性优化,同时针对办公场景的特点做了专属适配——毕竟制作PPT、撰写报告、处理Excel表格和代码仓库调试,属于完全不同的工作模式。

企业级Agent的使用成本是企业落地时无法回避的问题,TeleAgent搭建了ModelRouter智能路由系统,每次请求接入后,系统会根据任务模态、长度、关键词等信息判断复杂度,将任务分配到轻量、均衡、旗舰三档模型中:翻译、总结、格式化等简单任务优先使用轻量模型;PPT生成、文档处理、基础办公自动化任务使用均衡模型;深度研究、代码调试、复杂方案制定等任务才会调用旗舰模型。这套智能路由系统可以将推理成本降低约40%,简单任务的响应时间控制在3-5秒,路由延迟低于10ms。此外,TeleAgent还在推理侧加入了PD分离、KV Cache和负载感知调度等优化措施,进一步提升了运行效率,这也是它能在本次评测中拿下成本效率最高分的核心原因。

企业级Agent不仅要完成任务,还要保障操作安全——当Agent能够直接操作文件、调用系统、修改数据甚至执行业务流程时,一次错误操作带来的影响远大于生成文本出错。TeleAgent从研发初期就高度重视安全防护:所有接入系统的Skill都需要经过来源、病毒、漏洞校验;短期记忆和长期记忆分别隔离管理;文件读写操作被限制在指定工作目录内;高危命令会被实时监控,代码和文件操作尽可能在隔离环境中完成。

正因如此,TeleAgent的上线节奏相对保守:2026年4月完成内部试用后,团队又花费了两个月时间做安全测试和能力优化,直到7月才正式对外发布。目前,TeleAgent是首批通过中国信通院相关安全评测的智能体产品之一,在中国电信研究院内部安全评测中通过率达到98.2%,与外部安全厂商联合开展的28个场景、336个测试用例中,整体通过率达到99.7%。

很多人可能会认为TeleAgent是赶在Agent热潮中快速推出的产品,但拉长时间线来看,中国电信对智能体技术的布局已经持续了一年多。2024年底,中国电信就启动了星辰智能体平台的建设;2025年4月,该平台被确定为集团智能体基础设施;同年8月,团队推出星辰超级智能体网页版,开始探索自主式Agent;之后随着Coding Agent从代码开发场景向通用办公场景延伸,团队逐步接入了Coding增强模块、Skill体系和桌面运行环境。直到2026年4月TeleAgent桌面端进入内部试用,背后已经积累了丰富的平台、技术和产品经验。

尽管TeleAgent诞生于央企体系,但它的产品研发思路带有鲜明的互联网色彩。中国电信旗下人工智能公司现有1200多名员工,其中九成以上来自社会化招聘,团队吸纳了大量来自头部互联网公司和AI企业的研发人才,整体平均年龄仅30岁出头。在产品团队中,核心骨干拥有较大的自主招聘和技术探索空间,在产品方向尚未完全明确时,团队可以通过快速试错打磨用户体验;公司对早期产品的考核也没有急于追求收入,而是优先关注用户口碑。

同时,团队的组织方式也做了优化:过去央企跨部门开发产品往往会陷入多主体协同的漫长流程,而TeleAgent项目将资源决策尽量集中,让熟悉电信业务的人员和具备互联网产品经验的人员直接在一线配合,大幅提升了协同效率。

中国电信的体量也为TeleAgent提供了互联网创业公司难以企及的试验环境。产品上线初期,TeleAgent首先在集团内部大规模推广使用,中国电信拥有海量员工,内部覆盖了办公、网络、政企、云服务、号卡、宽带等众多业务场景,这意味着Agent每天都会接触到真实的业务需求,而非预先设计的演示任务。

目前中国电信内部的Skill广场已经累计上架5.6万个技能,被添加近200万次,参与开发和贡献Skill的员工达到2万人。这些技能大多来自一线员工:有人围绕宽带、号卡等主营业务开发专属技能,有人用Agent生成符合内部规范的PPT,还有一线员工将Agent用于摄像头巡检和电表识别。原本这些小工具需要走正式的立项和开发流程,现在业务人员可以自主完成需求落地。

这些真实的使用场景反过来又为产品团队提供了持续的优化反馈,中国电信内部既是TeleAgent早期最大的用户池,也是一个复杂的企业Agent测试场——只有在内部解决了普通员工使用、专业业务适配、系统权限管控、真实数据处理等一系列问题,产品才能顺利面向外部企业实现规模化落地。

当前企业级Agent市场正处于快速发展阶段,IDC今年4月的调研数据显示,已有48.5%的企业进入通用Agent的评估、试点或使用阶段;其中96.9%的企业Agent应用集中在办公自动化领域,流程自动化、知识管理和数据分析等场景也占据了较高的市场份额。

中国电信在企业Agent赛道的独特优势在于,它既拥有传统运营商的云资源、算力支撑、安全能力和政企客户资源,又吸收了互联网公司的快速迭代、用户反馈驱动和成本优化思路,这两套能力恰好匹配了当前企业Agent落地需要解决的核心问题。

中国电信的TeleAgent跻身IDC企业级Agent评测前三,再次印证了这家老牌运营商的转型成果——它已经不再是传统印象中的基础通信服务商,而是一家全面拥抱AI技术的数字化企业。

以上内容不代表本平台立场,仅供读者参考