文章摘要
中国电信针对数据需不出域、算力有限的企业AI落地需求,开源了全栈国产化轻量代码智能体大模型Xing4.0-29B-A4B。该模型采用MoE架构,经4-bit量化后单张消费级显卡即可本地部署,数据全程不出域,全链路适配国产昇腾生态,已在多平台开源上线,填补了星辰系列轻量化私有部署场景的空白。

当科技大厂们集体加码AI办公赛道,争相布局智能体能力、工作入口与企业工作流时,一批有特殊落地约束的企业却陷入了“想用却用不了”的困境。他们的核心业务数据不能对外泄露,因此模型需要就地部署,但可用算力资源有限,却依然需要处理长文档、完成复杂业务流程,日常工作半点不能落下。

针对这类精准需求,中国电信近期开源了Xing4.0-29B-A4B,这是一款全栈国产化的轻量级代码智能体大模型,从国产芯片、训练框架到模型训练、推理部署,整条技术链路都完成了系统适配。

为了实现低门槛本地部署,这款模型采用MoE架构,总参数规模达290亿,但每次推理仅激活约40亿参数。经过4-bit量化后,单张RTX 3090即可流畅运行,大幅降低了企业的硬件部署成本。

能在消费级显卡上运行只是基础,企业真正在意的是这款模型能否承接真实的业务需求。在本地文档处理场景中,这款模型可以直接完成内容理解、指标提取与信息整理,全程无需将数据移出企业内网。举个例子,一份200页的投标文件提交后,它可以在本地用约20分钟完成技术、商务、价格三个维度的初评,并逐条给出评分依据。

这款模型的本地化部署适配不止局限于消费级显卡。Xing4.0-29B-A4B完全基于华为昇腾910C算力训练,采用国产的MindSpore/MindFormers训练框架与开发套件,真正实现了“国芯训国模”,同时在推理部署端也完成了昇腾生态的适配验证,从训练到落地的国产算力路径已经完全打通。

目前,该模型已在GitHub、Hugging Face、Gitee、魔搭、魔乐等平台开源上线,同时支持API调用。截至目前,它已经进入HuggingFace模型趋势榜单第四名,受到了广泛关注。

不过,将模型部署到本地显卡,和让它稳定承接企业日常工作之间仍有差距。企业的业务任务往往不是简单的问答,而是需要先读取文档、提取信息、调用工具、核对结果,最终整理成可交付的材料,且这类任务需要长期稳定运行,还要兼顾性价比。

因此,Xing4.0-29B-A4B重点强化了代码开发与智能体能力,让模型可以真正承接工程级任务。在代码开发方面,过往百亿参数模型往往只能完成简单的函数编写或代码补全,一旦面对整个代码仓库的工程问题,就难以应对——它需要先理解项目结构、跨文件追踪接口调用、结合文档与日志定位问题,最后验证修改是否影响整体功能。针对这一痛点,这款模型将代码能力从“写片段”升级到了“干工程”。

它原生支持256K上下文,并可扩展至512K,能够一次性加载更长的代码、文档、日志与历史记录,为理解整个项目提供足够的上下文空间。比如,当企业需要将分散在Excel中的合同台账转化为可视化管控大屏时,模型不仅需要生成绘图代码,还要理解表格中的业务数据,将合同概览、金额分布、风险识别与履约预警等需求整合到同一个页面中,全程在本地完成数据处理与开发工作。

在智能体场景中,模型的要求更高:需要自主拆解任务、规划执行顺序、调用工具,并根据中间结果调整下一步动作,直到交付可验收的成果。Xing4.0-29B-A4B针对长程任务做了专项优化,当用户明确提出需求后,它可以判断任务的先后执行顺序,并行处理部分环节,并调用天气、日程、提醒、出行等不同工具或智能体,推进任务完成。

除了自身能力的强化,模型还需要无缝接入企业现有工作流。为此,Xing4.0-29B-A4B已经完成了对OpenCode、Claude Code、OpenClaw、Hermes等主流智能体与Harness框架的定向适配,同时兼容LLaMA-Factory、MindFormers、SGLang、vLLM、KTransformers等常用工具链,大幅降低了企业接入现有开发环境的门槛。

对于算力有限且数据不能出域的企业来说,轻量化部署是核心需求。传统FP16精度下,29B参数模型单卡显存占用约60GB,往往需要多卡或高端专业显卡才能运行。经过4-bit量化后,显存占用可压缩至约15GB,降幅达75%,让RTX 3090、4090等消费级显卡也能顺利运行。

目前,这套轻量化私有部署方案已经进入真实生产场景。在智能客服业务中,Xing4.0-29B-A4B已经完成私有化部署,用户通话、身份信息与业务记录全程不出域。面对复杂诉求时,模型可以完成意图理解、任务拆解、工具调用、结果整合与合规校验,当前复杂业务办理成功率已超过90%。

那么,这款模型是如何兼顾轻量化与高性能的?除了前文提到的MoE架构,背后还有架构优化、数据体系、训练流程与工程优化的多重配合。

在架构层面,长上下文推理面临着KV缓存占用显存过高、推理速度变慢的问题。Xing4.0-29B-A4B采用MLA多头潜变量注意力技术,将需要缓存的信息压缩为更紧凑的形式,降低长上下文推理的显存开销。同时,它还引入了MTP多Token预测技术,相比传统单Token预测,模型可以同时学习预测后续多个Token,掌握更长的上下文关联,在推理时还可以通过提前生成候选内容并交由主模型校验,进一步加速生成速度。此外,模型还采用了DeepSeek同款的mHC流形约束超连接,约束信息在不同层之间的传递,减少训练过程中的信号不稳定问题。

在数据体系方面,中国电信自建了包含数十万亿词元的训练数据集,经过PB级多源清洗后,不仅包含通用内容,还加入了复杂表格、结构化知识图谱与智能体行为轨迹。其中,智能体行为轨迹数据直接关联模型的Agent能力,记录了任务从目标设定、工具调用、结果反馈到后续调整的完整流程,让模型可以学习如何连贯地完成多步骤任务。

在后训练阶段,团队搭建了支持代码运行、在线搜索与工具调用的高并发沙箱,在其中构建长程智能体任务,通过测试用例与自动化机制校验代码运行、工具调用与结果合规性,让训练数据的质量有了实际执行结果作为依据。

训练流程上,Xing4.0-29B-A4B采用了循序渐进的难度升级策略:预训练阶段从4K序列长度起步,先学习通用知识与基础推理,再逐步提升代码与复杂推理数据的占比;中训练阶段将序列长度依次扩展到32K、128K与256K,同时增加仓库级代码、复杂推理与智能体相关数据;在后训练阶段,团队围绕Coding、Agent与Reasoning三个方向开展多专家强化学习,再通过MOPD技术融合各方向的专项能力。训练过程中还使用了Muon优化参数更新与QK-Clip控制注意力计算数值规模,降低数值异常风险。

在工程优化层面,团队针对国产算力做了深度适配。基于昇腾910C集群与MindSpore/MindFormers框架,完成了mHC等新特性的适配、跨框架精度对齐与融合算子开发,让模型架构、训练框架与国产芯片实现协同优化。针对计算调度与显存压力,团队通过DVM图算融合、细粒度重计算与Ascend C定制融合算子,减少调度与数据搬运开销,节省显存并提升执行效率。官方数据显示,经过多层次协同优化后,整网训练吞吐较开箱性能提升约96%,接近翻倍。后训练使用的Slime强化学习框架也完成了昇腾生态适配,从训练框架到底层算子再到强化学习流程,都做了针对性优化。

为了让企业能够丝滑地使用这款模型,中国电信还提供了一站式部署方案。希望快速上线的企业,可以选择将Xing4.0-29B-A4B预集成到算网一体机中,减少环境搭建与配置工作,缩短部署周期。当本地算力紧张时,企业还可以在满足数据管理要求的前提下,通过智算专线调用云端算力实现弹性扩容。对于采用国产算力的企业,模型还基于智源FlagOS统一开源AI软件栈,打通了多家国产芯片的适配路径,降低跨硬件平台迁移与部署的成本。从消费级显卡到算网一体机,再到云端弹性算力,不同规模、不同技术储备的企业都能找到适配的部署路径。

很多人会好奇,中国电信为何要专门推出这样一款轻量级模型?将其放入中国电信的星辰系列模型布局中就能找到答案。此前,中国电信已经布局了十亿、百亿、千亿参数模型,同时开展了万亿参数模型以及语音、语义、多模态等方向的研发。Xing4.0-29B-A4B填补了星辰系列在轻量化私有部署场景的空白,专门针对本地算力有限但需要处理复杂业务的企业需求。

中国电信长期接触政务、客服、网络运维等大量私有化部署场景,深知企业在使用AI模型时需要兼顾数据安全、算力成本与业务复杂度。这款轻量模型的设计正是从企业现场的实际需求出发,确定模型规模、强化核心能力,并配套相应的交付方案,这也契合中国电信正在推进的云改数转智惠战略,以及算力、平台、数据、模型、应用五位一体的智能云体系。模型负责理解与执行任务,平台负责接入与编排,算力与网络支撑运行,行业应用则将能力接入具体业务,Xing4.0-29B-A4B正是这套体系中面向轻量化私有部署的重要一环。

当前AI办公的赛道竞争依然激烈,但对于那些受限于数据安全与算力条件的企业来说,终于有了一款可以直接上手的解决方案。从消费级显卡就能运行的轻量化部署,到全栈国产化的技术链路,再到适配企业现有工作流的能力,Xing4.0-29B-A4B为这类企业打开了AI办公的大门。后续星辰系列的更新也值得期待,更大参数的模型可以处理更复杂的任务,多模态模型可以覆盖更多办公场景,而轻量模型则可以让更多受限于设备与部署条件的企业用上AI技术。

以上内容不代表本平台立场,仅供读者参考