国产AI Token工厂率先投产 性价比超越国际算力方案

9月3日,国内两家科技企业正式签署战略合作协议,基于趋境科技自研的国产PD异构技术与摩尔线程MTT S5000智算卡、MUSA软件平台的深度融合,双方将携手推进基于ATaaS平台的国产化高品质AI Token工厂建设,并联合研发推广以Token Pod(Token超节点)为载体的软硬一体化解决方案。
目前该联合方案已正式投入生产环节,承接头部模型厂商的官方真实Token业务流量。在统一的生产服务标准下,这套方案既兼顾了国产算力的生产级性能表现,又在单位AI Token的生产成本上具备显著优势,整体性价比超越国际同类先进算力方案,这也标志着双方率先推动国产PD异构推理技术正式进入规模化生产环境。
双方相关负责人共同完成了签约流程,企业高管团队出席了本次签约仪式。
当前大模型应用已经进入规模化商业落地阶段,基础设施的竞争焦点已经从单卡硬件性能转向系统级的Token生产效率。一套算力方案的商业价值,不再仅仅取决于能否运行大模型,更核心的衡量标准是在既定服务目标下,单枚高品质AI Token的生产成本。
趋境科技与摩尔线程的联合方案,其性价比优势并非单纯依靠硬件价格差异,而是通过对大模型推理的Prefill与Decode两个关键阶段进行资源优化配置实现的。其中摩尔线程MTT S5000负责Prefill阶段的输入计算与KV Cache生成,再与承担Decode阶段Token生成的高带宽GPU协同工作,实现算力资源的精准分配。
MTT S5000凭借高密度AI算力、原生FP8精度,以及MUSA完善的软件栈与生态适配能力,能够将Prefill环节从传统推理链路中解耦出来,构建为可独立供给、独立计费、独立优化的专属算力资源池。而趋境科技则依托自研国产PD异构技术完成模型深度优化与跨设备协同,最终将不同类型的算力资源整合为统一、稳定且高性价比的端到端推理服务。
这种资源配置模式减少了Prefill阶段对高成本算力资源的占用,也避免了按照单一阶段的峰值需求配置整套基础设施。在当前投产项目的同等生产服务标准下,由4至5台MTT S5000组成的Prefill资源池,其输入Token处理的性价比已经超过国际先进算力方案。这意味着国产算力的竞争力正在从单卡性能层面,延伸至系统级的Token生产效率层面,双方为万亿参数大模型的规模化推理提供了一条兼顾生产级性能与成本效率的国产算力路径。
性价比的优势最终需要真实生产环境的检验,而生产环境往往面临高并发、超长上下文处理以及持续流量波动等复杂挑战,这对国产算力的显存管理、跨设备协同能力以及服务稳定性都提出了更高要求。根据当前生产运行的实测数据,摩尔线程MTT S5000与趋境科技自研的国产PD异构方案协同运行,在国产头部大模型的复杂业务场景下,实现了平均超过50 TPS的生成速度、超90%的KV Cache命中率、99.9%的服务稳定性,以及生产级低首Token时延(TTFT),真正将国产算力转化为规模化、高品质的AI Token生产能力。经过多轮性能迭代与专项优化,MTT S5000已经顺利跨过模型兼容与测试验证阶段,正式接入高品质AI Token的生产链路。
本次合作的生产成果,也是趋境科技“少模型、深优化”技术路线的集中体现。该技术路线的核心是将核心工程资源聚焦于具备明确规模化需求的重点模型,围绕模型、芯片、推理系统与真实业务负载开展持续优化,最终的衡量标准是能否在实际运行中兼顾时延、吞吐、稳定性、精度、长上下文处理能力与成本控制,持续产出高品质AI Token。
这一理念贯穿了本次国产PD异构方案的设计与落地全流程:趋境科技根据Prefill与Decode两个阶段的不同任务特征,完成了PD分离异构推理方案的设计,并与摩尔线程共同完成了MTT S5000与模型、推理系统及运行环境的深度优化。双方通过线上真实流量持续检验优化效果,并根据运行结果迭代模型配置与服务策略,让性能提升从实验室参数转化为稳定的高品质AI Token产出,进一步验证了“少模型、深优化”在国产异构生产场景中的有效性。在此过程中形成的模型配置、流量特征与运行策略,也进一步沉淀到ATaaS平台,形成了可复用的标准化生产能力。
本次战略合作的核心目标,是充分发挥双方在推理系统、生产运营与国产GPU软硬件平台方面的各自优势,共同建设能够承接真实业务、持续产出高品质AI Token的国产化AI Token工厂。围绕这一目标,双方将共同推出基于Token Pod的软硬一体化Token生产解决方案:摩尔线程提供MTT S5000智算卡与MUSA软件平台,趋境科技则以Token Pod为交付载体,将相关硬件与自研国产PD异构推理系统、ATaaS平台及运营服务深度融合,形成覆盖基础设施、推理优化、平台管理与持续运营的专属推理集群。
为推动联合方案从已投产的试点项目走向标准化交付,双方将把国产PD异构项目中积累的模型适配、跨设备协同与生产运营经验进一步沉淀至Token Pod。依托共享KV Cache、流量感知配置、弹性扩展与故障隔离等核心能力,Token Pod可以适配国产与国际主流的硬件组合,形成可根据业务需求灵活配置与扩展的Token生产单元,有效加快联合解决方案在具体项目中的落地速度。
联合方案的持续复制,建立在趋境科技已有的成熟生产基础之上。截至2026年8月,趋境科技已经完成日均万亿级高品质AI Token生产项目的共建,并在多个项目中形成了日均千亿级高品质AI Token的生产能力,为双方进一步建设和运营更大规模的国产化高品质AI Token工厂积累了丰富的项目实践经验。作为国产异构混推的先行实践者,趋境科技始终以生产级标准推进国产PD异构方案的落地,在保障功能与精度可信的基础上,持续开展深度引擎性能优化,真正让国产GPU的硬件能力转化为高品质AI Token的产出能力。
未来,趋境科技与摩尔线程将进一步深化技术联合、标准共建与生态协作,拓展在互联网企业、前沿基础模型公司、运营商等国家关键基础行业的合作场景,推动国产PD异构推理技术进入更广泛的生产应用领域。

