蚂蚁Ling-3.0-Flash:混合架构+KDA,智能与效率双提升

7月24日,蚂蚁百灵正式推出新一代原生混合推理模型Ling-3.0-Flash。这款模型总参数量达124B,但单次计算仅激活5.1B参数,在大幅缩减整体体量、降低算力开销的同时,其基础推理、指令遵循以及长文本处理等核心性能指标,不仅对标甚至超越了参数规模为其2到3倍的行业领先模型,展现出更优异的智效比与落地性价比。目前该模型已上线OpenRouter平台,首周提供限时免费体验,后续将正式开源。
作为本次版本的核心优化重点,Ling-3.0-Flash针对AI Agent的实际落地场景进行了深度打磨。研发团队为模型扩充了超过10000个真实交互训练场景,同时优化了复杂任务的自我纠错能力与长程规划机制。在代码编写、复杂任务拆解、多源信息深度调研等实际应用场景中,该模型的自主闭环交付能力得到显著提升,有效解决了传统大模型在处理大型任务时容易出现思路跑偏、流程断档的痛点。
这款模型能够实现“小体量、高智能”的核心关键,在于底层计算架构的全新设计。研发团队摒弃了单纯堆砌参数的传统思路,从预训练阶段就采用混合注意力架构,按照5:1的比例交替堆叠KDA线性注意力层与MLA层,让模型在长上下文处理效率与综合能力之间实现了更优的平衡。
除此之外,Ling-3.0-Flash还将上一代的Lightning Attention升级为KDA(Kimi Delta Attention),在Delta Rule的状态更新逻辑中引入了细粒度对角门控机制,使得模型在处理长文档与代码库时,可以更精准地留存关键信息,避免长上下文遗忘的问题。同时,模型进一步压缩了单次计算的专家激活比例,将前代模型1/32的Token专家激活占比下调至1/64,进一步提升了整体的效率表现。
为了让AI Agent能够更流畅、稳定地运行,蚂蚁百灵还为Ling-3.0-Flash配套了专属的工程与协作架构。在响应速度层面,通过引入集群级分级缓存机制,避免了长对话与多轮交互中的重复计算,将长输入场景下的首字响应延迟降低了60%至80%以上;在任务稳定性方面,升级后的多智能体协同架构支持不同Agent之间分工协作、互相校验,有效降低了单一模型出现误判的概率,为高频线上服务与真实业务落地提供了可靠的支撑。


