Ling-3.0-flash:魔搭社区调用与部署全指南

近期,某AI研发团队正式开源了新一代原生混合推理模型Ling-3.0-flash,这款模型通过原生混合线性注意力、细粒度状态记忆与高稀疏MoE架构,在长上下文处理、智能体执行效率与部署成本之间找到了理想的平衡。
这款模型采用总参数量124B、激活参数仅5.1B的MoE架构,与上一代1T级旗舰思考模型相比,总参数量仅为前者的12.4%,激活参数量约为8.1%。官方评测数据显示,在推理、指令遵循、长文本处理与智能体任务等多项基准测试中,Ling-3.0-flash的表现能够对齐甚至超越上一代旗舰及部分更大规模的模型。
更值得关注的是,本次开源同步提供了基础版本、FP8、FP4与INT4多种权重格式,让模型的部署场景从云端API延伸到本地设备与专属推理集群。对于开发者而言,Ling-3.0-flash的核心价值并非仅仅是“参数更小”,而是实现了模型能力、运行速度、部署成本与自主可控性之间的重新平衡。
多场景落地能力
Ling-3.0-flash更适合应用在边界清晰、可调用工具、结果可验证的执行链路中,以下场景展示了其在不同领域的实际能力:
3D自动化建模:快速搭建城市场景并渲染
Ling-3.0-flash突破了平面代码的限制,可以直接介入三维设计流程,成为可随时调用的虚拟建模助理。在Blender使用场景中,模型通过Blender MCP接口控制3D软件,仅需一句自然语言指令即可自动编写Python脚本,搭建包含高架路网、摩天大楼与材质的完整城市场景,随后设置相机路径并渲染输出航拍视频。整个生成过程中,模型展现出了复杂3D几何空间推理、Blender Python API控制以及长程MCP工具调用的综合能力。
自主多智能体科研闭环:从课题到论文的全流程支持
当面对陌生研究课题时,Ling-3.0-flash可以扮演多重角色快速完成研究闭环。其搭建的自主多智能体科研大盘,支持跨角色自主进行假说推演、文献检索、数据质询打回、研讨与自动化成果论文及PPT报告合成,帮助研究人员快速推进课题进度。
办公自动化:从凌乱草稿到规范文档
对于杂乱的立项草稿和预算数据,Ling-3.0-flash可以像私人秘书一样完成日常核算与文档整理工作。基于Office MCP接口,模型能够直接读取并排版Word提案,自动调整格式并生成目录;同时可以核算Excel财务数据,处理SUMIF公式与透视表汇总,最终输出规范文档与PDF滚动长图。整个过程中,模型展现出了对多模态文档解析、Office API精细控制与自动化长程执行的稳定性。
批量美学网页生成:纯代码实现视觉表达
除了代码工具属性,Ling-3.0-flash同样具备出色的设计能力。即使没有任何外部图片素材,模型仅通过纯代码即可批量搭建出极具视觉冲击力的前卫艺术网页。本次测试中,模型生成了包豪斯、波西米亚、酸性设计等多个现代设计流派的页面,难度从Easy到Hard渐进覆盖,在不依赖外部图片的前提下,纯靠CSS渐变、SVG路径和排版布局还原了各流派的设计质感,展现出对视觉流派设计的理解力、极高质量的前端代码批量生成与无图美学排版能力。
本地敏感数据处理:医疗研究的单机闭环
在单台NVIDIA DGX Spark设备上部署Ling-3.0-flash,可以构建一套面向医疗研究数据处理的本地智能体Pipeline。模型与数据均在本地环境中运行,有效降低患者敏感信息外传的风险,可辅助完成以下工作:
这一案例体现了Ling-3.0-flash单机部署的实际价值:在降低敏感医疗数据外传风险的同时,将重复的信息提取、整理和初步分类转化为可持续运行的本地流程,让研究人员把更多时间用于真正需要专业经验和责任判断的工作。需要注意的是,模型仅用于医疗研究与数据处理辅助,不替代专业人员判断或临床诊断,实际应用仍需满足相关法规、伦理审查,以及组织内部的权限管理、日志审计和数据治理要求。
- 敏感信息处理:对身份信息进行脱敏,并为研究样本分配动态ID,降低后续处理过程中关联真实身份的风险。
- 医疗信息结构化:从原始资料中提取生命体征、血液生化指标和彩超报告等信息,将分散数据整理为可用于研究分析的结构化结果。
- 研究流程辅助:按照研究规则完成样本初步分组;对于异常、复杂或证据不足的样本,统一标记为“Unclassified”,交由专业人员进一步复核。
核心技术架构升级
Ling-3.0系列模型在架构设计上实现了系统性升级,深度融合长上下文计算、状态记忆与专家路由优化,以更低的单Token激活规模承载并转化更大容量的知识与能力。
Hybrid-linear:原生混合线性注意力架构
与上一代Ling-2.6依赖后期架构迁移进行预训练改造不同,Ling-3.0从预训练伊始就采用了原生混合线性注意力架构,以5:1的比例交替堆叠KDA线性注意力层与MLA层,即每6层包含5层KDA和1层MLA。这种设计让全链路模型组件在整个训练周期内实现深度协同优化,在长上下文处理效率与模型能力之间实现了更优的平衡。
模型将上一代的Lightning Attention升级为KDA(Kimi Delta Attention),KDA在Delta Rule的状态更新中引入了细粒度对角门控,赋予不同特征通道独立的保留、衰减与写入控制能力。这一机制显著提升了有限状态记忆的控制精度,让模型在处理长文档、大型代码库和复杂资料包时,能够精准维护跨段落、跨步骤的关键信息,为长上下文检索、信息整合和持续推理奠定了坚实的架构基础。
基于Ling Scaling Law,更低的专家激活比例可以带来更高的“效率杠杆”,即以更少的实际计算获得更高的等效模型能力。因此,Ling-3.0将每个Token的专家激活比例由前代的1/32进一步降低至1/64,以极低的计算消耗驱动模型能力的跃迁。
综上,原生混合线性注意力、KDA与稀疏MoE三者深度协同,大幅提升了参数规模、计算开销与模型能力之间的转化效率,为Ling-3.0-flash在124B总参数量、仅5.1B激活参数量的规模下实现跨越式发展提供了坚实的架构支撑。
极致智能密度:兼顾高性能与高性价比
在上一代flash模型对智能密度与智效比极致探索的基础之上,Ling-3.0-flash实现了全面进化。研发团队并未追求单纯的“大而全”,而是专注于在“足够强”的前提下,把“快、省、可落地”做到极致,不断突破模型能力的上限与智能密度的绝对边界。
面对更大尺寸的SOTA模型及上一代旗舰模型,Ling-3.0-flash在多项关键指标上展现出不逊色甚至更优的越级表现:
- 核心能力全面对标,性能实现越级:Ling-3.0-flash在传统推理、指令遵循与长文本交互上展现出向更大体量模型看齐的底气,不仅全面覆盖数学、传统逻辑与代码等核心复杂场景,能够精准驾驭多约束及智能体环境下的严苛指令,更能从容支撑海量上下文处理,保障长周期、多轮次深度交互中复杂业务逻辑的持续推进。
- 多场景深度适配,Agent扎实落地:围绕当下热门的智能体场景,Ling-3.0-flash展现出极高的场景契合度,做到“能力强、响应快、协同稳”。无论是深度覆盖代码生成、多文件重构与结果验证的Coding Agent,具备出色任务规划、工具组合与动态调整能力的General Agent,还是专注于多轮检索、跨源整合与证据闭环的Deep Research Agent,模型均能扎实落地,以卓越的闭环执行力从容驾驭各类复杂生产力场景。
- 极致智能密度,兼顾高性能与高性价比:在追求高性能的同时,Ling-3.0-flash在智能密度与智效比的维度上追求极致。凭借极少的总参数与激活参数,模型在多项测评指标中达到或超过大尺寸SOTA与上一代旗舰模型,更将推理开销压至极低。这种极致的智能密度转化为实际应用价值,意味着更短的生成时延、更快的首字响应与更低的API调用成本,全面赋能高频线上服务与真实智能体的落地。
在MiniAppBench测试中,Ling-3.0-flash的通过率达到25.3%,与总参数规模约为其两倍的开源SOTA模型达到同等水平。该测试要求模型仅根据一句用户需求生成完整可用的APP,参与评测的16个主流模型平均通过率仅为17%。
智能密度为平均榜单分数除以总参数量,代表单位显存下的智能水平,用于衡量起步部署硬件门槛;智效比为平均榜单分数除以单token激活参数量,代表单位计算算力下的智能水平,用于衡量高并发服务能力。激活参数决定单次推理计算量与服务吞吐,Ling-3.0-flash仅需5.1B激活参数即可提供具有竞争力的智能分数。
Agent全面进化:能力强、响应快、协同稳
Ling-3.0-flash还围绕真实生产力场景,对Agent能力、运行效率与协同架构进行了系统升级。面对复杂约束和长程任务,模型能够持续规划、调用工具、响应环境反馈,并根据中间结果动态调整执行路径,最终完成可验证的任务交付。与此同时,研发团队通过分级缓存和Multi-Agent协同架构,进一步提升了长会话交互效率,以及复杂任务执行的能力上限与稳定性。
能力强:复杂任务,持续优化
在训练阶段,研发团队将Coding Agent、General Agent和Deep Research Agent的可交互训练环境扩展至10000余个,并持续提升环境的质量、多样性和任务难度。针对长程智能体任务,团队在RL阶段引入完整执行轨迹复盘和步骤贡献评估机制,为任务执行过程生成更细粒度的步骤级训练信号,帮助模型更高效地从环境交互、失败反馈和自主纠错中学习。
相比上一代旗舰模型,Ling-3.0-flash的Agent能力实现全面提升,在多项指标上对齐甚至超越体量达其2~3倍的开源SOTA及行业领先闭源模型,展现出面向真实生产力场景的任务执行与交付能力。
响应快:长程交互,无需重算
智能体任务越复杂,对话轮次越多,上下文也越长。传统推理服务中,一旦本地缓存被新请求挤出,或同一会话被调度至其他计算节点,系统往往需要重新处理前面数万Token的上下文,导致首Token延迟快速上升。为此,Ling-3.0-flash基于SGLang HiCache与Mooncake构建了集群级分层缓存体系,让已有上下文能够跨层级存储、跨节点共享和按需恢复,将缓存从“实例私有”升级为“集群共享”,最大限度减少长上下文的重复计算。实测显示,在长输入场景下,命中L3 Cache相比直接重新计算,可将首Token延迟降低60%~80%以上。
从本地缓存到集群共享,从重复计算到分层复用,Ling-3.0-flash显著提升了长会话的Token Efficiency。对于Coding Agent、长文档问答等需要持续携带完整历史的场景,这意味着更快的任务接续、更低的计算开销,以及更加流畅稳定的交互体验。
Multi-Agent协同稳:多元智能,相互校验
面对复杂智能体任务,传统的Single-Agent推理链路容易受到决策漂移、局部误判和容错能力不足等问题影响。为此,Ling-3.0-flash升级了多智能体协同架构。研发团队在相关研究范式的基础上,进一步研究了Multi-Agent架构的Scaling机制。不同Agent可以围绕任务进行多层级分工,并通过交叉验证、信息补充、协同纠错与竞争赛马,降低单一推理路径带来的偏差。
测试数据显示,在相关测试集上,通过该多智能体架构可获得log-linear的性能提升。未来,研发团队将把这一范式拓展到更广泛的任务场景,持续探索更大规模智能体协同的能力边界。
部署与使用指南
在线体验与API调用
无需本地部署,用户可以在开源模型服务平台直接试用Ling-3.0-flash。在模型页面点击「在线体验」,即可在网页端与模型直接对话,快速验证推理、指令遵循与长文本处理效果。
此外,平台还为模型提供免费的API-Inference调用,接口与OpenAI SDK兼容。在模型页点击「推理API-Inference」即可获取示例代码,将<MODELSCOPE_TOKEN>替换为自己的平台访问令牌后即可运行:
from openai import OpenAI
client = OpenAI(
base_url='https://api-inference.modelscope.cn/v1',
api_key='<MODELSCOPE_TOKEN>',
)
response = client.chat.completions.create(
model='inclusionAI/Ling-3.0-flash',
messages=[
{
'role': 'user',
'content': '你好'
}
],
stream=True
)
done_reasoning = False
for chunk in response:
if chunk.choices:
reasoning_chunk = chunk.choices[0].delta.reasoning_content
answer_chunk = chunk.choices[0].delta.content
if reasoning_chunk != '':
print(reasoning_chunk, end='', flush=True)
elif answer_chunk != '':
if not done_reasoning:
print('\n\n === Final Answer ===\n')
done_reasoning = True
print(answer_chunk, end='', flush=True)
本地部署
官方为Ling-3.0-flash提供了vLLM与SGLang两套部署方案,权重可以直接从开源模型服务平台下载:
pip install modelscope
modelscope download --model inclusionAI/Ling-3.0-flash --local_dir ./Ling-3.0-flash
vLLM部署方案
首先安装官方适配版本的vLLM:
pip install uv
uv venv ~/my_ling_env
source ~/my_ling_env/bin/activate
git clone -b ling_3_0 https://github.com/inclusionAI/vllm-ling-v3.git
cd vllm-ling-v3
VLLM_USE_PRECOMPILED=1 uv pip install --editable . --torch-backend=auto
启动服务(以4卡为例),$MODEL_PATH指向上一步下载的权重目录,$PORT为服务端口。由于模型在训练阶段带MTP,推荐推理时开启投机解码以降低延迟:
vllm serve "$MODEL_PATH" \
--port "$PORT" \
--trust-remote-code \
--served-model-name auto \
--tensor-parallel-size 4 \
--gpu-memory-utilization 0.85 \
--enable-prefix-caching \
--mamba-cache-mode align \
--enable-auto-tool-choice \
--tool-call-parser ling3 \
--reasoning-parser ling3 \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
调用服务时,推荐使用以下采样参数:temperature=0.6、top_p=0.95、top_k=20,并开启enable_thinking:
curl -s http://${MASTER_IP}:${PORT}/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "auto",
"messages": [{"role": "user", "content": "hello!"}],
"chat_template_kwargs": {"enable_thinking": true},
"stream": true,
"temperature": 0.6,
"top_k": 20,
"top_p": 0.95
}'
SGLang部署方案
官方提供了跟随Ling-3.0运行时更新的预置镜像:
docker pull lmsysorg/sglang:dev-Ling-3.0-flash
低延迟推荐配置,内置MTP / NEXTN与256K YaRN上下文,适用于4张141GB级显卡或4卡Blackwell节点;使用80GB显卡时将--tp 4改为--tp 8:
docker run --rm --gpus all --ipc=host --shm-size 32g \
-p 30000:30000 \
-e HF_TOKEN=<your-hf-token> \
lmsysorg/sglang:dev-Ling-3.0-flash \
env SGLANG_ALLOW_OVERWRITE_LONGER_CONTEXT_LEN=1 \
python3 -m sglang.launch_server \
--model-path inclusionAI/Ling-3.0-flash \
--tp 4 \
--context-length 262144 \
--speculative-algorithm NEXTN \
--mem-fraction-static 0.8 \
--host 0.0.0.0 \
--port 30000
若使用已下载到本地的权重,可去掉-e HF_TOKEN,通过-v挂载权重目录并将--model-path指向挂载后的路径。
调用服务时,chat template与ling3 reasoning parser默认开启思考模式,可在单次请求中通过"chat_template_kwargs": {"enable_thinking": false}关闭:
curl -s http://localhost:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "inclusionAI/Ling-3.0-flash",
"messages": [{"role": "user", "content": "hello!"}],
"stream": true,
"temperature": 0.6,
"top_k": 20,
"top_p": 0.95
}'
不同组合的完整启动矩阵和已验证配置,可参考SGLang Cookbook,更多部署说明见模型服务平台的模型详情页。

