文章摘要
9月8日,两支技术团队联合开源面向端侧场景的20亿参数大语言模型MiniCPM5-2B,经多项行业评测,该模型综合性能登顶全球40亿参数以下开源模型,参数效率、推理能力领先同级,初步形成端侧通用智能体雏形。本次同步开源全套技术资源,完成多平台适配,提供多场景部署方案。

9月8日,两家技术团队联合推出了一款面向端侧场景的开源大语言模型MiniCPM5-2B。这款模型仅搭载20亿参数,采用高密度架构设计,具备工具调用、深度搜索、代码生成等核心能力,初步形成了通用智能体的落地雏形。

根据行业通用评测指标,该模型综合得分达到23分,在全球40亿参数以下的开源基座模型中排名第一,智能体能力得分也达到20分。本次开源还同步开放了训练方案、数据集、强化学习框架等全套技术资源,覆盖从模型训练到落地部署的全流程。

端侧模型的性能标杆

在行业通用智能评测榜单中,MiniCPM5-2B的综合能力得分提升至23分,超越了多款主流3B到4B级别的开源模型,位居全球40亿参数以下开源模型之首。

从模型的智能密度来看,MiniCPM5-2B实现了极致的参数效率比——仅以20亿的参数体量,智能水平就领先了参数规模翻倍的40亿同级开源模型。这意味着,该模型仅用约一半的参数量,就跑出了近乎翻倍的智能得分,单位参数的智能密度极高。

在推理效率与输出质量上,MiniCPM5-2B同样表现出色。以相同的计算成本为例,当消耗21k Token(其中14k用于思考,7k用于生成答案)时,MiniCPM5-2B的智力得分高达23分,位居同级模型第一。对比来看,其他同级别模型在相近计算成本下的得分仅为其一半左右。

在通用智能体能力上,MiniCPM5-2B也体现了高密度端侧语言基础模型的潜力。根据评测成绩,该模型获得了断层式领先的20分,是同级模型的10倍能力增长,初步实现了高智能密度端侧通用智能体能力的雏形。

除了通用智能评测榜单,MiniCPM5-2B在覆盖代码推理、数学推理、指令遵循、综合知识、长文本、工具调用和智能体任务等方向的34项基准评测中也有出色表现:其平均得分高达53.9分,排名第一,不仅领先同级2B模型第二名的33.2分,也超过了4B模型中表现最佳的同类型产品。在具体任务上,代码推理、数学推理、长文本、工具调用、搜索智能体、通用智能体等多个领域上均领先同级2B乃至参数规模更大的3B-4B行业主流模型。

以1000分为人类基线,MiniCPM5-2B在真实任务评测中获得891分,居于40亿参数以下模型榜首,同时远高于参数规模约为其6倍的其他模型,更接近人类水平。MiniCPM5-2B在智能密度与Token消耗上的表现,进一步验证了团队首创的「密度定律」的科学性,也体现了其在算力与显存有限的手机、车机、PC、机器人等端侧设备上兼顾性能与成本的落地优势。

高效数据治理体系支撑极致性能

MiniCPM5-2B能够高效平衡性能与成本的背后,是对每一个模型参数潜力的极致挖掘。支撑这一结果的,是团队自2023年以来率先积累多年的数据治理经验与成果。

受限于算力、显存等因素,目前能够部署到端侧设备上的模型参数规模有限,因此每一个参数的智能密度都直接决定了端侧智能的上限。数据治理是提高智能密度的关键。

MiniCPM5-2B基于分级数据治理体系,在通用网页、数学、代码、SFT、RL等多个维度上提出了完善的数据治理方案。伴随MiniCPM5-2B一同新开源的,还有4个专项数据集。

代码专项数据集:面向代码预训练与能力优化,覆盖多分级代码数据。项目从海量公开代码仓库中采集原始数据,经过清洗去重、算法代码筛选和任务导向的结构化合成,形成多阶段的高质量代码训练数据。

智能体后训练数据集:用于模型后训练阶段的智能体能力优化,包含数十万条训练样本,覆盖工具调用、网页搜索、代码生成、办公文档处理、数据库交互等任务,可有效提升端侧模型智能体能力。

强化学习专用数据集:是模型强化学习阶段的核心数据集,包含超过8万条覆盖数学推理、代码生成、通用知识问答和长文本理解的高质量样本。针对训练中常见的数据质量问题,数据集通过多阶段流程进行严格清洗,为强化学习训练提供高信噪比的奖励信号和可靠的数据基础。

通用预训练精炼框架:是一个面向大规模预训练数据的函数调用式精炼框架。它通过轻量化模型逐条地对数据生成处理脚本,实现低成本、细粒度且可追溯的数据清洗。该框架包含多个数据子集,可有效提升预训练数据质量。截至2026年9月,该系列数据集累计下载量超过266万次,累计开源数据集数量已超过10个,在开源社区已得到广泛验证。

创新强化学习框架与算法

此次随着MiniCPM5-2B的开源,团队还开源了全新的自研强化学习框架与基于奖励的强化学习策略。

在训练框架侧,新框架彻底丢掉了传统RL训练的中央控制器和额外依赖,将训练、推理、奖励计算等全部建模到对等服务,利用数据就绪状态来驱动实际控制流,能够简单地在多种训练模式中灵活切换,便于扩展。

在算法层面,端侧模型做长思维链强化学习时,常常会遇到训练过程中分数不升反降的问题:一方面训练数据里噪声多、难度不匹配,奖励信号容易带偏模型;另一方面传统信用分配方法太粗糙,面对上万词元的推理链,分不清哪些对、哪些错。

为此,团队提出了针对性的改进方案:数据上,用三阶段流水线筛选校准训练数据;算法上,给传统训练方法装上专用模块,实现词元级信用分配。在新方案加持下,MiniCPM5-2B在强化学习后训练中获得了显著的性能收益。

多平台原生适配加速产业落地

为加速产业落地,MiniCPM5-2B已与多家芯片或计算平台厂商完成了首日原生适配,在多款芯片上表现出色。

在主流个人计算平台上,依托全异构算力以及官方工具套件,对MiniCPM5-2B开展全链路深度优化。相较于基准版本,预填充和解码性能均得到大幅提升;可显著压低运行内存占用,大幅削减长上下文推理时延,以低功耗稳定跑通全套端侧Agent能力。开发者可实现开箱即用的本地化部署,从底层硬件、优化工具链到上层应用形成完整闭环,充分释放端侧AI的全部产业潜力。

在嵌入式芯片平台上,MiniCPM5-2B可以基于双芯平台实现完整端侧部署,依托专用工具链完成模型量化、算子深度优化,依托高带宽硬件优势有效降低大模型首token时延,在端侧硬件上稳定运行,完整复现端侧Agent核心能力。

在移动计算平台上,MiniCPM5-2B现已能够在搭载专用加速技术的计算平台的移动设备上实现高效运行。该技术可在CPU上直接实现AI加速,能够在异构计算框架下,高效支持各类实时移动端推理任务。实际测试结果显示,在启用该技术的移动设备上运行MiniCPM5-2B时,推理性能实现了显著提升,有利于为用户带来更加流畅、智能的端侧AI体验。

全栈技术开源生态

团队本次联合开源,不仅开源MiniCPM5-2B模型本身,还同时开源模型背后的训练方案、框架与数据。近年来,团队联合开源社区持续推进基础模型技术开放。截至2026年8月,MiniCPM系列模型开源下载量已突破5000万,语言基础模型开源下载量突破1300万。

目前,MiniCPM5-2B已接入主流开发工具链,并适配多种模型开发与部署工具。在训练与微调方面,已支持多款主流微调工具;在推理部署方面,已接入多个主流推理框架,并兼容团队自研的CPU推理框架。

多场景本地部署指南

用户可以通过多种方式获取并部署MiniCPM5-2B,适配不同的使用场景:

模型下载方式:首先安装必要的依赖工具,根据不同的运行方式选择对应版本下载。例如,针对主流推理框架,可以下载通用版本;针对轻量化本地推理工具,可以选择GGUF格式版本;针对苹果自研芯片设备,可以选择专用优化版本。也可以通过Python SDK直接下载标准版本,或者在使用主流推理框架时直接指定从开源平台拉取模型。

# 安装依赖工具
pip install -U modelscope

根据场景选择下载对应版本

通用版本,适用于主流推理框架

modelscope download --model 通用模型标识

轻量化版本,适用于本地轻量推理工具

modelscope download --model 轻量化版本标识

苹果芯片专用版本

modelscope download --model 苹果芯片专用版本标识

基于原生框架的本地推理:安装相关依赖后,可以通过简单的代码示例完成本地推理,官方推荐采样参数为temperature=1.0、top_p=0.95,模型原生上下文长度为131072 tokens。

from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "模型标识"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype="auto",
    device_map="auto",
)
messages = [{"role": "user", "content": "请简要介绍一下你自己。"}]
inputs = tokenizer.apply_chat_template(
    messages,
    tokenize=True,
    add_generation_prompt=True,
    enable_thinking=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device)
outputs = model.generate(**inputs, max_new_tokens=128)
print(tokenizer.decode(
    outputs[0][inputs["input_ids"].shape[-1]:],
    skip_special_tokens=True,
))

基于服务框架部署:可以通过主流服务框架快速启动模型服务,通过标准接口进行调用,方便集成到各类应用中。同时,部分框架支持专用的工具调用解析,可直接适配模型的工具调用格式。

轻量端侧部署:对于CPU、本地桌面或资源受限设备,可以选择轻量化格式版本,通过专用工具运行;对于苹果自研芯片设备,可以选择专用优化版本,实现低显存占用的本地推理。

以上内容不代表本平台立场,仅供读者参考