文章摘要
9月8日,面壁智能开源2B参数新一代端侧大模型MiniCPM5-2B,原生集成工具调用、深度搜索、代码生成等通用Agent核心能力,多项评测性能领先更大参数同类模型,推理效率优异。此次全栈开放了模型权重、训练流程、自研强化学习框架算法、数据处理工具及全流程训练数据集,首次让端侧通用Agent具备落地雏形,适配隐私敏感本地任务需求。

近年来,端侧大模型的能力边界持续拓展,从最初在手机等设备上运行基础语言模型,到如今支持长文本理解、数学推理、代码生成等复杂能力,行业开始聚焦一个新的命题:通用Agent能力,能否从云端走向端侧?

不同于简单将聊天模型部署到设备,端侧通用Agent需要具备理解目标、拆解任务、调用工具、根据反馈调整策略,并在多轮交互中持续推进任务的完整能力。随着端侧模型性能不断提升,原本依赖云端的复杂工作流,如今已经具备在设备侧独立运行的潜力。

面壁智能正是这一领域的代表性参与者。9月8日,该机构正式开源新一代端侧语言基础模型MiniCPM5-2B,首次让端侧通用Agent能力具备了落地雏形。这款模型将工具调用、深度搜索、代码生成等智能体核心能力原生集成到端侧,为复杂任务在设备侧运行提供了全新的解决方案。

值得注意的是,此次面壁智能开放的不仅是模型权重和基础算法,还包括训练Recipe(如RL训练流程)、自研强化学习框架Meshy、基于奖励的强化学习策略JustRL II,以及一批SFT训练数据——这在当前的大模型开源生态中并不多见。

端侧模型轻装上阵,Agent能力正在成形

MiniCPM5-2B虽参数规模仅2B,但性能表现并不逊色于更大参数的模型。根据Artificial Analysis Intelligence Index榜单,这款模型在开源模型类别中排名第一,该榜单综合了9项评测维度,覆盖知识推理、代码能力以及Agent任务执行等多个领域。数据显示,MiniCPM5-2B以23分的成绩领先Gemma 4 12B、Qwen3.5 9B等更大参数的模型。

在专门衡量Agent工作流能力的榜单中,MiniCPM5-2B同样以20分位居榜首,领先Granite 4.2 8B、Qwen3.5 9B等竞品。

推理效率方面,MiniCPM5-2B也展现出明显优势,完成单个任务平均仅需要约21K输出token,在同规模模型中处于较低水平。

在真实工作任务评测中,MiniCPM5-2B取得了接近人类基准的成绩,这意味着端侧模型的能力边界已经从简单问答延伸到了真实业务场景的处理。同时,这款模型还展现出较高的智能密度,进入同级开源模型的领先位置。

综合多项benchmark测试来看,MiniCPM5-2B的平均分为53.9分,领先Qwen3.5-2B等同类模型。评测覆盖代码推理、数学推理、工具调用、代码智能体、搜索智能体等多个维度,模型在多个方向上的能力保持均衡,说明其性能提升并非来自单一能力点,而是整体能力的全面增强。

这些榜单成绩背后,最值得关注的是端侧通用Agent能力已经初具雏形。过去行业普遍认为,Agent能力只有云端大模型才能支撑,而MiniCPM5-2B的出现,将端侧部署和通用Agent能力结合在了一起:模型从预训练阶段就开始为Agent能力做准备,贯穿SFT、大规模强化学习对齐的全流程,确保这些能力在实际使用中稳定可靠,而非仅能运行的半成品。

在强化学习阶段,MiniCPM5-2B采用了面壁智能自研的强化学习框架Meshy和JustRL II策略。训练框架层面,Meshy移除了RL训练的中央控制器和Ray依赖,将训练、推理、奖励计算等模块建模为对等服务,通过TransferQueue中的数据就绪状态驱动控制流,可以灵活在同步、异步、全异步三种训练模式间切换,便于扩展。

算法层面,端侧模型做长思维链强化学习时,常常面临训练分数不升反降的问题:一方面训练数据噪声多、难度不匹配,奖励信号容易误导模型;另一方面GRPO的信用分配过于粗糙,面对上万词元的推理链,难以区分每一步的对错。针对这些痛点,MiniCPM团队提出了JustRL II:在数据层面,通过三阶段流水线筛选校准训练数据;在算法层面,为GRPO添加Critic模块,实现词元级的信用分配。在JustRL II的加持下,MiniCPM5-2B在RL后训练中获得了显著的性能提升。

我们通过实际测试验证了模型的表现:首先让MiniCPM5-2B在本地处理一篇AI生成的长篇会议纪要,连续提出“本次会议缺席人员是谁”“Atlas V2.0正式上线日期是哪一天”等问题,模型能够从长文本中准确提取关键事实,区分讨论过程与最终结论,给出正确答案,满足日常使用需求。

接下来,我们让模型根据5份简历提取每位候选人的姓名、年龄、工作年限、核心技能,并整理成结构化表格。MiniCPM5-2B能够从多份长文本简历中精准提取关键信息,完成匹配分析,整个过程无需将候选人资料上传至云端,直接在本地完成文档理解和信息处理。对于企业来说,招聘筛选、资料整理等任务往往涉及大量敏感信息,端侧Agent的价值就在于让模型具备处理真实业务流程的能力,同时降低数据离开本地带来的安全风险。

最后,我们测试了模型的网页生成能力,MiniCPM5-2B能够根据简单描述完成页面布局设计和代码生成,输出包含多个功能模块的完整网页。

从以上测试案例可以看出,MiniCPM5-2B已经具备了理解任务、处理信息并生成结果的端侧Agent雏形。

公开数据治理、开源数据集,这在行业里很罕见

除了算法和模型,数据质量已经成为决定模型能力的核心因素。对于参数规模有限的端侧模型来说,如何从海量数据中筛选、提炼高价值信息,直接决定了模型的能力上限。

此次面壁智能公开了支撑MiniCPM5-2B能力提升的完整数据体系,包括全新的预训练数据处理工具UltraX,以及三个最新开源的数据集。

UltraX是一个函数调用式的数据精炼框架,与过去用大模型端到端重写文本的思路不同,它通过训练一个仅0.6B参数的轻量模型,预测一套结构化的编辑操作,包括保留、删除、替换、插入,再由确定性执行器将这些操作应用到原始文本上。

传统的数据处理多采用文档级过滤:判断一篇网页文章的整体质量,差则整篇丢弃,但有价值的内容和垃圾信息往往交织在一起,整篇丢弃会造成大量有效信息的损失。UltraX的思路则是让模型像精细的编辑一样,逐行判断“这段保留、那段删除、这句需要修改”,既避免了端到端重写容易带来的语义漂移和结构破坏,又因为编辑操作可保存、可审计,让整个精炼过程完全可追溯,数据修改的内容和原因都有据可查。

效果验证显示,UltraX在FineWeb、RedPajama-v2、AICC等五个主流语料上的表现优于原始语料:使用同样规模的1B模型从零预训练,UltraX精炼后的语料在下游任务上全面领先,仅用16B tokens训练出的效果,就超过了原始语料训练满20B tokens的最终表现,数据效率提升非常明显。目前UltraX已在Hugging Face开源,发布后一度登顶Hugging Face Datasets Trending榜首。

与此同时,面壁智能还同步开源了UltraData-Code、UltraData-SFT-Agent-2609、UltraData-RL-2609三个数据集,将数据治理能力延伸到模型训练的全流程。

UltraData-Code用于代码数据的分级治理,延续了UltraData一贯的L0到L3递进式构建思路:L0从约1.92亿个公开GitHub仓库中保留最新版本代码与溯源信息;L1在此基础上进行大规模过滤、格式规范化和近重复去重;L2面向11种编程语言,专门筛选算法相关代码,通过语义embedding加上分类器打分,提取主要实现算法和数据结构的文件,规模约400B tokens;L3则更进一步,将这些算法代码拆解重构为任务描述、解题分析、参考实现和测试代码相互对齐的结构化训练样本,规模约150B tokens。

UltraData-SFT-Agent-2609是MiniCPM5-2B后训练阶段的核心Agent数据池,包含约50万条样本,覆盖工具调用、网页搜索、代码Agent和通用Agent等多种任务类型,具体场景包括网页搜索与多跳问答、软件工程与多环境代码执行、Office文档处理、金融服务与数据库工具交互等,既有一步到位的短链路指令,也有需要持续规划、反复交互、阶段性验证的长链路任务。

UltraData-RL-2609则是后训练RL阶段的核心数据,包含超过8万条样本,覆盖数学推理、代码生成、通用知识问答和长文本理解。强化学习训练中,数据质量比数量更重要,常见的问题包括题目答案无法自动验证、奖励标签不可信、题目难度与模型当前水平不匹配等。UltraData-RL-2609专门设计了三阶段流水线来解决这些问题,分别为可验证性过滤、奖励可信性校验和难度匹配与信号优化,为模型提供更高质量的强化学习训练信号。

事实上,数据开源一直是面壁智能和OpenBMB社区的重要方向。过去几年,双方围绕大模型训练全流程持续开放数据资源,覆盖对齐、推理、预训练等多个环节,包括UltraChat、UltraFeedback(面向指令对齐和偏好学习)、UltraInteract_sft、UltraData-Math(聚焦复杂推理能力提升)、Ultra-FineWeb、DCAD-2000(覆盖网页预训练和多语言数据治理)等。截至2026年9月,双方已累计开源超过10个大模型训练数据集,UltraData系列数据集累计下载量超过266万。此次开放的新数据集,进一步将数据开源延伸到代码、Agent和强化学习训练阶段。

开发者能用它做什么?

MiniCPM5-2B从设计之初就充分考虑了开发者的使用需求。推理端支持SGLang、vLLM、llama.cpp、Ollama、Hugging Face,以及面壁智能自研的CPU推理框架Arclight,覆盖主流本地部署和云端推理场景。微调端则支持Llama Factory和ms-swift,可以快速在自有数据上进行领域定制。

特别值得关注的应用场景是对数据隐私敏感的任务,比如聊天记录整理、会议纪要处理、合同问答、内部邮件分析等。这类任务如果使用云端模型,数据需要离开本地上传至服务器,始终是企业用户的顾虑所在。端侧模型的价值恰恰在于,数据无需离开本地,在一定程度上降低了隐私风险,同时减少了云端调用的成本。

此外,端侧运行Agent的能力,也让批量处理任务(如试卷批改、简历筛选、合同集拆分并行处理)在本地变得高效且低成本。

结语

过去几年,大模型的竞争主要集中在云端:更大的参数规模、更强的推理能力、更高的训练成本,不断推动模型的能力上限提升。但AI真正进入日常生活和产业场景,还需要跨过另一道门槛——让模型能够在设备侧运行,让智能真正靠近用户。

MiniCPM5-2B的意义在于,在有限的参数规模下,让工具调用、深度搜索、代码生成等Agent能力开始进入端侧。这意味着端侧模型正在从轻量版助手,走向能够理解任务、调用能力并完成工作的智能体。

更重要的是,面壁智能此次开放的不只是一个模型权重,而是包括数据、训练流程、RL框架和方法体系在内的一整套探索路径。开发者拿到的不只是一个现成的模型,更是一套可以继续优化和创新的基础设施。

未来的AI形态,或许不会只有云端超级模型这一种答案。云端负责复杂推理,设备侧承担高频、隐私敏感任务,二者协同工作,将成为更普遍的形态。2B参数不是终点,但它证明了一件事:当Agent能力开始进入端侧模型,AI正在从数据中心走向每个人手中的设备。

一些参考链接

MiniCPM5-2B 开源链接(含模型与 UltraData 系列数据):

Hugging Face:https://huggingface.co/collections/openbmb/minicpm5

GitHub:https://github.com/OpenBMB/MiniCPM

Meshy 框架开源链接:

GitHub:https://github.com/OpenBMB/Meshy

博客:https://maydomain.notion.site/meshy-blog-zh

JustRL II 强化学习算法:

博客:https://panhaoxuan.notion.site/justrl-ii-small-llms-to-128k-reasoning-with-a-critic-cn

以上内容不代表本平台立场,仅供读者参考