2B 参数打赢 12B:面壁智能 MiniCPM5 开源登顶
9 月 8 日,端侧大模型公司面壁智能联合 OpenBMB 开源社区,开源新一代高密度端侧语言基础模型 MiniCPM5-2B。这个只有 20 亿参数的模型,在第三方评测机构 Artificial Analysis 的榜单上以 23 分位列全球 4B 参数以下开源模型第一。
小参数,高密度
从榜单数据看,MiniCPM5-2B 的智能密度超过了 Qwen3.5 9B,也超过了参数规模约为其 6 倍的谷歌 Gemma 4 12B。
如果以 1000 分为人类基线,MiniCPM5-2B 在真实任务评测中获得 891 分,位居 4B 以下模型榜首,同时明显高于 Qwen3.5 9B 的 645 分和 Gemma 4 12B 的 647 分。
在推理消耗上,这个模型的效率优势更加直观。产出同样约 21k Token(14k 思考 + 7k 答案),MiniCPM5-2B 拿到 23 分;Granite 4.2 3B 消耗约 19k Token(12k 思考 + 7k 答案)得 14 分;LFM2.5-2.6B 消耗 21k Token(14k 思考 + 7k 答案)只有 11 分。同等算力开销下,得分差距接近一倍。
在覆盖代码推理、数学推理、指令遵循、综合知识、长文本、工具调用和智能体任务的 34 项基准评测中,MiniCPM5-2B 平均得分 53.9 分排名第一,既领先同级 2B 模型第二名的 33.2 分,也超过 4B 模型中表现最好的 Qwen3.5-4B。
端侧跑 Agent 的第一次验证
更值得关注的是智能体指标。MiniCPM5-2B 在 Agentic Index 上拿到 20 分,而同等参数规模模型(包括 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B)得分均低于 10 分。
这意味着在 2B 参数规模上,通用智能体能力已经出现雏形。模型支持工具调用、深度搜索、代码生成等任务,面向手机、PC、车机和机器人等端侧设备。原生上下文长度为 131,072 tokens。
对开发者而言,这条路径的价值在于:智能体能力不再必须依赖云端大模型,终端本地运行有望带来更低的推理成本、更快的响应速度,以及更可控的数据隐私。
连训练方法一起开源
这次开源的范围超出了模型权重本身。面壁智能同时公开了完整训练配方、4 个数据集、自研强化学习框架 Meshy 和强化学习策略 JustRL II。
数据集方面包括 UltraData-Code、UltraData-SFT-Agent-2609、UltraData-RL-2609 与 UltraX 四个数据集。其中 UltraData-Code 从约 1.92 亿个公开 GitHub 仓库采集原始数据,最终形成约 400B 词元的算法代码精筛数据和约 150B 词元的任务导向合成数据;UltraData-SFT-Agent-2609 约 50 万条样本,覆盖工具调用、网页搜索、代码生成、Office 文档处理与数据库交互;UltraData-RL-2609 超过 8 万条,覆盖数学推理、代码生成与长文本理解。
框架层面,Meshy 去掉了强化学习训练的中央控制器和 Ray 依赖,把训练、推理、奖励计算全部建模为对等服务,可在同步、异步、全异步三种模式间切换。JustRL II 则针对长思维链训练中的噪声与信用分配问题,在数据侧采用三阶段流水线筛选校准,在算法侧为 GRPO 引入 Critic,实现词元级信用分配。
芯片厂商首日适配
为加速落地,MiniCPM5-2B 已完成英特尔、瑞芯微、Arm 等平台的 Day0 首日原生适配。
在英特尔平台上,模型依托酷睿 Ultra 系列 CPU、GPU、NPU 异构算力与 OpenVINO 工具套件完成全链路优化;在瑞芯微平台上,可基于 RK3588 与 RK1828 双芯平台部署,通过 RKNN3 工具链完成量化与算子优化;在 Arm 平台上,模型已适配启用第二代可伸缩矩阵扩展技术 SME2 的 Armv9 移动设备,实测预填充与解码性能分别约为对照条件的 1.7 倍和 1.2 倍。
工具链方面,模型已支持 LlamaFactory、ms-swift 等训练微调工具,并接入 SGLang、vLLM、llama.cpp、Ollama、Transformers 等推理部署框架,同时兼容面壁智能自研的 Arclight CPU 推理框架。
截至 2026 年 8 月,MiniCPM 系列开源模型全球累计下载量已突破 5000 万次,其中语言基础模型 MiniCPM 下载量超过 1300 万次。







