面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

9 月 8 日,面壁智能联合 OpenBMB 开源社区正式开源新一代「小钢炮」MiniCPM5-2B

MiniCPM5-2B 的参数规模为 2B,是一款高密度端侧语言基座模型,支持工具调用、深度搜索、代码生成等任务,初步实现了端侧通用 Agent 雏形

根据国际知名权威榜单 Artificial Analysis Intelligence Index(以下简称「AA榜单」)的最新评测,MiniCPM5-2B 综合能力得分 23 分,在全球 4B 参数规模以下的开源基座模型中综合表现第一

其中,在评测智能体能力的 Agentic Index 指标上,MiniCPM5-2B 更是断层式领先:总分高达 20 分,同级模型(如 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B)仅 2 分。

这一能力跃升的背后,是面壁智能在数据、模型训练与框架等大模型底层技术上的持续创新,也是面壁智能首创「密度定律」在端侧基础模型上的持续验证。

全球 4B 以下综合表现最优

 

在 AA 榜单上,MiniCPM5-2B 的综合能力得分提升至 23 分,位于全球 4B 参数以下开源模型之首,超越 Gemma 4 12B、Qwen3.5 9B 以及各大主流 3B-4B 级别的模型:

面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

在模型的智能密度上,MiniCPM5-2B 实现了极致的参数效率比——以仅 2B 的参数体量,在智能水平上领先参数规模翻倍的 4B 同级开源模型。

这意味着:MiniCPM5-2B 仅用约一半的参数量,就跑出了近乎翻倍的智能得分,单位参数智能密度极高

面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

在推理效率与输出质量上,MiniCPM5-2B 表现出了 极高的 Token 产出效率:

同样消耗 21k Token(14k 思考 + 7k 答案),MiniCPM5-2B 的智力得分高达 23 分、同级第一。同比 Granite 4.2 3B 消耗 19k Token(12k 思考 + 7k 答案),智力得分仅 14 分;LFM2.5-2.6B 消耗 21k Token(14k 思考 + 7k 答案),智力得分仅 11 分。

也就是说,MiniCPM5-2B 用同等甚至更紧凑的计算成本,实现了几乎两倍的智能高度

面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

在通用 Agent 能力上,MiniCPM5-2B 也体现了高密度端侧语言基础模型的潜力:

根据 AA 榜单成绩,MiniCPM5-2B 获得断层式领先的 20 分,是同级模型(包括 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B)的 10 倍能力增长,初步实现了 高智能密度端侧通用 Agent 能力雏形

面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

除了 AA 榜单,MiniCPM5-2B 在覆盖代码推理、数学推理、指令遵循、综合知识、长文本、工具调用和智能体任务等方向的 34 项基准评测中也有出色表现:

  • 平均得分高达达 53.9 分,排名第一不仅领先同级 2B 模型第二名的 33.2 分,也超过 4B 模型中表现最佳的 Qwen3.5-4B。
  • 具体任务上,代码推理、数学推理、长文本、工具调用、搜索智能体、通用智能体等多个领域上均领先同级 2B 乃至参数规模更大的 3B-4B 行业主流模型。

面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

以 1000 分为人类基线,MiniCPM5-2B 在真实任务评测中获得 891 分,居于 4B 以下模型榜首,同时远高于参数规模约为其 6 倍的 Gemma 4 12B(647 分),更接近人类水平。

面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

MiniCPM5-2B 在智能密度与 Token 消耗上的表现,进一步验证了面壁智能首创「密度定律」的科学性,也体现了其在算力与显存有限的手机、车机、PC、机器人等端侧设备上兼顾性能与成本的落地优势。

数据治理,让智能更高效

MiniCPM5-2B 高效平衡性能与成本的背后,是 对每一个模型参数潜力的极致挖掘。支撑这一结果的,是面壁智能自 2023 年以来率先积累多年的 数据治理 经验与成果。

受限于算力、显存等因素,目前能够部署到端侧设备上的模型参数规模有限,因此每一个参数的智能密度都直接决定了端侧智能的上限。数据治理是提高智能密度的关键。

MiniCPM5-2B 基于面壁智能 UltraData 的 L0 至 L4 分级数据治理体系,在通用网页、数学、代码、SFT、RL 等多个维度上提出了完善的数据治理方案。伴随 MiniCPM5-2B 一同新开源的,还有 4 个数据集:UltraData-CodeUltraData-SFT-Agent-2609UltraData-RL-2609、UltraX

  • UltraData-Code

面向代码预训练与能力优化,覆盖 UltraData L0 至 L3 分级代码数据。项目从约 1.92 亿个公开 GitHub 仓库中采集原始数据,经过清洗去重、算法代码筛选和任务导向的结构化合成,分别形成约 400B 词元的 L2 算法代码精筛数据和约 150B 词元的 L3 任务导向合成数据。

面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

  • UltraData-SFT-Agent-2609

用于 MiniCPM5-2B 后训练阶段的智能体能力优化,包含约 50 万条训练样本,覆盖工具调用、网页搜索、代码生成、Office 文档处理、数据库交互等任务,可有效提升端侧模型智能体能力。

  • UltraData-RL-2609

该数据是 MiniCPM5-2B 强化学习阶段的核心数据集,包含超过 8 万条覆盖数学推理、代码生成、通用知识问答和长文本理解的高质量样本。针对题目不可验证、奖励标签不可信以及难度与模型能力不匹配等问题,数据集通过可验证性过滤、奖励可信性校验和难度匹配三阶段流程进行严格清洗,为 RL 训练提供高信噪比的奖励信号和可靠的数据基础。

  • UltraX:

UltraX是一个面向大规模预训练数据的函数调用式精炼框架。它通过轻量化模型逐条地对数据生成处理脚本,实现低成本、细粒度且可追溯的数据清洗。UltraX 包含五个数据子集,合计约 100B 词元、1.14 亿条样本,可有效提升预训练数据质量。

目前,UltraData 数据集在开源社区已得到广泛验证。截至 2026 年 9 月,UltraData 系列数据集累计下载量超过 266 万次,累计开源数据集数量已超过 10 个。

面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

可扩展的强化学习

此次,随着 MiniCPM5-2B 的开源,面壁智能与 OpenBMB 还开源了全新的自研强化学习框架 Meshy 与基于奖励的强化学习策略 JustRL II。

在训练框架侧,Meshy 彻底去掉了 RL 训练的中央控制器和 Ray 依赖,将训练、推理、奖励计算等全部建模到对等服务,利用 TransferQueue 中的数据就绪状态来驱动实际控制流,能够简单的在同步、异步、全异步三种训练模式中灵活切换,便于扩展。

在算法层面,端侧模型做长思维链强化学习,常常训练过程中分数不升反降:一方面训练数据里噪声多、难度不匹配,奖励信号容易带偏模型;另一方面 GRPO 信用分配太粗糙,面对上万词元的推理链,分不清哪步对、哪步错。为此,MiniCPM 团队提出 JustRL II :数据上,用三阶段流水线筛选校准训练数据;算法上,给 GRPO 装上 Critic,实现词元级信用分配。在 JustRL II 加持下,MiniCPM5-2B 在 RL 后训练中获得了显著的性能收益。

面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

多款芯片 Day0 适配,加速产业落地

为加速产业落地,MiniCPM5-2B 已与英特尔、瑞芯微、Arm 等多家芯片或计算平台厂商完成了 Day0 首日原生适配,在多款芯片上表现出色。

在英特尔平台上,依托酷睿 Ultra 系列 XPU 全异构算力(CPU、GPU、NPU)以及 OpenVINO™ 工具套件,对 MiniCPM5‑2B 开展算子、图融合、内存调度全链路深度优化。相较于基准版本,预填充 (Prefill) 和解码 (Decode) 性能均得到大幅提升;可显著压低运行内存占用,大幅削减长上下文推理时延,以低功耗稳定跑通深思考推理、工具调用、深度搜索、代码生成全套端侧 Agent 能力。开发者基于英特尔 AI PC 可实现开箱即用的本地化部署,从底层硬件、优化工具链到上层 Agent 应用形成完整闭环,充分释放 MiniCPM5‑2B 端侧 AI 的全部产业潜力。

在瑞芯微平台上,MiniCPM5-2B 可以基于 RK3588+RK1828 双芯平台实现完整端侧部署,依托瑞芯微 RKNN3 完整工具链完成模型量化、算子深度优化,依托 RK182X 系列的高带宽优势有效降低大模型首 token 时延,在端侧硬件上稳定运行,完整复现包括深思考推理、工具调用、深度搜索、代码生成等端侧 Agent 核心能力。

在 Arm 计算平台上,MiniCPM5-2B 现已能够在搭载启用第二代可伸缩矩阵扩展 (SME2) 技术的 Armv9 计算平台的移动设备上实现高效运行。内置于 Armv9 CPU 架构,Arm SME2 可在 CPU 上直接实现 AI 加速,能够在 AI 异构计算框架下,高效支持各类实时移动端推理任务。实际测试结果显示,在启用 SME2 技术的移动设备上运行 MiniCPM5-2B 时,预填充(prefill)与解码(decode) 阶段的性能分别实现了约 1.7 倍和 1.2 倍的提升,有利于为用户带来更加流畅、智能的端侧 AI 体验。

数据、框架、训练方法均开源

面壁智能与 OpenBMB 本次联合开源,不仅开源 MiniCPM5-2B 模型本身,还同时开源模型背后的训练 Recipe(配方)、框架与数据。

近年来,面壁智能联合 OpenBMB 开源社区持续推进基础模型技术开放。截至 2026 年 8 月,MiniCPM 系列模型开源下载量已突破 5000 万,语言基础模型 MiniCPM 开源下载量突破 1300 万。

面壁智能开源 MiniCPM5-2B:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

目前,MiniCPM5-2B 已接入主流开发工具链,并适配多种模型开发与部署工具。

模型训练与微调方面,MiniCPM5-2B 支持 LlamaFactory、ms-swift 等工具;在推理部署上,支持 SGLang、vLLM、llama.cpp、Ollama、Hugging Face Transformers 等主流框架,并兼容面壁智能自研的 Arclight CPU 推理框架。开发者可以根据设备类型、算力条件和应用需求,选择适合的部署与开发方案。

以开源推动中国 AGI 技术的发展,是面壁智能与 OpenBMB 一直以来的共同追求。未来,面壁智能也将继续秉持开源开放的理念,加速人工智能的落地与普惠,让更强的端侧智能走进更广泛的真实场景。

目前,MiniCPM5-2B 模型、数据与框架均已开源,开发者可通过以下地址获取。

➤ MiniCPM5-2B 开源链接 (含模型与 UltraData 系列数据)

HuggingFace:

🔗 https://huggingface.co/collections/openbmb/minicpm5

GitHub:

🔗 https://github.com/OpenBMB/MiniCPM

➤ Meshy 框架开源链接

GitHub:

🔗 https://github.com/OpenBMB/Meshy

博客:

🔗 https://maydomain.notion.site/meshy-blog-zh

➤ JustRL II 强化学习算法

🔗 https://panhaoxuan.notion.site/justrl-ii-small-llms-to-128k-reasoning-with-a-critic-cn

本文作者@面壁智能。原文链接:https://mp.weixin.qq.com/s/QjIQhrayJK47SAN2E5TpdA

AI情报

百度开始抢“AI总入口”了

2026-9-7 19:46:57

AI情报

腾讯文档「AI工作台」上线!全面接入WorkBuddy Agent底座

2026-9-8 12:21:08

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧