MiniCPM5-2B 是面壁智能 OpenBMB 团队于 2026 年 9 月 7 日开源的 2B 级端侧大语言模型,是 MiniCPM5 系列在 5 月发布的 1B 版本之后的第二款模型,采用标准 Llama 架构的稠密 Transformer,总参数量约 25.2 亿,原生支持 131072 Token 上下文,以 Apache 2.0 协议开放权重。官方公开的评测数据显示,它在同尺寸开源模型对比集中平均分 53.9,超过对比集中所有 4B 级模型的最高分 51.1,优势集中在代码、数学、长文本理解、工具调用和 Agent 任务。本文拆解它的架构参数、训练配方中的 RL + OPD 蒸馏方法、vLLM/SGLang/Transformers 三种部署方式、GGUF/MLX/GPTQ 等发行版本的选择,以及端侧小模型和云端大模型在实际业务中该如何搭配。
MiniCPM5-2B 是什么:面向本地部署的 2B 级稠密模型
MiniCPM5-2B 是 OpenBMB 面壁智能开源的端侧大语言模型,定位是"小而强"——在本地助手、编程 Agent、工具调用工作流和推理场景中,用 2B 的体量提供接近更大模型的能力,同时保持可以在消费级设备上运行的部署占用。
官方公布的核心参数:
| 项目 | 参数 |
|---|---|
| 架构 | 标准 LlamaForCausalLM 稠密 Transformer |
| 总参数量 | 2,516,756,480(非嵌入参数 1,981,982,720) |
| 层数 | 42 |
| 注意力头(GQA) | 16 个 Query 头 / 2 个 KV 头 |
| 上下文长度 | 131,072 Token |
| 开源协议 | Apache 2.0 |
| 发布时间 | 2026 年 9 月 7 日 |
它和 5 月发布的 MiniCPM5-1B 采用同一套训练配方,只是把规模放大到 2B,官方的定位是"给能承受更大部署占用、换取更强能力的用户"。截至 2026 年 9 月 8 日,MiniCPM 仓库在 GitHub 上已有 1 万多颗 Star。
评测成绩:2B 级开源 SOTA,并越级压过 4B 模型
按官方公布的对比数据,MiniCPM5-2B 在同尺寸对比集中拿到 2B 级开源 SOTA,并且平均分超过了对比集里列出的所有更大模型。
- 同尺寸对比对象:LFM2.5-2.6B、Qwen3.5-2B、Gemma-4-E2B-it
- 越级参考对象:Qwen3.5-4B、granite-4.2-3B、Nemotron-3-Nano-4B、Gemma-4-E4B-it、LFM2.5-8B-A1B
- 平均分:MiniCPM5-2B 为 53.9,对比集中更大模型的最高分为 51.1
官方特别指出优势集中在五个方向:代码推理、数学推理、长文本理解、工具调用、多类 Agent 任务。需要注意的是,这些数据来自模型发布方自己选定的对比集和评测集,第三方独立复测结果尚未大规模出现,实际业务中建议用自己的任务样本做验证。
训练配方:分层数据管理 + RL 教师 + 在线策略蒸馏
MiniCPM5-2B 的训练是 UltraData 分层数据管理方法的完整实践,分为基础训练、中期训练、后训练三个阶段,并且把各阶段的训练数据一并开源。
三阶段流程:
- 基础训练:经过稳定训练和衰减训练两步,建立核心语言能力;语料以 Ultra-FineWeb、UltraX 等开源数据集为主
- 中期训练:针对目标能力和目标数据分布做强化,代码数据采用 L0–L3 分级管理的 UltraData-Code
- 后训练:先用 400B Token 的深度思考 SFT 数据建立推理和对话能力,再训练数学、代码、Agent、写作等领域的专项 RL 教师模型,最后用在线策略蒸馏(OPD)把多个教师合并回一个发布模型
RL + OPD 带来了什么:
- RL 阶段采用 JustRL II 中描述的基于 Critic 的算法,提升训练稳定性
- OPD 合并了 16 个 RL 训练出的专家模型,其中 5 个是 Agent 专家
- 按官方数据,RL + OPD 让推理与通用能力平均提升 10.96 分,Agent 能力提升 6.96 分
- OPD 直接复用各 RL 教师的训练 Prompt 做蒸馏数据,不需要额外构建语料
随模型一起开源的数据集包括 UltraX(网页预训练)、UltraData-Code(分级代码数据)、UltraData-SFT-Agent-2609(50 万条 Agent 训练样本)、UltraData-RL-2609(8 万多条 RL 样本),这在小模型发布中并不常见,对想复现或二次训练的团队价值较高。
怎么部署:vLLM、SGLang、Transformers 三种方式
官方 README 给出三种主流部署路径,其中工具调用场景推荐 SGLang。
vLLM:
pipinstall"vllm>=0.21"vllm serve openbmb/MiniCPM5-2B--port8000SGLang(工具调用推荐):
pipinstall"sglang[srt]>=0.5.16"python-msglang.launch_server --model-path openbmb/MiniCPM5-2B--port30000\--tool-call-parser minicpm5MiniCPM5-2B 输出的是 XML 风格的工具调用,SGLang 内置的minicpm5解析器会把它转换为 OpenAI 兼容的tool_calls格式,现有 Agent 框架基本可以直接对接。
Transformers:
fromtransformersimportAutoModelForCausalLM,AutoTokenizer model_id="openbmb/MiniCPM5-2B"tokenizer=AutoTokenizer.from_pretrained(model_id)model=AutoModelForCausalLM.from_pretrained(model_id,torch_dtype="auto",device_map="auto")messages=[{"role":"user","content":"请简单介绍一下你自己。"}]inputs=tokenizer.apply_chat_template(messages,tokenize=True,add_generation_prompt=True,enable_thinking=True,return_dict=True,return_tensors="pt",).to(model.device)outputs=model.generate(**inputs,max_new_tokens=128)print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:],skip_special_tokens=True))要求transformers>=5.6。官方推荐采样参数为temperature=1.0, top_p=0.95,enable_thinking=True开启深度思考模式。
**投机解码加速:**官方同时发布了 MiniCPM5-2B-DSpark 草稿模型(约 0.3B),在 SGLang 中通过--speculative-algorithm DSPARK启用,可以在不改变目标模型输出的前提下加速解码。
发行版本怎么选:BF16、GGUF、MLX、GPTQ
Hugging Face 上的 MiniCPM5 collection 提供了多种格式,对应不同硬件:
| 版本 | 适用场景 |
|---|---|
| MiniCPM5-2B(BF16) | NVIDIA GPU 服务端部署,vLLM/SGLang 首选 |
| MiniCPM5-2B-GGUF | llama.cpp 生态,CPU 或低显存设备 |
| MiniCPM5-2B-MLX | Apple Silicon Mac 本地运行 |
| MiniCPM5-2B-GPTQ | 量化后的 GPU 部署,降低显存占用 |
| MiniCPM5-2B-SFT / Midtrain / Base | 二次训练、研究对比用的中间检查点 |
| MiniCPM5-2B-DSpark | 投机解码草稿模型,配合主模型使用 |
从 Hugging Face 页面的下载量看,GGUF 版本在发布首日下载量已明显高于 BF16 原版,说明本地端侧运行是当前用户的主要用法。ModelScope 魔搭社区同步提供了全部版本,国内下载可优先走魔搭。
端侧小模型和云端大模型怎么搭配
MiniCPM5-2B 这类端侧模型的意义不是替代云端大模型,而是把一部分任务下沉到本地——低延迟、离线可用、数据不出设备,同时把复杂任务留给云端更大的模型处理。
典型的分工方式:
- 端侧承担:意图识别、简单问答、本地文档摘要、工具调用的路由与参数抽取、隐私敏感的预处理
- 云端承担:复杂多步推理、长篇生成、需要最新知识的问答、对质量要求高的最终输出
这种"端云协同"架构对云端接入层的要求是接口标准化和多模型可切换——端侧模型走 OpenAI 兼容接口,云端也走同样的接口,路由逻辑才能统一。国内可直接访问的七牛云AI大模型广场这类统一接入平台,汇聚多款主流大模型并按能力标签组织,可以作为端侧模型之上的云端能力补充,用同一套接口规范承接本地处理不了的任务。
常见问题
MiniCPM5-2B 需要多少显存?
官方 README 没有给出显存的具体数字。按 25 亿参数估算,BF16 权重约 5GB,加上 KV 缓存后消费级显卡可以运行;GGUF 量化版本可在 CPU 或更低显存设备上运行,具体占用取决于量化位宽和上下文长度。
MiniCPM5-2B 和 MiniCPM5-1B 该选哪个?
两者训练配方相同,区别在规模。官方定位 2B 版给"能承受更大部署占用、换取更强能力"的用户;设备资源紧张或只需要轻量任务,选 1B;需要更好的代码、数学和 Agent 表现,选 2B。
MiniCPM5-2B 可以商用吗?
可以。模型以 Apache 2.0 协议开源,允许商用和修改,只需保留协议声明。
MiniCPM5-2B 支持工具调用吗?
支持。模型输出 XML 风格的工具调用,官方推荐用 SGLang 作为后端,内置解析器可以把它转换为 OpenAI 兼容的 tool_calls 格式,接入现有 Agent 框架不需要额外适配。
MiniCPM5-2B 支持多长的上下文?
原生支持 131,072 Token,官方在评测中把长文本理解列为其优势方向之一,适合本地长文档处理场景。
结语
MiniCPM5-2B 的发布延续了面壁智能"端侧小模型"的路线,值得关注的不只是 2B 级 SOTA 的成绩,更是它把训练数据、RL 教师方法和中间检查点一并开源的做法,给小模型社区提供了可复现的完整配方。以上信息来自 OpenBMB 官方 GitHub README 和 Hugging Face 模型页,截至 2026 年 9 月 9 日,评测数据为发布方自测结果,第三方复测尚待补充。
延伸阅读
- MiniCPM GitHub 仓库:https://github.com/OpenBMB/MiniCPM
- MiniCPM5 Hugging Face Collection:https://huggingface.co/collections/openbmb/minicpm5
- MiniCPM5-2B 模型页:https://huggingface.co/openbmb/MiniCPM5-2B
- UltraData 分层数据管理论文:https://arxiv.org/pdf/2602.09003
- 七牛云AI 大模型广场:https://www.qiniu.com/ai/models