如何本地部署Kimi K2.5:vLLM与SGLang完全教程(含H200 TP8配置与常见坑)
【免费下载链接】Kimi-K2.5Open Visual Agentic Intelligence项目地址: https://gitcode.com/gh_mirrors/ki/Kimi-K2.5
本文带你用 vLLM 或 SGLang 在本地部署Kimi K2.5——月之暗面开源的 1 万亿参数原生多模态 Agent 大模型。文章覆盖 H200 TP8 推荐配置、关键参数说明与新手最容易踩的坑,照着做即可跑通。
🎯 先认识一下 Kimi K2.5
Kimi K2.5 是基于 Kimi-K2-Base 在约 15 万亿图文混合 Token 上持续预训练得到的开源原生多模态智能体模型,支持视觉理解、即时(Instant)与思考(Thinking)双模式、对话与 Agent 范式。核心规格如下:
| 规格 | 说明 |
|---|---|
| 架构 | Mixture-of-Experts(MoE) |
| 总参数 | 1T(激活 32B) |
| 专家数量 | 384 个专家,每 Token 选 8 个 |
| 上下文长度 | 256K |
| 注意力机制 | MLA |
| 视觉编码器 | MoonViT(400M) |
| 量化方式 | 原生 INT4 量化 |
完整的模型介绍、评测榜单(AIME 2025 得分 96.1、SWE-Bench Verified 76.8 等)可查阅 README.md,更深入的技术细节见 tech_report.pdf。
💡 由于采用原生 INT4 量化,权重体积大幅缩小,8 卡 H200 即可承载整个模型。
📋 部署前:环境与硬件清单
硬件参考:官方示例为单节点 8×H200(张量并行 TP8)。显存紧张的机器可以关注后文的 KTransformers CPU+GPU 异构方案。
软件要求:
- 推理引擎推荐三选一:vLLM、SGLang、KTransformers
transformers最低版本要求4.57.1- 注意:
kimi_k2reasoning parser 等特性目前合入的是nightly / 最新版引擎,稳定旧版本可能无法识别该模型,建议直接使用 nightly 构建(详见 docs/deploy_guidance.md)
🚀 vLLM 部署:一行命令拉起 H200 TP8 服务
第 1 步:安装 nightly 版 vLLM
模型目前仅提供在 vLLM 的 nightly wheel 中:
uv pip install -U vllm \ --torch-backend=auto \ --extra-index-url https://wheels.vllm.ai/nightly第 2 步:启动 H200 单节点 TP8 服务
vllm serve $MODEL_PATH -tp 8 \ --mm-encoder-tp-mode data \ --trust-remote-code \ --tool-call-parser kimi_k2 \ --reasoning-parser kimi_k2关键参数速读
| 参数 | 为什么必须加 |
|---|---|
-tp 8 | 张量并行切分到 8 张 H200,这是承载 1T 参数的基础 |
--tool-call-parser kimi_k2 | 开启工具调用(Function Calling)所必需 |
--reasoning-parser kimi_k2 | K2.5 默认开启思考模式,缺少它会导致推理内容解析错误 |
--mm-encoder-tp-mode data | 多模态编码器的并行模式设置 |
--trust-remote-code | 加载模型自带的自定义代码 |
⚡ SGLang 部署:最快上手方式
SGLang 的最新 main 分支已支持 Kimi K2.5,安装更简单:
pip install "sglang @ git+https://github.com/sgl-project/sglang.git#subdirectory=python" pip install nvidia-cudnn-cu12==9.16.0.29同样是 H200 单节点 TP8,启动命令与 vLLM 几乎一致:
sglang serve --model-path $MODEL_PATH --tp 8 \ --trust-remote-code \ --tool-call-parser kimi_k2 \ --reasoning-parser kimi_k2🔑 两个 parser 参数在 SGLang 下同样是必选项:
--tool-call-parser用于工具调用,--reasoning-parser用于正确解析思考(reasoning)内容。
🖥️ 显存不够?KTransformers CPU+GPU 异构方案
如果买不到 8 张 H200,KTransformers 支持CPU+GPU 混合推理(MoE 专家拆到 CPU,注意力留在 GPU)。官方在 8×L20 + 2×Intel 6454S 上实测:
- Prefill:640.12 tokens/s
- Decode:24.51 tokens/s(48 路并发)
启动方式为python -m sglang.launch_server并追加--kt-amx-method AMXINT4、--kt-cpuinfer 64等 KTransformers 专属参数,完整命令可直接参考 docs/deploy_guidance.md 中的 KTransformers 一节。
✅ 部署后:验证与调用要点
服务启动后,它提供OpenAI 兼容 API,可直接用openaiSDK 调用。几个容易忽略的配置细节:
- 采样参数:Thinking 模式建议
temperature=1.0;Instant 模式建议temperature=0.6;top_p统一建议0.95 - 切换到即时模式(Instant):vLLM / SGLang 部署下需在请求
extra_body中传{'chat_template_kwargs': {"thinking": False}} - 视频输入为实验性能力,目前仅官方 API 支持
- 验证部署是否正确,可使用官方的 Kimi Vendor Verifier 工具
调用示例(含图片输入、思考/即时模式切换)见 README.md 第 6 节 "Model Usage"。
🕳️ 常见坑清单(新手必看)
| 症状 | 原因与解决 |
|---|---|
| 启动报模型架构不识别 | 用了稳定旧版引擎。K2.5 相关特性仍在nightly / 最新 main中,请升级 |
| 回复里思考过程混进正文 | 漏加--reasoning-parser kimi_k2(vLLM、SGLang 都要加) |
| 工具调用(Function Calling)失败 | 漏加--tool-call-parser kimi_k2 |
| OOM 显存不足 | 确认使用原生 INT4 量化权重,并保证 TP8 切分;或用 KTransformers 异构方案 |
| 输出格式异常 | transformers版本低于 4.57.1,请先升级 |
| 想让模型快速回答别思考 | 通过extra_body传chat_template_kwargs.thinking=False切换 Instant 模式 |
📚 延伸阅读与资料路径
- 部署命令与参数原始出处:docs/deploy_guidance.md
- 模型介绍、评测结果与 API 调用示例:README.md
- 完整技术报告:tech_report.pdf
- 开源协议(代码与权重均为 Modified MIT):LICENSE
📌 提示:推理引擎更新频繁,官方给出的命令仅为示例而非最优配置,追求更高吞吐时请持续关注 vLLM / SGLang 上游的最新实践。
总结:Kimi K2.5 本地部署的核心就三件事——装 nightly 引擎、按 H200 TP8 配置启动、别忘两个kimi_k2parser 参数。搞定这三步,你就拥有了一台可多模态、可思考、可调工具的私有 Agent 大脑。
【免费下载链接】Kimi-K2.5Open Visual Agentic Intelligence项目地址: https://gitcode.com/gh_mirrors/ki/Kimi-K2.5
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考