Kimi K2 使用指南:如何部署并读懂 MuonClip 训练的 1T 参数 MoE 模型
【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2
Kimi K2 是 Moonshot AI 开源的混合专家(MoE)大语言模型:1T 总参数、32B 激活参数,由自研 MuonClip 优化器在 15.5T tokens 上完成预训练,全程零 loss spike,SWE-bench Verified 智能体编码得分 65.8。
性能与架构数据:Kimi K2 参数表与核心成绩
先把规格摆出来:Kimi K2 用 384 个专家 + 每 token 只激活 8 个的方式,把 1T 参数的模型压到 32B 激活算力,并采用 MLA 注意力与 128K 上下文。
| 项目 | 数值 |
|---|---|
| 架构 | 混合专家(MoE) |
| 总参数 / 激活参数 | 1T / 32B |
| 层数(含密集层)/ 密集层数 | 61 / 1 |
| 注意力隐藏维度 | 7168 |
| MoE 隐藏维度(单专家) | 2048 |
| 注意力头数 | 64 |
| 专家总数 / 每 token 激活数 | 384 / 8 |
| 共享专家数 | 1 |
| 词表大小 | 160K |
| 上下文长度 | 128K |
| 注意力机制 / 激活函数 | MLA / SwiGLU |
在 Kimi-K2-Instruct 的评测中(非思考模式),它拿到 SWE-bench Verified 65.8(单次尝试)、SWE-bench Multilingual 47.3、LiveCodeBench v6 53.7、GPQA-Diamond 75.1、AIME 2025 49.5、Tau2-Bench 66.1、ACEBench(En) 76.5,多项指标处于开源模型前列。
MuonClip 优化器原理:15.5T tokens 零 loss spike 怎么做到的
大白话结论:Muon 收敛快,但训到大规模时注意力 logits 会爆炸——技术报告里一个 9B 激活/53B 总量的对照实验中,最大注意力 logits 很快冲过 1000,直接引发 loss 尖刺甚至训练发散。MuonClip 的做法就是在每一步训练后检查每个注意力头的最大 logits,一旦超过阈值 τ=100,就按固定比例收缩该头的 query/key 权重,把 logits 压回上限。
术语层面的拆解:MuonClip 整合了四部分——Muon 动量更新 + Newton-Schulz 正交化(匹配 Adam 的 RMS 幅值)、weight decay、与 QK-Clip 组成的稳定机制。Kimi K2 训练时 τ 固定为 100 未再调参:训练前期 logits 被钳在 100 附近,约 30% 训练步后自行衰减回正常区间,损失曲线全程平滑。
本地部署三步走
- 克隆代码库:
git clone https://gitcode.com/GitHub_Trending/ki/Kimi-K2 - 到 Huggingface 下载 block-fp8 格式的权重,提供 Kimi-K2-Base(供微调)与 Kimi-K2-Instruct(对话与智能体场景,推荐 temperature=0.6)两个版本。
- 选择推理引擎启动:官方推荐 vLLM、SGLang、KTransformers、TensorRT-LLM,其中 vLLM 与 SGLang 的启动示例见 docs/deploy_guidance.md;工具调用(tool calling)的接入方式见 docs/tool_call_guidance.md。
延伸阅读:技术报告与官方文档
- 完整技术报告(arXiv: 2507.20534):仓库内 tech_report.pdf,MuonClip 算法与缩放实验细节在第 2 章
- 模型部署:docs/deploy_guidance.md
- 工具调用指南:docs/tool_call_guidance.md
- 许可协议:代码与权重均为 Modified MIT,见 LICENSE
【免费下载链接】Kimi-K2Kimi K2 is the large language model series developed by Moonshot AI team项目地址: https://gitcode.com/GitHub_Trending/ki/Kimi-K2
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考