Kimi K3由 Moonshot AI 于 2026 年 7 月发布,是截至目前规模最大的开放权重模型。作为一个混合专家模型(Mixture of Experts,MoE),Kimi K3 拥有 2.8 万亿个总参数,但每次推理仅激活约 1040 亿个参数。与其他前沿开放权重模型相比,其激活参数占总参数的比例很低,仅为 3.7%。这种架构让模型具备很高的潜在智能水平,同时不必在单次请求中激活太多参数。
不过,激活参数相对较少,并不意味着 Kimi K3 更容易下载并在本地运行。要存放全部模型权重,仍然需要极其庞大的内存。本文将介绍运行 Kimi K3 究竟需要哪些资源,以及在什么情况下,租用 GPU 自托管会比使用无服务器推理更划算。
参数数量并不能说明全部问题
多数模型使用 16 位精度进行训练。如果为了节省显存而使用 4 位精度运行,模型能力通常会有所下降。
Kimi K3 则在设计上采用原生微缩放 4 位浮点格式(Microscaling Floating Point 4,MXFP4),并通过量化感知训练(Quantization-Aware Training,QAT)得到 4 位发布权重,因此可以在不进行有损压缩的情况下提高运行效率。
在 Kimi K3 的量化感知训练过程中,每次前向传播都会先把权重舍入到 4 位精度,然后再使用这些权重。这样一来,模型优化的损失函数本身就包含量化造成的差异。因此,模型是在训练过程中直接学习如何以 4 位精度良好运行,而不是在使用时从 16 位降低至 4 位,并被动接受由此产生的误差。
Kimi K3 也可以使用 8 位或 16 位精度运行,但这样做不是为了提高模型质量,主要是出于硬件或软件兼容性的考虑。FP4主要面向推理。如果需要微调模型或继续训练,则仍然需要使用更高精度。
估算模型权重所需内存的基本方法,是用模型总参数量乘以计划采用的量化位数,再除以 8。之所以除以 8,是因为内存容量通常使用字节计量,而一个字节等于 8 位。
以 Kimi K3 为例:
2.8 万亿参数 × 4 位 ÷ 8 = 1.4 TB
也就是说,仅加载模型权重就大约需要 1.4 TB 内存。
如果要使用 8 位或 16 位精度运行,内存需求将分别增加至两倍或四倍。对于 Kimi K3,使用更高精度的主要原因,是在不支持原生 FP4 的硬件上运行,或者使用比当前 FP4 内核更成熟的软件栈,而不是为了获得更高的推理质量。
相比之下,Kimi K2的不同版本只有 1 万亿个参数,但其全精度权重采用 BFloat16(BF16),需要约 2 TB 内存,比 Kimi K3 的原生 4 位权重大约多 600 GB。
除此之外,推理期间还需要额外内存存放键值缓存(Key-Value Cache,KV Cache)、激活值以及运行时开销。
Kimi K3 的架构让实际运行成本低于其规模所暗示的水平
像 Kimi K3 这样庞大的模型之所以还能以经济可行的方式提供推理服务,是因为在处理单个 Token 时,模型中的绝大部分参数都不会参与计算。多项效率创新使其成本模型得以成立。
MoE 的稀疏性让每个 Token 只激活 896 个专家中的 16 个,再加上两个共享专家。与此同时,模型采用分位数平衡路由(Quantile Balancing Routing),以确定性方式把 Token 分配给不同专家,避免浪费专家容量。
Kimi Delta Attention(KDA)使用固定大小的注意力状态,而不是为每个 Token 分别维护 KV 缓存,因此最多可以减少约 75% 的 KV 缓存内存占用。
Attention Residuals允许神经网络中的每一层通过学习得到的权重,调用此前特定层的输出。Stable LatentMoE则是 Kimi K3 的混合专家框架,其中的专家在经过压缩的潜在空间中运行,从而降低计算成本。
KDA、Attention Residuals 和 Stable LatentMoE 结合使用,使 Kimi K3 的整体扩展效率相比 Kimi K2 提高约 2.5 倍。
为什么单张 GPU 无法运行 Kimi K3?
对于单个用户的 Kimi K3 推理请求,根据上下文长度不同,KV 缓存还需要约 2~15 GB 内存,激活值约需 30 GB,运行时开销也约为 30 GB。加上 1.4 TB 的模型权重,总内存需求约为 1.5 TB。
单张 GPU 显然无法满足要求,因此只能采用多 GPU;如果要实现符合生产环境需求的扩展能力,通常还需要多节点部署。
按照基础容量估算,H100 配备 80 GB 显存,H200 配备 141 GB 显存,因此分别需要大约 19 张 H100 或 11 张 H200。
不过,Hopper 架构以及 AMD MI300X 虽然可以加载 4 位权重,却需要在运行时对其进行反量化。这样能够保留一部分显存节省,但无法充分发挥 Kimi K3 原生 4 位架构带来的速度优势。
更合理的方案,是使用较新一代的 Blackwell B200、B300,或者 AMD MI350X、MI400 系列 GPU,直接以原生方式执行 MXFP4(4 位)计算。
因此,自托管 Kimi K3 不只是一个“需要多少张 GPU”的问题,也涉及 GPU 硬件代际的选择。
根据 vLLM 团队发布的 Kimi K3 部署指南,目前较直接的部署方式是使用8 张 NVIDIA B300 或 8 张 AMD MI355X GPU,并将张量并行规模设置为 8。AMD GPU 使用 ROCm 软件栈;具体驱动、镜像和内核要求则应以对应的部署配置为准。
另外,由于 KDA 独特的前缀缓存机制不像标准 vLLM 那样为每个 Token 维护 KV 缓存,普通前缀缓存无法直接与其无缝配合。
Kimi K3 的开发方 Moonshot 为 vLLM 贡献了一套定制实现,专门解决这一问题。因此,如果要自行托管 Kimi K3,需要使用包含 K3 专用代码的较新版本 vLLM。
用GPU服务器自己部署,还是使用 API?
Kimi K3 官方 API 的价格为:
- 输入:每百万 Token 3 美元;
- 缓存输入:每百万 Token 0.30 美元;
- 输出:每百万 Token 15 美元。
DigitalOcean 云平台的无服务器推理(Serverless Inference)当前提供相同的输入和输出价格,即每百万 Token 3 美元和 15 美元。
能够原生运行 FP4 的最低成本单节点方案,大约由 8 张 MI350X 组成,每张 GPU 每小时约 4.76 美元。整台节点的费用约为每小时 38 美元。如果使用长期运行的预留 GPU Droplet 云服务器,每月成本约为 27,800 美元,无论是否有人发送推理请求,这笔费用都会持续产生。
如果要让无服务器推理的费用达到同样水平,用户每月需要消耗大约 18 亿个输出 Token。按照 API 每百万输出 Token 15 美元的价格计算,相当于全天候持续输出约 700 Token/秒。
实际上,单路请求的 Token 生成速度通常只有每秒数十个;即使在理想条件下,也可能只是每秒数百个。因此,单路请求几乎不可能达到这一盈亏平衡点。
不过,一个计算节点至少可以并行处理 40 个请求。如果每个请求不使用完整的 100 万 Token 上下文,可同时驻留的请求数可以接近 600 个。
| 上下文长度 | 每个请求的 KV 缓存或状态空间 | 可驻留请求数(约 600 GB 内存池) |
|---|---|---|
| 完整 100 万 Token | 约 15 GB | 约 40 个 |
| 128K | 约 2 GB | 约 300 个 |
| 32K | 约 1.5 GB | 约 400 个 |
| 8K | 约 1 GB | 约 600 个 |
重度用户每月可能使用约 5,000 万个 Token。即使全部按照价格更高的输出 Token 计算,通过 API 调用的费用最高也约为 750 美元。
对于单个用户而言,通过 API 使用无服务器推理的成本,大约比租用 GPU 自己部署并运维 Kimi K3 低 40 倍。
但是,当稳定的重度用户超过 40 名,并且每名用户每月使用 5,000 万个以上 Token 时,成本计算会逐渐转向有利于自托管的一侧。这 40 名用户可以是相互独立的个人,也可以表示一套复杂的智能体编排系统,其中包含由单个用户调度的 40 多个智能体。
既然一个节点能够处理 40 个并发请求,是否可以减少 GPU 数量,只为单个用户配置足够的 GPU?
答案是“不行”,原因主要有以下几点。
首先,为此类大型模型提供推理服务时,需要通过张量并行(Tensor Parallelism)把模型的每一层拆分到多张 GPU 上。张量并行通常在 2 张、4 张或 8 张 GPU 上具有更合理的计算结构,而不是使用 6 张 GPU。虽然 6 张可能是容纳权重并满足单用户推理要求的最低数量,但 8 张仍然是更现实的最低配置。
其次,这类 GPU 通常不能按 5~6 张租用,而是以 1 张或 8 张为单位提供。即使能够租到 6 张 GPU,单个用户的 Token 生成速度和实际用量也很难高到足以抵消租用成本。
对于部分用户而言,成本并不是最重要的决策因素。控制能力、一致性、可靠性、数据驻留以及其他要求,都可能让自托管更具吸引力。
在这种情况下,应仔细查看所使用推理服务商的服务条款。许多第三方提供商不会存储推理数据,并且拥有良好的数据隐私记录,因此未必需要为了数据隐私而租用 GPU 自托管。
如果计划自托管 Kimi K3,并将其作为商业服务对外提供,还应查看 Kimi K3 许可证。Kimi K3 没有采用 Apache 或 MIT 许可证,而是使用定制许可证;Kimi K3 允许使用、修改、微调、部署、分发和商业化,但对达到一定规模的“模型即服务”业务以及超大型商业产品附加了条件。
在 DigitalOcean 上运行 Kimi K3 意味着什么?
如果选择使用无服务器推理,DigitalOcean 通过无服务器推理(Serverless Inference) API 提供按 Token 计费的 Kimi K3 服务,输入和输出价格分别为每百万 Token 3 美元和 15 美元,与 Kimi 官方价格一样。
如果选择 GPU 自托管路线,则可以使用 DigitalOcean 的 GPU Droplet 云服务器、专用推理(Dedicated Inference)或长期预留 GPU。
注:DigitalOcean 专用推理为单个用户预留独占 GPU,性能和延迟更稳定,并支持部署自有模型;无服务器推理则按 Token 计费、共享算力且无需管理基础设施。
使用 GPU Droplets 时,用户需要自行管理推理软件栈。使用 Dedicated Inference 时,DigitalOcean 会运行一个托管式 vLLM 端点,用户则负责提供 Kimi K3 模型权重。
DigitalOcean 提供 AMD Instinct MI350X 和 NVIDIA B300 GPU,这两类硬件支持原生 MXFP4 计算,更适合运行采用 4 位权重的 Kimi K3。GPU 型号和区域可用性可能变化,部署前应查看平台的实时资源情况。
| GPU 型号 | 数据中心 |
|---|---|
| AMD Instinct MI350X | 亚特兰大(ATL1)、里士满(RIC1) |
| NVIDIA B300 | 里士满(RIC1)、堪萨斯城(MKC1) |
如果 GPU Droplets 和 专用推理(Dedicated Inference)已达到容量上限,可以联系 DigitalOcean 的销售团队,咨询专用容量。
DigitalOcean 虽然也提供裸金属 GPU,但目前裸金属规格中没有支持原生 FP4 的选项,因此不适合运行 Kimi K3。
总结
对于大多数团队,按 Token 计费的无服务器推理仍是运行 Kimi K3 更经济、简单的方式:无需一次性租用至少 8 张高端 GPU,也不必持续承担模型部署、推理框架和集群运维成本。
只有当业务拥有长期稳定的高并发流量,GPU 能够保持较高利用率,或者对数据驻留、性能一致性、自有权重和基础设施控制有明确要求时,自托管或专用推理才更值得考虑。按照本文采用的价格和负载假设,单个重度用户使用 API 可能比租用 GPU 自托管便宜约 40 倍;当系统需要持续服务数十个高用量用户或智能体时,自托管的成本优势才可能逐渐显现。
因此,Kimi K3 的部署选择不能只比较 Token 单价,还应同时评估并发量、GPU 利用率、上下文长度、运维能力、数据要求和模型许可证。即使未来采用其他大型开放权重模型,本文介绍的“按量 API、专用推理与 GPU 自托管”成本比较方法仍然适用。
本文中说提到的所有型号的 GPU 云服务器,以及无服务器推理服务,DigitalOcean 都有提供,如需协助评估技术方案选型,可直接咨询DigialOcean 中国区战略合作伙伴卓普云(aidroplet.com)。卓普云还会为中国区的DigitalOcean企业用户提供技术支持服务。
相关链接
- Kimi K3 模型卡(Hugging Face)
- vLLM 对生产级 Kimi K3 支持的预览
- DigitalOcean GPU Droplets
- Kimi K3 现已上线 DigitalOcean 无服务器推理