7 月收尾:云原生 AI 平台的半年里程碑与下半年路线
一、半年数据:从零到日均 480 万推理请求
一月的时候,这个平台还只是三个模型跑在几台 GPU 节点上的原型系统。到七月底,平台承载的在线模型 26 个,日均推理请求 480 万次,GPU 节点 32 台,日均成本 $1,240。对应的团队规模是 6 个人。
数字本身不说明问题。核心问题是:这半年的建设到底解决了哪些能力瓶颈,还有哪些关键能力缺失。七月作为上半年的收尾月,适合做一次整体复盘,把半年的交付串成一条线。
二、半年能力建设全景
第一阶段(1-2 月):让模型能跑起来
第一阶段的目标简单:选型推理引擎、搭建 K8s GPU 调度、把 3 个模型部署上线。关键技术决策是选择 vLLM 而非 TGI 作为主力推理引擎(六月完成了全量迁移),原因在前面的月报里已详细说明。
这个阶段的遗留问题是:模型能跑起来,但不保证跑得好。可用率 98.2%、GPU 利用率 25%、没有批处理——属于"能用"但远不到"好用"。
第二阶段(3-4 月):让服务质量可度量、可优化
多模型推理网关是第二阶段最关键的交付。它解决的问题是:不同模型有不同的延迟特征、上下文窗口和成本结构,但应用层不应该关心这些差异。网关负责请求路由、负载均衡和自适应批处理。
这个阶段同时建立了服务质量监控体系。TTFT、TPS、显存利用率三个指标构成了模型服务的核心 SLA 看板。监控体系的建设带来一个预期之外的收益:排障时间明显缩短——以前要翻 5 个不同系统的日志,现在一张 Grafana 面板能看到全链路状态。
第三阶段(5-6 月):成本优化不是省钱,是把钱花对地方
GPU 是 AI 平台最贵的资源。第三阶段的 GPU 分时复用和训练/推理混合调度不是在"省 GPU",而是让 GPU 从"一卡一用"变成"一卡多用"。GPU 利用率从 25% 提到 62%,等效释放了约 10 台节点的算力。
Scale-to-Zero 是另一个成本管控的关键能力。低频模型长期常驻消耗资源但没有产出,自动缩放到零后用多少付多少。这个阶段也上线了 Spot 实例的自动切换策略,在有 fallback 保证的前提下,进一步降低推理服务的基础成本。
第四阶段(7 月):稳定性治理和技术债务清理
七月做的事情和前面三个阶段不同——不是在"加新能力",而是在"修旧地基"。三次存储故障的修复、CI/CD 流水线从 12 分钟到 5 分钟、工具链的瘦身评估、性能调优清单——这些都是基础设施层面的精细化运维。
三、下半年的路线:三个必须填上的坑
半年交付了 20+ 个能力,但差距仍然明显。下半年必须解决三个关键问题:
3.1 跨集群 GPU 池化
当前所有 GPU 节点在一个集群内,当这个集群资源耗尽时,无法将推理负载自动迁移到其他集群。这意味着单集群的 GPU 容量上限就是整个平台的能力天花板。下半年的目标是为推理服务建立跨集群的统一调度层,基于 Karmada 或自研调度器实现跨集群的 GPU 资源池化和负载迁移,消除单集群资源瓶颈。
3.2 推理服务质量从"返回结果"到"返回正确结果"
当前的服务质量指标衡量的是技术性能——延迟、可用率、吞吐。但这些指标回答不了"模型给出的回答是否准确"。下半年计划建立内容质量自动评估管线,至少覆盖三个维度:幻觉率(事实性错误)、格式遵从率(结构化输出的一致性)和风格一致性。
3.3 多租户资源隔离
当前所有推理服务共享 GPU 池,没有租户级的资源隔离。当一个模型的流量暴涨时可能挤占其他模型的计算资源。下半年计划基于 K8s ResourceQuota 和优先级抢占机制,建立租户级的资源保障体系,让每个业务线都有明确的算力 SLA。
四、团队能力的增长与缺失
半年做了不少事情,但团队的短板也清楚了:
- 强项:基础设施搭建和运维、GPU 调度调优、Go 后端服务开发。
- 弱项:模型评估和 Prompt Engineering 的方法论积累不足、训练侧的 GPU 调优(NCCL 参数、FSDP 分片策略)还处于摸索阶段。
- 缺失:没有专门做 AI 安全和对齐的人,模型的安全评测(越狱攻击、有害内容过滤)目前是空白。
下半年的团队扩充计划优先考虑两个方向:一个是训练侧的性能优化工程师(补齐 NCCL/FSDP 的短板),另一个是 AI Safety 方向的工程师(建立安全评估体系)。
五、结语
半年时间,团队把一个原型系统跑成支撑 26 个模型、日均 480 万推理请求的平台。GPU 利用率从 25% 提到 62%,推理吞吐提升 22%,CI/CD 从 12 分钟压到 5 分钟,可用率从 98.2% 提到 99.7%。这些数字背后是无数个深夜的排障、一次又一次的配置调整和不断迭代的架构决策。
但也要清醒地看到:跨集群调度还没做、内容质量评估还是空白、多租户隔离只存在于文档中。下半年的重点是填上这三个坑,把平台的成熟度从"能用"推到"可规模化运营"。
基础设施不需要漂亮话。上半年的成绩是数据说话,下半年的目标也要用数据来验证。七月是上半年的终点,但不是建设的终点——八月已经开始,新的能力必须在新的数据中得到证明。