1. 算力密度飙升背后:机房供电正在拖后腿
过去几年我参与过不少数据中心的改造项目,有一个现象特别明显:IT设备的演进速度,已经远远把供电系统甩在了后面。五年前我们做机房设计,单机柜按 4kW 到 6kW 规划已经算比较超前,很多传统机房甚至按 2kW 到 3kW 去预留。等到 GPU 服务器、AI 训练集群开始大规模上架,单机柜功率密度瞬间被拉到 20kW、30kW 甚至更高,原有的供配电架构立刻变得捉襟见肘。
大数据和算力这两个词听起来很抽象,落到机房层面就是三件事:算得更快、散得更多、耗得更多。算得更快对应芯片工艺和互联技术的升级,散得更多对应液冷这类新型散热方式的引入,而耗得更多,直接冲击的就是供电制式本身。这轮变革不像以前换个更大功率的 UPS 就能解决,它动的是整个供电链条的地基——从变压器、低压配电柜、UPS、列头柜,到末端插接母排和机柜配电单元,每一环都需要重新审视。
1.1 机柜功率从千瓦跨向百千瓦的冲击
我印象最深的是某智算中心项目,他们首批上架的机柜平均功率已经到 30kW 以上,规划中还要支持后续向 50kW 到 100kW 演进。当时我们拿原有设计图纸一核对,发现问题是连锁的:UPS 容量不够可以加并机柜,但机房供电进线容量不够就需要改造高压侧;末端列头柜的开关和母排载流量不足,则需要重新敷设电缆;甚至连防雷接地和等电位联结的规格都变了。
传统数据中心供电制式源于电信机房时代,以 380V/220V 交流、双路 UPS、2N 或 DR 冗余为典型特征。这套制式的核心假设是机柜功率低、负载平稳、IT 设备以 CPU 服务器为主。AI 算力集群打破了这个假设,GPU 服务器不仅功率高,负载波动还非常剧烈,训练任务跑起来时电流曲线几乎是分钟级跳变。UPS 的带载能力、蓄电池的放电时长、柴油发电机对阶跃负载的响应能力,全部暴露在更严苛的工况之下。
1.2 传统冗余架构第一次出现“灵活性危机”
传统 2N 冗余供电架构有一半容量在闲置,这在过去数据中心上架率低、负载率不高的时期还能接受。到了算力时代,机柜满配甚至超配成为常态,闲置一半容量的代价变得难以承受。但直接改成单路供电又面临可用性下降、维护窗口难安排等一系列问题。
我见过一种更现实的过渡做法:保留双路 UPS 架构,但在末端增加智能切换开关,让不重要负载在市电直供和 UPS 供电之间灵活切换。这种“双路物理、逻辑可调”的思路,其实已经是在朝供电制式变革的方向试探。真正彻底的变革,则是上文提到的将直流供电直接下沉到机柜末端,也就是我们后面要详细说的 HVDC 方案。
2. 传统供电制式的三个典型“不匹配”
在讨论新制式之前,有必要把老方案的痛点讲透。供电制式变革不是拍脑袋的决定,而是“不匹配”累积到一定程度后的必然结果。我给客户做技术交流时通常总结为三个维度:效率、末端、管理。
2.1 效率不匹配:AC-DC-AC 多次变换的损耗
传统 UPS 供电链路是“市电交流 → 整流成直流 → 逆变成交流 → 服务器电源再次整流成直流”。链路中每一级变换都有损耗,虽然目前高频 UPS 的效率已经能做到 96% 左右,但那是理想工况下的数字。实际机房负载率不足 50% 时,效率往往会掉到 90% 以下。多个环节的损耗叠加,再加上空调制冷补偿这些损耗所需要的额外电力,整个供电链路对算力负载的综合效率损失非常可观。
HVDC 方案砍掉了逆变环节,市电整流成 240V 或 336V 直流后直接送给服务器,服务器电源只做 DC-DC 变换。仅这一项改动,供电链路损耗就能下降 3% 到 5%。别小看这 3%,在一个 10MW 的数据中心里,每年对应的电费差额是一笔不小的数字。而且少了逆变环节,机房里的发热源也减少了,空调负担随之下降,形成正向循环。
2.2 末端不匹配:CRAH 送风天花板与机柜功率的矛盾
传统风冷机房以行级或房间级精密空调为主,单机柜功率超过 15kW 后气流组织会迅速恶化,出现局部热点。供电制式变革的逻辑在这里体现为“供电与散热协同设计”:高功率机柜往往意味着液冷方案,液冷机组是电源敏感设备,泵的启动电流、运行稳定性对供电质量有要求。过去供电和暖通是两个专业各管各的,现在必须同步考虑。
从供电角度讲,液冷意味着 CDU(冷量分配单元)和管路系统需要额外的供电回路,这些辅助设备的可靠性直接影响算力可用性。我在一个改造项目里遇到过 CDU 泵和 IT 负载共用同一列头柜的情况,泵启动时电压跌落导致同一柜内的 GPU 服务器出现硬件报错。后来把动力负载和 IT 负载分开供电,问题才解决。这种末端细节,恰恰是新制式设计中最容易被忽略又最能体现水平的地方。
2.3 管理不匹配:市电、柴发、UPS 之间的配合短板
算力负载对供电连续性的要求不仅是“别断电”,还包括“别闪断”。GPU 训练任务中断的恢复成本极高,一次闪断可能意味着几十个小时训练进度清零。传统 UPS 支持的小时级备电在算力场景里价值下降,真正重要的是毫秒级不间断和秒级恢复能力。
这带来了储能角色的变化:过去蓄电池是最后一道保险,现在更倾向于配置短时大功率的储能系统来平抑算力负载的急剧波动,同时协同柴油发电机快速加载。供电制式的变革因此不再只是“交流变直流”这么简单,而是涉及储能、发电、配电、负荷多层协同的系统级重构。
3. 供电制式变革的四大方向与实际形态
说了这么多痛点,接下来聊聊现在行业里公认的变革方向。我梳理下来主要是四条线:电压等级与直流化、供配电形态集成化、储能深度参与、以及算力与电力协同调度。
3.1 中压交流+分散式HVDC成为主流
目前国内头部云厂商新建的大规模智算中心,普遍在走“10kV 交流进线 + 分散式 HVDC”的路线。什么意思呢?
传统的 UPS 集中式供电是“一个大鼻子拉全部负载”,HVDC 方案则是把整流模块做成了标准化功率单元,直接部署在机房模块内部。每个机房模块配置一套或多套 HVDC 机架,高压交流进来后先变成 240V(国内常用)或 336V(国外部分场景常用)直流,再通过直流母排输送给机柜。这套架构在成本、效率、可靠性之间取得了比较好的平衡。
拿 240V 和 336V 的对比来说:240V 在国内电信运营商体系里用得久,相关标准比较完善,设备供应链成熟;336V 的好处是母线电压更高,同样的功率下电流更小,线缆损耗更低,但绝缘和防护等级要求更高。具体选哪个,需要结合机柜功率密度、运维团队的技术积累和供应链情况综合判断。
3.2 一体化电力模块取代传统低压配电房
这几年力兴起的“一体化电力模块”,是把变压器、低压配电、HVDC 整流、蓄电池、监控系统全部集成到一个标准化集装箱式的模块里。传统方案需要一整个低压配电房的空间,一体化模块则可以直接部署在机房附近,甚至室外。
这种形态变革给数据中心建设带来的最大好处是交付速度。传统供配电系统从设计到安装调试,周期是按月算的;一体化电力模块是工厂预制、现场拼装,实测下来能够大幅压缩建设周期。同时,各模块之间按 N+1 或 2N 配置,可用性等级完全可以做到 Tier III 甚至 Tier IV 的水平。
当然,一体化模块也不是没有缺点。集成度高意味着单个设备的故障影响面变大,对运维团队的故障隔离能力要求更高。此外,模块内部的散热设计在南方高温地区需要特别关注,我见过一个项目去现场测试时发现模块内部温度偏高,后来通过加装导流罩和调整百叶方向才解决。
3.3 储能介入:从备电到功率型补偿
电池在传统数据中心里是“备而少用”的角色,在算力中心里则完全不同。由于 AI 训练负载的剧烈波动,储能系统已经开始承担“削峰填谷”和“动态功率补偿”的职责。
一种比较新的做法是“算力负载跟随储能状态运行”:当储能 SOC 处于高位时,允许负载全速运行;当 SOC 下降后,系统逐步降载或切换部分负载到其他供电通道。这种机制既保护了电池寿命,又最大化利用了市电容量,还能参与电网需求响应获取额外收益。
这里有一个常人容易忽略的问题:锂电池在数据中心的消防规范。算力中心储能容量大,锂电热失控风险不容忽视。目前在做的方案是“模组级消防”——在电池包内部设置独立的探测和灭火装置,而不是等火灾蔓延到整个电池柜再启动气体灭火。我参观过的几个新项目,电池仓都做了独立分隔和泄压设计,这已经成为新制式下供电安全的重要组成部分。
3.4 算电协同:从“制冷”到“热管理”的供电联动
算电协同听起来很玄,其实本质上是让算力负载、供配电、散热三者动态配合。传统数据中心三者都是静态配置,算力负载是变量,供电和散热按最大负载预留。算力中心如果继续沿用这个思路,冗余成本会非常夸张。
现在的方向是引入“动态母排”和“智能列头柜”,让机房模块的供电容量可以在相邻模块之间互相调度。某模块负载低了,多余容量可以临时借给附近的训练模块;模块负载高了,可以自动降低非关键负载(比如备份任务)的优先级。这种调度需要供电系统具备实时的负载感知和快速的母排切换能力,对智能配电设备提出了很高的要求。
4. 实际部署经验:从方案选型到验收的注意事项
前面讲了大量战略层面的东西,下面落到实际操作层面。以我一个改造项目的经历为例,把选型、实施和验收过程中踩过的坑和积累的经验分享给大家。
4.1 功率密度测算与机柜选型
供电制式变革的第一步不是选 HVDC 还是 UPS,而是把功率密度算清楚。我见过不少人拿着 GPU 服务器的铭牌功率直接乘以台数,得出一个数字就开始做配电设计,结果实际运行时电流远超预期。
正确做法是区分“最大功耗”和“典型功耗”。GPU 服务器在跑训练和跑推理时的功耗差异非常大,必须结合业务负载模型做功耗画像。建议对现网服务器做至少一周的功耗采样,画出日曲线和周曲线,找出峰值持续时间和波动频率。在此基础上预留 30% 左右的余量,再去确定机柜功率等级。
4.2 冗余架构与维护便利性的取舍
很多运维团队习惯了传统 UPS 的维护模式,对 HVDC 的维护便利性有疑虑。这里需要提前规划几个细节:直流母排是否支持不断电维护?整流模块是否支持热插拔?电池组是做集中式还是分布式?
我个人的建议是,如果机房空间允许,优先做分布式电池——电池跟着 HVDC 模块走,每组电池只负责一小片负载。虽然电池数量会多一些,但故障隔离和运维检修都简单很多,不会出现一组电池检修导致几面机柜设备全部停摆的情况。维护窗口的安全性,往往比初期设备成本更重要。
4.3 验收测试与常见踩坑
供电系统验收是最容易出现“看起来正常,实际有问题”的阶段。以下几个测试点大家务必重视:
一个是负载阶跃测试。HVDC 系统在空载和满载切换时,输出电压的响应速度和超调量必须严格控制。我之前测过一款设备,负载从 10% 突加到 80% 时,输出电压跌落了将近 20V 才恢复,这个表现根本不能用于 GPU 集群。类似问题只能通过加大输出电容、优化控制环参数来解决,必须在部署前发现。
另一个是电池与 HVDC 的配合测试。很多系统电池只做备电,平时充电、放电交给 BMS 管理,验收时只做一次简单的断市电测试。但实际情况是,电池内阻、连接条压降、采样线接触不良等问题,只有在 50% 以上放电倍率时才会暴露。建议验收时做一次电池组 10 分钟放电测试,同时监测每一节电池的端电压和温度,任何一节出现压差过大都要排查原因。
5. 技术争议与长期演进判断
供电制式变革进行到今天,行业里仍然存在不少争议。主要集中于两点:HVDC 与传统 UPS 孰优孰劣,以及供电系统智能化演进的方向。
5.1 HVDC 与传统 UPS,运维团队转型问题
从技术指标看,HVDC 在效率、扩展性、成本上都有优势,但它在市场推广中最大的阻力来自运维习惯。传统 UPS 的运维人员对交流侧的各种保护、切换逻辑非常熟悉,切换到直流系统后,很多经验要清零重学。
在实际项目中,我建议采用“混合架构过渡”:先在一个机房模块部署 HVDC,跟传统 UPS 系统并行运行,让运维团队有足够时间熟悉新设备的巡检、告警处理和故障应急。等到团队对新制式的操作有了信心,再逐步扩大规模。这样既控制了风险,也让新制式在组织内自然生长。
5.2 智能运维与电力数字孪生
供电制式变革的另一个明显趋势是数字化。传统机房的配电柜多数是“哑设备”,最多看看电压电流,故障时靠人去现场判断。新制式下的智能配电柜则普遍具备了数据的实时采集和上传能力,配合数字孪生模型,可以在虚拟环境中模拟各种故障场景、演练应急处置流程。
我接触过的一个算力中心项目,运维大屏上可以实时展示每一路母线的负载率、谐波畸变率、三相平衡度,还能预测未来 6 小时内的负载趋势。调度人员能够在负载高峰来临前提前调配供电资源,甚至自动触发负载迁移策略。这种“电力数字化 + 算力调度”的深度融合,正在把供电系统从“被动响应”变成“主动管理”。
5.3 对从业者的建议:把握规律而非追逐热点
结合我多年的实践经验,供电制式变革背后的核心规律是把供电资源更加精准地匹配到算力需求上。无论是 HVDC、新型储能还是算电协同,本质上都是在消解功率密度提升带来的刚性约束。
对正在规划算力中心建设的朋友,我的建议是保持适度前瞻:按未来 2 到 3 年的主流负载密度设计供配电架构,不要按最新极限值规划,因为 GPU 迭代周期远快于供电系统的折旧周期;按越来越高的功率密度去预留扩容空间,但不急于把容量一次到位。供电架构上优先选择技术成熟、供应链完整的方案,同时对液冷、储能等新方向保持关注。
我在实际项目中还发现一个容易被低估的环节——供电制式变更需要业主方电力报装提前同步。新建算力中心的负荷往往远超传统数据中心,需与当地供电部门就进线容量、变电站间隔、功率因数要求、负荷等级认定等多个事项提前沟通。很多项目工期延误,不是设备到不了,而是电力配套没跟上。这块如果条件允许,建议业主在规划阶段就与供电部门做专项技术对接,必要时委托设计院做专项接入方案,把电力外部条件稳定住,内部供电制式改革才能顺利落地。
最后再分享一个小技巧:不管选哪种新制式,务必保留一部分传统交流供电能力,至少在办公区、安防系统和机房照明部分要如此。纯直流化的机房一旦遇到特殊紧急情况,标准的检修工具和仪器仪表会很难接入,保留一条小容量交流通道,能让运维工作从容很多。供电制式变革最终是为了服务业务连续性,而不是为了技术上的“新”,这一点想清楚了,很多取舍也就不难做了。