news 2026/9/14 22:26:34

AI数据中心供电与散热升级:从12V/48V到HVDC与液冷全解析

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI数据中心供电与散热升级:从12V/48V到HVDC与液冷全解析

1. 为什么LLM数据中心成了电源行业的“压力测试场”

做电源这行十几年,最近两年被问得最多的问题变了。以前大家问的是“这个模块效率几个点”“纹波控制在多少毫伏”,现在客户开口第一句基本是:“我这批GPU机柜,单柜功率要干到80kW甚至100kW,你那套供电方案能扛住吗?”说实话,第一次听到这个需求的时候,我下意识觉得对方是不是把单位说错了。毕竟传统数据中心单机柜功率能稳定跑在8kW到12kW就已经算不错了,突然跳一个数量级,对整个供电链路来说完全是另一种游戏。

1.1 算力密度飙升背后,是功率密度的三重跳涨

LLM训练集群的功耗增长,核心逻辑其实不复杂:单颗GPU的功耗上去了,单机柜能塞的GPU数量上去了,整个数据中心的建设规模也上去了。这三个变量叠加,就让电源系统的压力直接爆表。

先看单卡功耗。几年前的旗舰训练卡,TDP大概在300W到400W,那时候大家就觉得风冷快压不住了。到了新一代加速卡,单卡TDP普遍走到700W以上,部分型号甚至摸到1000W。这是什么概念?一个8卡节点,光GPU的峰值功耗就是5.6kW到8kW,还没算CPU、内存、网卡和硬盘。

再看机柜密度。为了减少跨机柜通信延迟、提升训练效率,GPU服务器倾向于高密度部署。传统机柜放10台1U服务器轻轻松松,但AI训练机柜通常是4台甚至8台8卡服务器叠在一起,加上NVLink交换机、存储节点,单柜功率从几年前的6kW到8kW直接冲上40kW、60kW、80kW。我跟过的几个实际项目,单柜峰值功耗甚至规划到了120kW以上。

最后是数据中心整体规模。单机柜功率大了,单栋楼能放下的总算力也上去了,但配套的供配电和散热设施必须同步扩容。一个典型的万卡级GPU集群,IT负载轻松超过50MW,中压变压器、低压配电柜、UPS或HVDC系统、列头柜、末端PDU,每一级都要重新算一遍。

这三重跳涨叠加的结果就是:以前“够用”的供电方案,现在从变压器到末端连接器,每一环都在超负荷边缘试探。做电源的人应该都有这种感受——最怕的不是产品本身出问题,而是整个系统在极限工况下的连锁反应。

1.2 传统供电方案在AI集群里的三个“撑不住”

传统数据中心供电链路,长这样:市电进来,经过变压器、UPS、配电柜、列头柜,最后到机柜里的PDU,再进服务器内部的电源模块(PSU),由PSU把高压交流电转成12V直流,给主板、CPU、GPU供电。这条链路在传统机柜功率下没什么大毛病,但放到LLM训练集群里,三个地方先撑不住。

第一个撑不住的是12V母线。功率等于电压乘以电流,服务器内部12V母线要支撑800W甚至1000W的GPU,电流就是70A到90A。一块GPU就要近100A电流,一张8卡主板的总电流奔着600A到700A去了。这么大的电流在PCB上走,铜箔厚度、过孔数量、连接器端子全得加码,损耗和发热都很难看。懂硬件的人都知道,12V下超过300A的板级供电,设计难度已经开始指数级上升。

第二个撑不住的是UPS和配电系统的效率。传统UPS工作在双变换模式,交流转直流再转交流,效率做到96%以上已经算优秀,但问题在于它占了两个转换环节的损耗。AI数据中心负载波动又大,GPU在训练和推理之间切换时,电流变化斜率很陡,UPS和柴油发电机组的配合、市电和电池的切换逻辑都会受到冲击。

第三个撑不住的是风冷。传统风冷机柜的单柜散热能力极限一般在15kW到20kW,到了30kW以上,风扇转速拉到满,噪音大、功耗高不说,GPU进风温度一高就开始降频。一个万卡集群因为散热导致算力折损,损失的钱远超省下来的那点电费。

1.3 AI电源的真正需求清单

在跟客户做技术交流的时候,我习惯把AI数据中心对电源的需求整理成一张清单,需求方和供应方都按照这张清单对齐,后面少走很多弯路。

  • 高效率:电源效率直接影响整个数据中心的PUE。钛金级PSU的94%到96%效率是底线,LLM集群追求的是97%以上,每提升1个百分点,一个50MW的数据中心一年省下的电费都是百万级。
  • 高功率密度:机柜空间是稀缺资源,电源模块必须在相同体积里输出更高功率。3kW、3.3kW的CRPS模块已经普及,5.5kW甚至更高功率的模块正在铺开。
  • 快动态响应:GPU负载是出了名的“喜怒无常”,从空载跳到满载可能只需要微秒级。电源必须把瞬态响应压到几十微秒以内,否则电压跌落就会触发GPU报错或系统重启。
  • 高可靠性:训练任务一旦中断,重新加载检查点(checkpoint)的成本是小时级的。电源作为串联在整条链路上的环节,任何一次宕机都是不可接受的。
  • 可管理性:整个集群上万台服务器,电源的健康状态、温度、输入输出电压电流、效率数据,全部要能被管理平台实时拉取和监控。

这几条需求列出来,大家应该能理解为什么传统的“采购标准电源模块”思路行不通了。AI数据中心需要的不是某一颗电源器件,而是从器件到系统的整套供电与散热方案。高酷这类电源厂商做的,就是把这套方案里的每一环都拆开,重新设计、重新匹配。

2. 供电升级路径:从12V到48V再到HVDC,高酷是怎么走的

供电升级不是拍脑袋换个大功率电源模块就行,而是整个电压等级、转换链路、系统架构的重新选型。我自己的体会是,AI服务器电源的升级路径可以拆成三跳:第一跳是服务器内部从12V到48V,第二跳是机柜内从分散式供电到集中式母线供电,第三跳是数据中心级别从UPS交流走向高压直流。高酷在这三跳上都有对应的产品布局和技术路线,下面挨个拆开讲。

2.1 第一跳:12V到48V,不是简单升压而是架构重构

为什么LLM服务器的板级供电一定要从12V换到48V?核心原因是电流。同样的800W功耗,12V下电流约67A,48V下只需要约17A。电流降了四分之三,线缆和PCB走线上的损耗跟着大幅下降,因为铜损跟电流的平方成正比。同样的线径,48V方案能传输的功率是12V方案的16倍,这不是线性提升,是平方级翻盘。

更关键的是,48V架构把供电链路拆成了两级:前端的AC-DC电源模块只负责把市电转成48V直流,后端的板载DC-DC转换器再把48V降压到GPU和CPU需要的0.7V到1.8V。这样做的好处是,大电流的传输距离被压缩到最短,母线上的电流密度大幅降低,板级供电设计的难度也降了下来。

有人可能会问,为什么不直接上更高电压,比如60V或者400V?因为安全特低电压(SELV)的规范上限是60V DC,超过这个值,整个系统的绝缘、防护、连接器标准全部要上一个台阶,成本和风险都不可控。48V是工程上综合安全和效率之后的最优解,这不是某一家厂商拍脑袋定的,而是行业达成的共识。

高酷在这个环节的产品思路很明确:把48V母线当作整个机柜供电的中枢,AC-DC模块统一输出48V,再通过机柜内的供电背板或者线缆分发到每一个计算节点。这种架构对比传统12V方案,母线铜排的截面积可以缩小一半以上,整机柜的供电损耗能降低5%到8%,意味着PUE直接往下拉了一截。

2.2 第二跳:从AC-DC集中供电到“PSU+母线+板载DC-DC”的分布式链路

看一张AI服务器的供电拓扑,你会发现它跟传统服务器长得完全不一样。

典型链路是这样的:数据中心的交流电或者高压直流电进入服务器机柜,接在电源分配单元(PDU)上,然后进入一组CRPS规格的电源模块(PSU)。这组PSU的输出并联到一条48V母线上,母线再往后端板载DC-DC转换器供电,由这些转换器把48V逐步降下来给GPU、CPU、HBM、NVSwitch供电。

这条链路里,PSU的角色从“直接给主板供电”变成了“给母线供电”,它对动态响应、均流精度、效率曲线的要求完全不一样了。高酷在给客户做方案时,一般会强调几个关键参数:满载效率要在97%以上,20%到100%负载范围内的效率曲线要平,均流偏差控制在2%以内,动态响应时间小于50微秒,保持时间不小于12毫秒。

另一个容易忽略的点是PSU的规格尺寸。现在的AI服务器普遍使用CRPS(Common Redundant Power Supply)规格,但传统的CRPS尺寸在185mm x 73.5mm x 40mm左右,输出功率做到3kW就接近极限。再往上走,就要么加厚模块,要么换更长的规格。高酷的高功率版本CRPS模块已经做到185mm x 73.5mm x 65mm,输出功率拉到3.3kW甚至5.5kW,同时保证热插拔能力和冗余设计不变。

这里必须提一句均流特性。多颗PSU并联工作时,如果均流控制做得不好,有的模块满载、有的模块轻载,不仅浪费容量,还容易提前老化。好方案是用数字均流(droop sharing或者active current sharing),让每颗模块的输出电流尽可能均匀分配。实际测试中,高酷的PSU在4颗并联时,均流动态偏差可以控制在3%以内,这对整机柜的长期稳定运行非常关键。

2.3 第三跳:HVDC和整机柜供电,数据中心级的大一统

服务器内部和机柜内部的供电升级之后,整个数据中心层面的供电架构也在变。传统数据中心用UPS做交流不间断供电,市电断电后靠电池逆变,切换时间在毫秒级。AI数据中心对供电可靠性的要求更高,同时对效率的追求也更极致,所以高压直流(HVDC)方案开始成为大趋势。

HVDC方案的思路简洁得多:市电经过变压器和整流模块,直接变成240V或者380V的直流电,然后通过直流母线一路送到机柜,机柜里的PSU只需要做DC-DC降压就行,省掉了“交流变直流再变交流再变直流”的多级转换链条。一级转换省下来,效率就能提升2到3个百分点,一个大型数据中心全年省下的电费是千万级的。

高酷在整机柜供电方案上的做法是:把AC-DC整流环节前移,直接提供接入HVDC母线的供电单元。这样客户的数据中心可以一步到位采用高压直流架构,机柜里的PSU不再需要内置完整的AC-DC电路,体积、成本、故障率都降下来了。

这种架构还有一个隐性好处:电池管理更灵活。传统UPS需要把电池电压逆变成交流电给负载,而HVDC系统里电池直接挂在直流母线上,充放电控制简单得多,电池利用率更高,寿命也更长。

2.4 一个完整的供电升级案例拆解

光讲架构有点虚,拿一个实际的升级案例来说。

假设一个传统机房,单机柜功率12kW,机柜里放的是2U通用服务器,供电方式是传统双路UPS加机柜PDU。现在要把这个机房改造成GPU训练集群,单机柜目标功率80kW,需要做哪些升级?

第一步,机柜供电能力从12kW提升到80kW,意味着输入电流从约18A(380V三相)提升到约120A。原来的32A工业插座和线缆全部要换,改用单柜专用的60A或125A工业连接器,线缆截面积从6平方毫米升级到25平方毫米甚至更粗。

第二步,配电柜到机柜的链路要重新规划。80kW机柜最好采用双路母线供电,一路主用一路备用,每路承载40kW。每一路的断路器、接触器、电表都要按照60A以上选型。

第三步,机柜内的PSU方案要换。12kW时代一个机柜放2到3个2kW PSU就够了,80kW时代需要至少24个3.3kW PSU或者16个5.5kW PSU。这么多PSU塞进机柜,要么分散挂在每台服务器里,要么集中放在机柜顶部的供电抽屉里。高酷的整机柜供电方案更倾向于后者:把PSU做成集中式供电抽屉,统一管理、统一散热,故障时整抽屉热插拔更换,不用动服务器本体。

第四步,散热方案必须同步升级。80kW的功耗意味着每秒产生约80kJ的热量,风冷在这个量级已经无能为力,需要上冷板式液冷或者浸没式冷却。这一块下面单独展开。

这套流程走下来,一个传统机柜真正变成AI训练机柜,供电、散热、布线、监控全部重做一遍。所以每次有客户说“我买几台GPU服务器插上就能用”,我都得给他泼盆冷水:服务器只是整个系统里最显眼的一环,真正决定能不能跑起来的是供电和散热这套“地下工程”。

3. 热管理解决方案:把几百千瓦热量“搬出”机柜的几条路线

供电升级解决的是“电怎么送进去”的问题,热管理解决的是“热怎么排出来”的问题。这两个问题在AI数据中心里是绑在一起的,电源效率再高,只要有1%的损耗变成了热,在一个80kW的机柜里就是800W的热量,相当于一台小型取暖器在机柜里一直开着。电源模块自己发热、GPU发热、其他器件发热,全都要靠散热系统带走。

3.1 为什么传统风冷在AI机柜里行不通

风冷的原理是用空气流过发热元件表面,把热量带走。空气的比热容很小,要带走同样的热量,需要的风量非常巨大。一个80kW的机柜,如果全靠风冷,需要的风量大约是每分钟几百立方米,相当于一个中型会议室体积的空气每分钟都要换一遍。气流速度上去了,风机功耗跟着上去了,噪音也上去了,最关键的是换热效率还是不够。

实际项目中,风冷方案的极限一般卡在单机柜15kW到20kW。再往上,不是风扇转速不够,就是服务器进风温度超标导致GPU降频。你花大价钱买的GPU,因为散热不够跑不到标称算力,这比电源效率低几个点更让人心疼。

3.2 冷板式液冷:当前最务实的过渡路线

冷板式液冷是目前AI数据中心最主流的散热方案,思路很简单:把发热最猛的芯片(GPU、CPU、HBM)上面贴一块金属冷板,冷板内部有微通道,冷却液在通道里流过去,把热量带走。液体的比热容和导热系数比空气高一个数量级,换热效率完全不在一个维度。

冷板式液冷的组件包括:冷板本身、快接头、 manifold(分集水器)、冷却液分配单元(CDU)、室外冷却塔或干冷器等。冷却液通常用去离子水加乙二醇或丙二醇,兼顾导热、防腐和防冻。

这里有个很多人忽略的点:冷板式液冷机柜里,并不是所有发热元件都能用液冷带走。电源模块、网卡、硬盘这些部件,改造液冷的成本高、收益低,很多时候还是保留风冷。所以整个机柜变成了混合散热模式:GPU和CPU上液冷,其他部件风冷。机柜内部要同时设计液冷管路和风道,结构复杂度上去了,但对现有产业的改动相对较小,是现阶段最平衡的方案。

我在跟高酷的工程师聊的时候,他们说现在不少整机柜方案已经把PSU供电抽屉做成了“风液混合”模块:电源本体还是风冷,但整个抽屉的热量先被内部风道聚集,再用液冷盘管带走。这样机柜的空调负荷可以大幅降低,供电抽屉在高功率输出时的温升也能压得住。

3.3 浸没式冷却:面向极限功率密度的终局方案

冷板式液冷虽然效率高,但它的换热路径是“芯片—冷板—冷却液—CDU—室外冷却塔”,每一级都有温差损失。到了极致功率密度,比如单机柜120kW以上,冷板式的换热面积可能不够,这时候就要上浸没式冷却。

浸没式冷却的原理更直接:把服务器整个泡在不导电的冷却液里,发热元件直接和冷却液接触,热量瞬间传给液体,再由外部循环系统带走。冷却液在服务器表面沸腾或者流动,换热效率极高,不需要复杂的管路设计,也不存在“哪个芯片没贴上冷板”的问题。

浸没式又分单相和两相两种。单相浸没式是冷却液始终维持液态,靠温差和流速换热;两相浸没式是利用冷却液的沸腾和冷凝相变吸热,换热能力更强,但对冷却液的沸点、密封性、系统压力都有特殊要求。

浸没式冷却的工程难点有几个:第一是冷却液的成本,电子氟化液一桶几千块起,一个机柜要几十桶;第二是服务器本身要做防水防渗设计,所有连接器、线缆、风扇都要换掉,电源模块也要专门做密封处理;第三是运维体验差,想换一块硬盘得先停机、拆箱、捞服务器、清液、烘干,过程相当繁琐。

所以我的判断是,浸没式冷却是个“终局技术”,适合单机柜功率超过100kW、对算力密度有极致追求的场景。现阶段大多数客户,冷板式液冷已经够用,而且工程成熟度更高、TCO更低。

3.4 热管理不只是“制冷”,还要管住电源自身的发热

做了这么多年电源,我发现大家对散热系统的注意力全在GPU上,电源模块自己的发热反而被忽略了。实际上,一个3.3kW的PSU,效率95%时自身发热是165W,效率97%时发热是99W,差了整整66W。一颗模块差66W,一个机柜16颗模块就是1kW的额外发热量,全都要散热系统扛走。

电源模块自身的散热设计,要从几个维度考虑。

  • 散热结构:高效率的电源模块普遍采用“风道隔离”设计,把发热元件分成几个区域,每个区域独立风道,避免热气流短路。高压侧、低压侧、磁性元件、功率半导体,各自的热量不能互相干扰。
  • 降额策略:芯片温度超过一定阈值后自动降额输出,防止过热损坏。这个策略的触发温度点设在哪里很关键——设得太高,器件寿命受损;设得太低,模块白白浪费容量。高酷的模块一般把降额点设在105℃左右,同时配合智能风扇调速,低负载时慢速转、高负载时快速转,兼顾噪音和散热。
  • 工作环境适配:AI服务器机柜进风温度可以达到35℃甚至40℃,电源模块的额定输出功率必须在这些温度下打折扣。选型的时候一定要看厂商提供的“功率-温度降额曲线”,否则你在25℃下测的满载功率,到40℃环境里可能只能输出80%。

我见过不少项目,GPU那边上了液冷,很先进,结果电源抽屉还是传统风冷,进风口贴着一堵墙,热风循环,电源模块频繁过热降额。这就是典型的“大处算清楚了,小处反而翻了车”。

4. 选型与落地:给工程师和采购的供电与散热避坑指南

前面讲了架构和趋势,这节讲点更落地的内容:真正到了选型和实施阶段,你要盯住哪些参数、躲开哪些坑。

4.1 五个必须看懂的电源关键参数

很多采购选电源,只会看功率和效率,这是远远不够的。对AI服务器电源来说,下面这几个参数每个都必须看懂。

  • 效率曲线:厂商标称的“最高效率”只是峰值效率,实际上更关键的是10%到100%负载范围内的效率曲线。LLM训练服务器的负载波动很大,如果效率峰值只在50%负载附近,满载和轻载时效率掉太多,全年平均PUE就不好看。
  • 保持时间(Hold-up Time):输入断电后,电源能维持正常输出的时间。传统标准要求不小于12ms,但对AI服务器来说,由于整机功耗大、母线电容储能有限,保持时间做到16ms到20ms更稳妥,给后端DC-DC和系统管理留出足够的切换时间。
  • 动态响应与过冲:GPU负载从20%瞬间跳到100%,输出电压会先掉一点再恢复,这个跌落幅度和恢复时间就是动态响应指标。好的电源模块要求负载突变时电压跌落不超过3%,恢复时间在50微秒以内,过冲电压不超过2%。这个参数直接关系到GPU会不会因为欠压或者过压报错、重启。
  • MTBF(平均无故障时间):AI数据中心动辄上万台服务器,电源模块数量巨大,任何一个模块故障都可能导致节点宕机。MTBF是一个统计指标,至少要选30万小时以上的模块,同时要有一整套完善的售后维保体系。
  • 均流特性:前面提过,多模块并联时电流要均匀分配。选型时可以要求多家厂商提供并联均流测试报告,动态均流偏差最好在3%以内。

4.2 冗余架构里最容易踩的三个坑

供电冗余是数据中心最基本的设计原则,但AI场景下有几个坑经常被踩。

第一个坑是N+N冗余变成了“半冗余”。有些项目配置了2N电源,但每路输入只接了单路市电,没有接发电机或电池。结果一路市电闪断,整个机柜直接掉电。花了大价钱做冗余,最后冗余了个寂寞。真正的N+N冗余是从变压器、UPS/HVDC、配电柜到末端插座,每一级都要独立且可用。

第二个坑是备用电源的切换时间没校准。双路供电的服务器在A路断电时会自动切换到B路,但这个切换需要时间,如果电源模块的保持时间不够,切换过程中电压就跌出去了。这里要特别注意PSU的“切换毛刺”测试,确保切换瞬间输出电压始终在规范允许的范围内。

第三个坑是PSU固件版本不统一。这个听着离谱,但实际项目里经常发生。一批服务器到货,电源模块混用了几家供应商的货,固件版本还不一致,导致均流特性、PMBus协议解析、故障上报格式都有差异。后续运维排查的时候,光对日志就对了一个星期。所以采购时一定要限定供应商和固件版本,到货时抽查核实。

4.3 高酷这类方案商,到底应该怎么配合

很多客户的习惯是等需求确定后再找电源厂商询价、下单,但AI数据中心的供电方案应该更早介入。

我建议的节奏是:在项目方案设计阶段,就找高酷这类厂商做一次供电架构联合评审,把单机柜功率、电压等级、供电链路、散热方式、冗余策略全部定下来。然后进入样机验证阶段,用小批量试制验证整机柜的供电和散热效果。确认没问题后,再进入批量交付阶段。

这样做的原因很简单:电源方案和数据中心物理建设(变压器容量、配电柜数量、线缆走向、冷却塔规格)是绑定在一起的,等你土建都完工了再改供电方案,改造成本成倍增加。早一点让电源厂商介入,很多架构上的问题在设计图上就能发现,现场要踩的坑就少了一大半。

高酷这类厂商的另一个价值在整机柜协同设计。供电、散热、管理系统不是独立存在的,它们要跟服务器、交换机、机柜结构、动环监控系统做大量接口对接。方案商如果只卖模块不管系统集成,客户自己把各个部件拼起来,很可能发现接口对不上、协议不互通、故障发生时不知道先看哪边。成熟的方案商会在设计阶段就提供整机柜的接口规范,甚至直接提供一整套供电和散热抽屉的参考设计,客户只需要做适配和验证。

5. 现场问题与排查实录

最后这一部分,我把这些年做AI数据中心供电与热管理项目时实际遇到过的典型问题整理成一张速查表,每条都是踩过坑换来的经验。

故障现象可能原因排查思路与修复手段
单节点在GPU满载时随机重启12V或48V母线电压跌落过大,超出GPU容忍范围用示波器抓GPU供电电压波形,看负载突变时的跌落幅度;检查板载DC-DC的输入电容是否足够,必要时增加母线电容;排查PSU动态响应参数是否达标
多颗PSU并联时电流严重不平衡均流控制参数不匹配,或PSU固件版本不一致查看各PSU输出电流监控值,确认均流偏差;统一固件版本;检查并联母线的阻抗是否一致,避免“末端模块吃不到电流”
机柜进风温度正常但电源模块过热降额电源模块出风口被堵死,或前后风道循环检查机柜前后门开孔率,确认热通道/冷通道隔离到位;统计PSU风扇转速日志,判断是否有持续高转速;必要时更换增强散热的电源抽屉
液冷机柜局部出现热点冷板与芯片接触压力不足,或快接头流量不足用红外热像仪扫描机柜内部温度场,定位热点区域;检查冷板安装扭矩是否符合规范;确认manifold各支路流量分配是否均匀
供电模块上报输入电压异常配电柜断路器接触不良,或输入线缆压降过大用万用表测PSU输入端实际电压,与告警值对比;检查断路器、端子排、线缆连接点是否发热;核算线缆截面积是否满足长距离压降要求
整机柜断电后服务器瞬间关机保持时间不足,或双路切换逻辑异常查看PSU保持时间测试报告是否满足12ms以上;检查服务器电源管理策略,确认双路切换配置;抓取断电瞬间的电压波形,定位切换时间点

除了表格里的问题,还有一个被问得特别多的情况:客户说“我明明上了液冷,为什么GPU还是降频?”排查下来经常发现,液冷冷板覆盖了GPU和CPU,但显存(HBM)、电源转换芯片(VRM)这些区域还是风冷,如果机柜整体风量设计不足,这些区域就成了局部热点,触发了降频保护。所以液冷不是“泡在水里就行”,还要算清楚哪些器件必须液冷、哪些可以风冷,以及风冷部分的风道怎么组织。

另外一个容易被忽视的坑是快接头的选型。液冷系统里快接头是故障率最高的机械部件之一,如果厂商为了省成本用了低规格产品,运行半年后就会出现滴漏。选型时一定要看接头的材质、密封圈寿命、插拔次数指标,最好选带有防误拔锁扣的产品。编码上也要做防差错设计,不同流量的管路用不同接头,避免现场接错。

最后分享一点我的个人体会

做AI服务器电源这个方向也有几年了,踩过不少坑,也见证了这个行业从“传统UPS加风冷”一路走到“48V母线加液冷”的全过程。我个人最大的体会是:AI数据中心的供电升级不是一个“换更大功率电源”的单点问题,而是从数据中心配电架构到机柜内供电链路、再到芯片级电压调节的全面重构。你以为你在选电源模块,实际上你在定架构;你以为你在装散热器,实际上你在定整个运维范式。

另外一个体会是:不要盲目追求最先进的技术。HVDC很好,浸没式散热也很好,但你要先算清楚自己的业务体量、机房条件、运维能力和投资回报周期。现阶段让大多数客户一步跨到浸没式冷却,确实有点勉为其难。更务实的路径是先把48V供电架构和冷板式液冷落地,把单柜功率做到60kW到80kW的稳定运行,等下一代技术成熟了、成本降下来了,再平滑演进。

最后再给一个实用小建议:如果你正在规划一个AI数据中心,建议预留至少30%的供电和散热冗余。LLM模型规模的膨胀速度远超预期,今天规划的功耗,一年后可能就变成满载基线了。留出冗余,你的数据中心生命周期会长很多。这一点,我拿不准是不是最优解,但纵观这几年的项目案例,凡是把冗余留足的,后期扩容都从容很多;凡是贴着极限算的,基本都在后补功课。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/14 22:24:52

写明不能替代就诊的健康网站放哪一层

写明不能替代就诊的健康网站,应该放在扫描层 会写明「内容仅供参考,不能替代就诊」的健康网站,更适合当扫描和解释层,而不是当看病入口。明白健康(https://healviews.com/)在页面上提示信息参考、不能代替就…

作者头像 李华
网站建设 2026/9/14 22:23:51

C++静态分析工具对比与应用实践

1. C静态分析工具的必要性与核心价值在C开发中,静态代码分析工具就像一位24小时在线的资深代码审查员。我经历过太多深夜调试指针越界、内存泄漏的痛苦,直到开始系统使用静态分析工具,代码质量才有了质的飞跃。这类工具能在不运行程序的情况下…

作者头像 李华
网站建设 2026/9/14 22:23:25

ABAP条件分支优化:避免空分支的5种实战方案

1. ABAP条件分支的痛点与空分支问题在ABAP开发中,IF条件分支是最基础也最常用的控制结构之一。但很多开发者(尤其是新手)常常会写出这样的代码:IF lv_flag abap_true." 处理业务逻辑 ELSE." 这里什么都不做 ENDIF.这种…

作者头像 李华
网站建设 2026/9/14 22:23:16

Notepad++高效文本处理:编码转换、正则替换与批量搜索操作

拿到Notepad这种工具,很多人第一反应就是“这不就是个记事本加强版吗”。但真正在大批量日志、脚本、配置文件里摸爬滚打过的朋友都知道,能不能顺手处理编码乱码、能不能一次替换几百个文件里的关键字段,决定了你是加班到九点还是三点半下班。…

作者头像 李华
网站建设 2026/9/14 22:20:37

网站制作公从零搭建避坑指南:选对技术栈流量翻倍

网站制作公从零搭建避坑指南:选对技术栈流量翻倍 网站做好了没人访问,这是很多老板和开发者最头疼的事。你以为上线了就是终点,其实那只是开始。很多项目死在半路上,不是代码写得烂,而是 从零搭建 的底层逻辑就错了。SEO 做不起来,加载速度慢,维护成本高,最后只能眼睁睁看着竞争对手的排名上去了。…

作者头像 李华
网站建设 2026/9/14 22:19:57

iLoader本质解析:iOS设备USB通信代理层

1. iLoader 是什么:一个被误读多年的 iOS 应用分发工具本质解析iLoader 这个名字在最近半年的开发者社群、iOS 破解圈和跨平台桌面应用讨论中高频出现,但绝大多数人提到它时,语气里带着模糊的敬畏——“听说能装 IPA”“Tauri 打包后要用它推…

作者头像 李华