这个月圈子里最常被转发的一张图,是高密服务器液冷渗透率的月度曲线:3月份的统计口径已经摸到78%。放在两年前,这个数字说出来大概没人信,当时液冷还是“甲方点名才上”的附加项,风冷散热模组还是服务器出厂目录里的默认选项。如今风向彻底变了,新规划的高密机房、AI训练集群、GPU资源池,第一版方案基本默认走液冷,风冷只在配电密度偏低或者改造限制过多的机房里继续扛着。
“风冷正式退出高密场景”这个判断,有人觉得是被市场数据推着走,有人觉得是技术迭代的自然结果。我这段时间跟做服务器散热设计、数据中心代建、以及实际运维液冷机房的朋友反复聊过,也翻了不少供应链和测试数据,想把这轮切换掰开揉碎讲清楚:78%渗透率到底意味着什么,风冷为什么在高密度场景下确实撑不住,液冷在机房落地时有哪些容易被忽略的工程细节,以及后面这22%大概会以什么节奏被填上。
1. 78%这个数字,拆开看是一次行业换轨
1.1 口径决定理解方式:这个78%统计的究竟是什么
先把手头的数据口径说清楚。3月份这一波统计,行业里一般把范围定义为“高密度服务器出货”,也就是单台设备功耗比较高、通常承担AI训练或HPC计算任务的GPU服务器、加速计算节点。这个口径下液冷渗透率78%,意味着十台新出的高密机器里,差不多八台出厂时就预装了冷板液冷部件,或者明确按液冷机柜方案交付。剩下的22%并不是被市场淘汰,更多是低功耗型号、旧平台延续型号,以及特殊部署场景里仍然选用了风冷方案。
如果换一个更宽的口径,把通用机架服务器、存储服务器、边缘服务器全部算进去,液冷渗透率肯定会低很多,可能只有百分之十几甚至个位数。所以看这个数字不能只看比例本身,得先确认统计边界。行业内常说的“液冷元年”“风冷退场”,指的都是高密AI服务器这个细分赛道,其他细分场景的风冷寿命还很长,这是理解整篇文章的前提。
1.2 单机柜功率密度越过风冷经济线,是整个切换的发动机
为什么偏偏是高密场景先完成切换?答案非常朴素:单机柜功率密度已经踩过了风冷方案的经济性和物理可行性红线。
一两代GPU之前的普通CPU机架,单机柜功耗通常落在5kW到15kW,风冷随便吹吹就能压住,机房空调送风、回风设计也成熟。到了AI时代,一台训练服务器单机功耗就飙到几kW,一台机柜塞进去四到八台,单柜功耗轻松做到40kW、60kW,个别全液冷机柜甚至奔着100kW以上去。风冷面对30kW以上的热负荷,需要的是巨大送风量、超高风机转速,以及几乎失控的噪音和气流组织。这种条件下继续用风冷,要么电费被风扇和空调吃掉一大块,要么芯片温度压不住导致降频,算力上不去,运维还整天被高温告警骚扰。
液冷方案恰恰在这个区间把成本曲线打了下来:冷却液把热量带走的能力远强于空气,单位体积可以搬运的热量高出一到两个数量级,机柜功率密度越高,液冷的边际收益越明显。所以这次换轨不是某个厂商推出来的概念,而是芯片发热一路走高之后,服务器厂商、机房建设方、运营方在成本核算里共同做出的选择。
1.3 生态切换比想象中更快:散热模组工厂都在换产线
过去一年,最直观的变化发生在供应链侧。我在供应商那边看到的情况是,原本做风冷散热器的产线,已经把相当一部分产能挪去做冷板、快接头和水冷管路预组装。服务器组装环节里,以前是拧散热器扣具、插风扇线,现在多了一道工序:装冷板、打扭矩、做气密性检测、连接二次侧管路。整机柜交付方案也比以前多,像NVL72这类超高密度整机柜形态,已经是水电气一体化的产品,不再是一台台标准服务器插到机架上那么简单的传统架构。
这种生态切换有一个明显的先导信号:主流服务器厂商的产品目录里,高功耗型号的“风冷版本”和“液冷版本”同时在卖,但风冷版本往往只对低功耗SKU开放,高功耗SKU默认只出液冷。芯片厂商给出的散热参考设计里,风冷散热器也名存实亡,官方推荐基本都是冷板加冷却液循环。生态一旦整体转向,再想回头用风冷,成本反而更高,因为配件、认证、测试标准都开始在液冷体系上建立。
2. 风冷在高密度场景的退场,是热力学账算不过液冷
2.1 传热效率的物理差距:一组可以自己复算的数据
风冷和液冷的差距,说到底就是传热介质本身的物理性质差距。空气的比热容大约1.005 kJ/(kg·K),密度大约1.2 kg/m³;水的比热容大约4.18 kJ/(kg·K),密度大约1000 kg/m³。同样带走一道热量,水需要的体积流量比空气小几个数量级。
我按一个30kW的单机柜来算笔账。假设送风和回风的温差是15K,30kW热负荷需要带走的热量是30kW,空气的流量需求大概是:
- 质量流量 = 30 /(1.005 × 15)≈ 1.99 kg/s
- 体积流量 = 1.99 / 1.2 ≈ 1.66 m³/s,换算成小时就是约5976 m³/h
5976立方米每小时是什么概念?一个标准42U机柜的正面迎风面积也就0.6平方米上下,要让这么多空气从柜门吹进去,柜内平均风速差不多要2.8米每秒,服务器风扇得狂转,噪音和功耗都压不住。如果把单柜功耗上升到100kW,同样的温差条件,风量要求直接翻到接近两万立方米每小时,机柜内的风速要接近每秒十米,这种条件在数据中心物理空间里根本没法稳定实现。
再看液冷。同样30kW热负荷,水的温差取15K,水的比热容4.18 kJ/(kg·K),需要的质量流量只有:
- 质量流量 = 30 /(4.18 × 15)≈ 0.48 kg/s
- 体积流量 = 0.48 / 1 ≈ 0.48 m³/s,也就是约1.72 m³/h
1.72立方米每小时,对一套水冷系统来说就是一根细管子轻轻松松能通过的流量。100kW机柜也只需要不到6立方米每小时的水流量,这种量级对泵、管径、阀门来说完全没有压力。液冷相比风冷,在单位体积热搬运能力上的优势是数量级的,这不是优化风扇转速能追回来的差距。
2.2 风冷的上限不在“能不能”,而在“划算不划算”
风冷在20kW以下能干活吗?当然能,而且干得很稳。但到了30kW以上,就会出现一连串连锁反应:机房送风量加大,空调风机功耗跟着涨;回风温度被压得很低,冷机效率反而变差;为了把热风送回空调,还要保证气流组织不短路,高架地板开孔率、冷通道封闭都要做到位。问题是,这整套系统投下去,换回来的还是“勉强压住”,热负荷稍微波动一下,柜内局部热点照样冒出来。
液冷在这里的优势不只是物理上限高,还在于热量可以精准地“贴着热源搬走”。冷板直接覆盖在CPU封装盖上,冷却液在微通道里流过,芯片到冷却液之间的热阻比空气小得多。芯片的均温性也更好,不再依赖散热器基板向四周扩散热量,芯片热点温度能降下来不少。实测中,同等芯片功耗下,液冷的芯片结温通常比优秀的风冷方案低10到20摄氏度,这直接换成了更低的漏电流、更稳定的睿频和更少的热降频。
2.3 风冷并没有失败,只是被安排到了更合适的位置
把话说得公平一点:风冷退出高密场景,不等于风冷是“落后技术”。风冷的可靠性记录非常好,因为它结构简单,没有水、没有泵、没有管路,不会漏液,也不存在防冻液老化的问题。在低功耗服务器、存储节点、网络设备、边缘小机房这些场景里,风冷仍然是最合适的选择,改造量小、维护简单、成本可控。
这轮切换的本质,是风冷被推到了它不擅长的高密度区间,而液冷在物理上天然适配这个区间。行业里现在说的“风冷正式退出高密场景”,准确说是“高密场景正式把风冷选项摘掉了”。以后大概率会出现长期并存的态势:高密算力区走液冷,周边支撑设备继续风冷,两种散热技术在同一个机房各管一段。
3. 液冷不只是换介质:CDU、环路和水质带来的工程复杂度
3.1 液冷到机房的三种落地形态,各有各的折腾点
现在主流的液冷落地形态有三种:冷板式液冷、浸没式液冷、以及介于两者之间的后门热交换器方案。冷板式是目前渗透率最高的,因为它的改动层面主要在服务器内部,把CPU/GPU上面的风冷散热器换成金属冷板,再用软管把冷却液引进去,机柜内再接到二次侧供回水主管。这种方案对服务器形态的改变最小,整机可以沿用标准机箱,机房改造也可以分步走。
浸没式则更激进,整台服务器或是只有热源部分,直接泡进绝缘冷却液里,靠液体的大面积接触带走热量。单相浸没维护还算简单,两相浸没要处理系统压差和冷凝问题,工程复杂度直线上升,目前主要用在超算和特定高密场景。
后门热交换器是一种过渡方案,热交换器装在机柜后门上,液体不走服务器内部,靠机柜内的风扇把热风抽到后门,再由水系统带走。它的冷却效率不如冷板直接接触热源,但改造灵活,适合存量机房向液冷转型,不用换整柜服务器,把机柜后门换掉就能接水。
3.2 CDU是液冷系统里最关键的“阀门大脑”,一定绕不开
不管采用哪种液冷形态,机房里都会出现一个共同设备:CDU,冷却液分配单元。CDU的作用,是把机房侧一次侧的冷却水(可能来自中央冷站、干冷器或冷却塔)和服务器侧二次侧的冷却液隔开,通过内部的板式换热器完成热量交换。
为什么要分一次侧和二次侧,而不是直接拿机房冷水进服务器?一是安全隔离,服务器二次侧冷却液可能是去离子水或者加了防冻液、缓蚀剂的特调液体,和一次侧自来水系统混在一起,水质、压力都对不上;二是流量和压力控制,每台服务器的水流量需求不大但压力要求稳定,CDU里集成循环泵、比例阀、过滤器和传感器,专门保证各支路流量均衡;三是故障隔离,服务器侧如果漏液,CDU的阀门可以单独关断,不影响整个机房的一次侧水系统。
选择CDU时,机柜级CDU(比如每个机柜一个,或者几个机柜共用一个)和机房级CDU各有取舍。机柜级CDU阀件更灵活,单柜改造时不影响邻居,但设备数量多、占地面积大、造价高;机房级CDU集中管理,效率更高,但刚上架那几天调试压力大,某个机柜接水异常时,排查链路更长。最近做高密机房的选型里,机柜级CDU的偏好明显更高,因为AI机柜之间的功率差异太大,集中式CDU很难适配所有柜的流量需求。
3.3 水质、缓蚀剂和补液:液冷机房的理论课与实践课
液冷管路的介质不是随便接自来水就能用的。冷板液冷二次侧的冷却液,行业里一般分为纯水方案和防冻液方案。南方天气温暖的地方,直接用去离子水加上适量缓蚀剂就行,成本低,换热效率最高。北方或者室外有干冷器的场景,就要加乙二醇/丙二醇类防冻液,防止冬季设备停运时管路结冰胀裂。
水质是最大的隐性工程点。冷却液如果电导率过高,容易引起电化学腐蚀,特别是不同金属材料接触的位置,比如冷板内部的铜、铝接头和快接头的不锈钢部件,异金属接触之后在导电液体里会形成电偶腐蚀,严重时点状腐蚀能把冷板内壁打穿。另一方面,水里的钙镁离子如果处理不干净,管路内壁会慢慢结垢,垢层增加热阻,流量下降,服务器温度跟着爬升。
工程实践里,二次侧冷却液需要定期检测电导率、pH值、总硬度和微生物含量。补液的时候要用去离子水,补液系统最好带水质在线监测功能,不要等管路堵了才发现问题。我见过一个机房的教训:补液图方便直接接了普通软水,运行半年后CDU里的过滤器堵得明显,拆开看全是絮状物和锈渣,等于把整个二次侧管路当成了水垢培养器。所以液冷工程里“管水”的工作量,一点都不比管服务器少。
4. 液冷上量后的实际运维教训:漏液、腐蚀与误报警
4.1 漏水检测机制,在实际环境中是最容易误报的环节
液冷机房一定会铺漏水检测,但传感器的布放和阈值设置,决定了这套系统的实际体验。许多人不注意的点是:漏水检测传感器有“水浸式”和“线缆式”两种,水浸式传感器靠两探针被液体短接触发,对滴水敏感;线缆式沿管线布放,可以检测到管廊里渗漏的位置,适合保护大面积区域。
实际运维里最常见的误报场景,不是真的漏液,而是凝露。高湿季节机房局部湿度大,冷板表面温度低于露点,金属管壁会产生凝结水,水滴落到底部水浸传感器上,报警直接触发。这种误报多了,运维值班会变得疲沓,真正漏液时反而容易延误响应。解决办法是给水管路加保温棉,同时传感器不要紧贴冷板滴水正下方,而是放在机房地板和机柜底部的接液盘区域,减少凝露水直接滴落的概率。
4.2 快接头和软管,是整个液冷系统里比较容易翻车的环节
对比CDU和冷板,服务器内部的软管和快接头往往因为“不起眼”而最容易被忽视。快速接头最大的问题,是各家厂商的标准并不完全统一,同一机房里如果混用了两套不同供应商的接头,端口尺寸、密封圈材质、锁紧力度都不一样,硬接容易漏,接错了更容易松动。
实际项目里,我建议在招标阶段就把快接头型号锁定,整批统一,并且安装时按规定的扭矩拧紧,不能靠手感。有些冷板产品用的是无滴漏快速接头,拔出时会自动封堵,但这种接头如果拆装次数超过设计寿命,内部密封圈会老化,反而比普通接头更容易在插拔后渗漏。机房如果经常做服务器迁移和调整,快接头一定要按寿命管理,和硬盘一样纳入备件计划。
还有一点要提醒:软管弯曲半径。二次侧软管如果折得太急,管壁会被压扁,流量下降,同时折弯处的应力会让软管老化得更快。机柜理线时,水管的走线空间和网线、电源线要分开,能走机柜侧边的就不要挤在中间,别给以后维护留隐患。
4.3 压力测试和放水操作,建议写进机房SOP
液冷系统上电之前,少不了一轮压制测试。我之前在测试现场见过工程队在管路接完后直接开泵,结果某个没拧紧的接头在高压下直接喷水,整个机柜区被迫清场。正确的流程是先做气压测试,管路系统注入干燥压缩空气或者氮气,保压观察压降,确认没有大的泄漏点后,再缓慢注液做水压测试。水压测试要按设计工作压力的1.5倍左右打压,保压至少24小时,记录压力曲线,曲线只要有明显下降就要逐段排查,这个步骤不能省。
日常维护里,放水操作也要有规范。无论什么时候要拆服务器冷板,第一步永远是“停电-关阀-排水-拆接头”。先把服务器下电,关闭对应支路的CDU阀门,排出支路余液,再拆快接头。这个顺序反了,喷射的冷却液可能直接浇到服务器主板上,轻则短路,重则整柜报废。排出来的冷却液不要直接倒掉,二次侧液体里通常有缓蚀剂,收集后如果水质没问题,可以经过过滤重新补充使用。
5. 78%之后还没被填满的洼地:液冷渗透率还能怎么涨
5.1 剩下的22%,大部分卡在“存量改造”而不是“新建设备”
既然高密新服务器的液冷渗透率已经到78%,剩下22%里的空间,主要不在新增设备,而在存量机房和边缘节点。存量机房面临的问题很现实:原来按风冷设计的空调风道、地板承重、配电容量,现在要接冷板液冷,必须先回答几个问题——空调箱和干冷器有没有扩容位置?机柜到CDU的主管路要穿过哪条走廊?原机房高低架地板下还能不能塞下更多水管?
这些工程问题叠加起来,会让部分项目选择“先不上液冷,继续用风冷压着”,也就是宁可让单柜功率受限、GPU降频跑,也不愿意承担动水系统的改造风险。但2025年之后的AI负载不会等人,很多存量机房的解决方案不是彻底重建,而是混合散热:机柜前半段还是风冷进风,机柜后门换成水冷门,或者部分高功耗机柜接液冷,周边低功耗机柜维持风冷。这种折中模式,会是把液冷渗透率从78%往更高推的主要路径。
5.2 冷板式液冷仍然是主流,浸没式大面积铺开还早
很多人问我,冷板是不是过渡方案,最终会被浸没式干掉。我的判断是,冷板式液冷至少未来三五年的主力地位还是稳的。原因是成本结构成熟、供应链完整,而且它对现有数据中心架构的兼容性更好,不用把机房改成一个巨大的电解槽。浸没式的散热能力上限更高,但容量密度、维护便利性和介质成本都还需要打磨,目前更适合超算中心这种“不计代价压性能”的场景。
冷静来看,浸没式如果要走进大规模商用,需要解决两个前置问题:一是运维的便利性,二是环保和回收。两相浸没液体的密封性和回收体系如果跟不上,成本下不来的同时还会被环保压力束缚。所以未来很长一段时间里,冷板式液冷会占大头,浸没式在局部高密场景里作为补充。
5.3 液冷渗透率继续提升的三个观察指标
如果想把目光放远一点,判断液冷是否会从78%继续走向90%,我建议盯三个指标:第一,服务器厂商的新品目录里是否还有高功耗型号的风冷版本,如果某一天连低功耗型号都默认带水冷快接口,那说明渗透率的天花板已经变了;第二,机房建设的招标文件里,是不是把液冷冷量预留写成了硬性条件,这比任何宣传口径都更接近真实采购意愿;第三,液冷二次侧冷却液和水质维护的服务商有没有形成规模,如果管路维护的产业链成熟了,原来的“不敢上液冷”会变成“敢上液冷”,渗透率自然还会往上走。
从我接触的项目看,2025年下半年这个趋势会更明显,特别是在大型云厂商的月度采购清单里,液冷服务器已经是从“可选”变成“默认”的标签。再过一两年回看,78%大概只是爬坡中间的一个点位,高密场景里的风冷选项还会持续收缩,直到变成另一个细分赛道的专有方案。这个过程中最值得投入精力的,不是争论谁取代谁,而是把液冷机房的系统设计、调试能力、运维规范沉淀下来——毕竟水冷系统一旦建好,要运营的可不止三五年。