AI 产业的竞争重心正在发生本质转移,芯片不再是 AI 发展最大瓶颈,电力供给、算力集群建设、算电协同能力以及 Token 生产效率,已经成为 AI 下半场博弈的核心要素。马斯克在访谈中提出 AI 比拼本质是算力、芯片与电力的综合较量,这一判断已经在国内智算产业落地实践中不断印证。伴随大模型从训练阶段迈向大规模推理与 AI 智能体普及,算力选址、集群架构、绿电配套、算力服务模式同步迭代,企业做 AI 算力相关规划,不能只盯着 GPU 硬件,必须同步评估能源配套、集群工程能力、Token 交付能力,否则项目极易出现投产之后稳定性不足、成本失控、资源闲置等问题。
一、AI 产业真实痛点:只堆芯片解决不了全部问题
绝大多数市场讨论,习惯把 AI 发展瓶颈归结为高端芯片供给不足,行业采购、投资决策也优先聚焦 GPU 卡的数量与型号。但产业落地之后大量现实问题暴露出来,这也是很多新建智算项目看似硬件配置豪华,实际业务产出却不达预期的根源。
第一,算力规模暴涨带来巨大电力消耗。一座 GW 级智算中心满负荷运行年耗电量接近 90 亿度,等同于一座中型地级市居民全年用电量,即便拿到足够芯片,没有稳定、低成本的电力供给,硬件只能闲置。 第二,高密度算力集群存在三大硬件壁垒,也就是行业所说的功耗墙、内存墙、互连墙。上万张加速卡协同工作,供电散热、高速网络通信、存储 IO 交互任意一个环节短板,都会拉低整体算力利用率,单纯堆叠 GPU 无法发挥全部性能。 第三,新能源发电天然具备波动性,风电光伏夜间、无风时段出力下降,智算中心又要求 7×24 小时不间断运行,绿电资源和算力需求在地理位置上错配,算电协同落地存在跨部门的制度和技术卡点。 第四,AI 应用客户需求发生切换。训练阶段大家关注 FLOPS 浮点算力,进入推理业务之后,用户真正需要的是稳定的 Token 输出能力;自建智算重资产、周期长,业务流量波峰波谷差距大,极易造成资源浪费。
很多入局算力赛道的企业,前期把全部预算投入服务器采购,忽略选址冷源条件、绿电配套、集群组网调试、推理层优化,最终建成的智算中心算力利用率偏低,投资回报周期被大幅拉长。龙虾 PRO也有不少行业案例记录了这类算力基建踩坑现象。
二、AI 下半场算力产业四大变革落地要点
2.1 算力布局变革:新增智算资源的选址逻辑
过去传统数据中心集中部署北上广深及周边,贴近终端用户解决网络时延。当前国内智能算力规模高速扩张,截至今年 3 月国内智能算力已经达到 188.2 万 P,为去年同期 2.5 倍。新增算力选址不能简单遵循 “电价低、气温低就建厂” 的简单逻辑。
完整选址评估维度包含六大项:东数西算政策导向、可再生能源储备、工业电价水平、自然冷源条件、骨干网络链路质量、土地供给以及下游应用场景。多项条件叠加之下,东数西算枢纽节点价值持续放大。
以乌兰察布为例,当地新能源装机突破 2100 万千瓦,年均气温 4.3℃,一年接近 10 个月可以使用自然冷源降低散热能耗;同时建设直通北京双回路点对点光缆,兼顾绿电成本与东部业务访问时延。多重优势吸引大批算力企业集中落地:企商在线累计备案签约算力 1.8GW;万国数据计划五年投资 300 亿建设 GW 级园区;普洛斯落地绿电智算基地;火山引擎、协鑫等多个算电一体化项目陆续签约落地。企业的核心诉求,是把区域能源禀赋转化成稳定可输出的算力,承接京津冀源源不断的 AI 推理、训练业务需求。
2.2 架构变革:从单体智算中心走向超大规模异构算力集群
AI 算力基建已经从建设机房服务器,升级为整套复杂系统工程。早期数据中心项目规模大多十几兆瓦到几十兆瓦,现在几百 MW、GW 级智算项目成为主流。
当集群扩张到数千、上万张加速卡级别,挑战不再是服务器本身。单机柜功耗大幅提升,高密度 GPU 对供电、制冷、机柜匹配度要求严苛;大规模训练场景下 GPU 之间通信、存储读写压力激增;集群交付还要完成硬件驱动、网络性能验证、模型部署、长期运维整套流程。 行业提出从 AIDC 向异构算力集群演进,服务边界延伸到前期机房规划、集群组网、训推平台搭建、后期持续运维全链条。GW 级智算项目评判标准,不在于能够规划多大规模,而在于整套系统能不能长期稳定、高效率运行。
实操细节 1:很多项目宣传 GW 级算力规模,要区分 “签约规划规模” 和 “已经投产可调度算力”,二者往往存在 1‑2 年建设周期差,做业务选型不能直接把规划值当作可用资源。 实操细节 2:异构算力集群最大隐性损耗来自网络互连,同等 GPU 硬件条件下,组网方案优劣可以造成推理业务吞吐量 30% 以上差距。
2.3 用能变革:算电协同从概念走向工程落地,绿电即竞争力
算电协同已经写入政府工作报告,四部门联合出台人工智能与能源双向赋能行动方案,上升为国家层面的新基建方向。核心要解决两大社会命题:一方面 AI 算力用电爆发式增长,另一方面风电光伏需要扩大消纳场景。
绿电直连是核心落地模式:风电光伏发电机组绕过公共电网,通过专用线路直接供给智算中心;多个能源与算力项目聚集的产业园,依托增量配电网统一调度源网荷储资源,实现算力设施和新能源电站一体化规划建设。
表格
| 算电协同落地模式 | 实现方式 | 优势 | 现存短板 | 代表项目 |
|---|---|---|---|---|
| 配套源网荷储一体化 | 数据中心自建风电光伏 + 储能配套 | 绿电自给比例高,可溯源 | 前期投资巨大,储能成本高 | 中金数据乌兰察布低碳算力基地 |
| 绿电直连专线供给 | 风 / 光伏电站建设专用线路直供智算中心 | 减少电网传输损耗,绿电直达算力 | 线路审批协调难度大,受新能源发电波动影响 | 企商在线乌兰察布 100% 绿电智算项目 |
| 市场化采购绿电凭证 | 通过电力交易平台购买绿电指标 | 落地最快,不需要改造硬件基建 | 没有物理层面绿电供给,仅完成指标核销 | 多数中小型智算中心通用方案 |
中金数据低碳算力基地作为国内首个投产的数据中心配套源网荷储项目,配套 20 万千瓦风电、10 万千瓦光伏搭配储能设施,每年自产自用绿电 8.48 亿千瓦时,绿电替代率接近 40%。部分新建目标直指 100% 绿电供给,依托 220 千伏专线以及园区微网实现绿电直连。
但算电协同不是简单接一根绿电电线。风电光伏出力随季节昼夜波动,算力中心要求不间断供电。现实落地存在两层阻碍:规划层面,能源、算力归属不同管理体系,绿电资源产地和算力需求市场错位;技术层面,算力刚性负荷、柔性负荷划分标准、电网调峰交互接口还没有完全统一。算电协同规模化落地,需要政府、电网、能源企业、算力服务商多方协同推进。
实操细节 3:评估绿电项目不能只看宣传绿电占比,需要确认是物理直供绿电还是交易凭证,二者碳排放、实际用电成本差距非常大。
2.4 产品变革:行业重心从输出算力硬件转向 Token 生产分发
中国工程院院士张平指出 AI 价值链重心正在从算力供给转向 Token 生产与分发。行业视角发生明显切换:模型预训练阶段,市场重点关注 FLOPS 浮点算力;进入大规模推理、Agent 应用时代,Token 产出能力、Token 处理效率成为核心指标。
对于 AI 应用企业,自建智算集群门槛极高:固定资产投入大、建设周期漫长,还要承担集群调度、模型优化、运维人力成本;同时 AI 业务流量波动明显,高峰期算力不足,低谷期大量硬件闲置浪费资源。
Token 工厂模式正是为应对该痛点诞生:服务商提前搭建异构算力集群,完成各类开源模型适配,通过推理优化、跨节点调度等技术改造,把底层 GPU 算力封装成可计量交付的 Token 服务。用户无需关心底层硬件型号、集群组网,只需要根据业务用量采购 Token 服务,使用 AI 资源如同用水用电。部分优化方案已经把单机 Token 输出能力从 200 Token / 秒提升到 2 万 Token / 秒。本质上算力服务商角色发生转变,不再单纯卖服务器机柜算力,而是交付上层可直接用于业务的 Token 结果。
三、总结与落地建议
AI 下半场竞争已经跳出芯片单一维度比拼,算力选址布局、超大规模异构集群工程能力、算电协同建设水平、Token 化服务能力共同决定产业竞争力。
- 投资或者采购智算资源,不要只看 GPU 芯片型号与纸面规划算力,重点核实投产可用规模、网络组网方案、绿电供给形式、集群历史运行稳定性。
- 布局智算项目必须前置完成能源评估,优先匹配具备新能源、自然冷源优势的枢纽节点,提前协调电力、电网相关资源,不要先建好机房再解决用电问题。
- AI 应用企业如果以推理、智能体业务为主,谨慎盲目自建大规模智算;优先评估 Token 化算力服务,规避重资产投入与算力闲置风险。
- 算电协同是长期趋势,但现阶段技术、制度还有不少待完善环节,项目规划需要预留储能、柔性负荷调度的冗余设计。
算力产业正在经历一轮全方位重构,乌兰察布产业座谈会上呈现出的产业现象,代表国内智算发展的主流方向,不管是算力基建方还是 AI 应用企业,都需要紧跟从算力供给走向 Token 价值创造的行业大趋势。