news 2026/9/26 8:24:50

HBM3E量产与AGI基建竞赛:算力瓶颈从模型转向数据搬运

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
HBM3E量产与AGI基建竞赛:算力瓶颈从模型转向数据搬运

1. HBM3E量产:AI算力狂飙背后的存储军备赛

1.1 为什么HBM成了大模型时代的“卡脖子”环节

如果你在过去两年做过任何大模型训练相关的工作,大概率会见过一个现象:GPU卡的价格一路飞涨,但实际上真正挡在训练效率面前的瓶颈,往往不是算力,而是显存带宽和显存容量。你可以把GPU比作一个超级大厨,把数据比作食材,HBM(High Bandwidth Memory,高带宽存储器)就是那个站在大厨身边、负责递食材的助手——助手递菜的速度不够快,大厨手艺再好也只能干等着。

这就是HBM存在的意义:把内存堆栈做厚,把接口带宽做宽,让数据传输速度追上GPU核心的计算速度。而SK海力士这次量产的HBM3E,是HBM3的增强版,直接把单颗堆栈的带宽推到了1.18TB/s以上,等效速率干到了9.6Gbps。什么概念呢?上一代HBM3的带宽大概在6.4Gbps级别,这一代提升了约五成。对于正在跑千亿参数甚至万亿参数大模型的人来说,这五成带宽意味着实打实的训练吞吐量提升,不是纸面参数好看那么简单。

SK海力士说这是“业界首款量产HBM3E”,坦率讲,这个“首款”的含金量不小。因为HBM的制造难度在于TSV硅通孔工艺的良率控制——要在20层甚至更高的DRAM堆叠里打通上万个垂直通孔,每一层的对准误差、热膨胀系数差异都会积累成良率杀手。业内做HBM的其实不止SK海力士一家,三星、美光也都有布局,但量产节奏、良率表现和稳定供货能力才是决定落地的关键。

1.2 HBM3E到底强在哪:带宽、容量与能效的三重升级

理解HBM3E的升级点,我建议从三个维度入手,这也是实际选型时要看的核心参数。

第一个是带宽。刚才说了,单颗HBM3E的带宽在1.18TB/s左右。实际使用中,一颗GPU通常挂6到8颗HBM堆栈,以英伟达H200为例,8颗HBM3E堆栈可以提供约4.8TB/s的总带宽。这个带宽意味着,在训练一个175B参数的模型时,参数读写的等待时间会显著缩短,GPU的利用率能往85%以上走。没做过分布式训练的读者可能没有直观感受,这么说吧:同样的模型、同样的数据,从HBM3换到HBM3E,训练收敛速度可能会有平均10-20%的改善——在算力资源按小时计价的时代,这就是成本差异。

第二个是容量。HBM3E单颗容量做到了24GB,比HBM3的16GB多了50%。大模型训练时,显存容量直接决定了你能塞多大的batch size、能不能把模型参数和梯度整个放进显存,进而影响流水线并行所需的层切分数。容量大了,切层就能切得少,跨卡通信的P2P流量就能降下来,训练效率自然跟着上去了。

第三个是能效。HBM3E的能效比HBM3提升了不少。数据中心里,GPU和内存的功耗高居不下,单位带宽的功耗如果能降下来,整个机柜的散热压力和电费账单都会好看一些。做运营的人都会算这笔账:一个训练集群动辄几千张卡,每张卡省10-20瓦,合起来就是几十千瓦的功耗削减——省下的不只是电费,还有机房扩容的资本开支。

1.3 布局HBM的玩家格局:SK海力士、三星与美光的竞速关系

在HBM这条赛道上,SK海力士目前的节奏是最快的。它在HBM3时代就已经是英伟达的主要供应商,HBM3E的量产进度也比三星和美光领先了一个身位。三星虽然在DRAM工艺上是老牌强者,但HBM需要的高频宽+3D堆叠+先进封装复合能力,和传统DRAM制造是两码事。三星的内部研发节奏、产品验证周期以及和GPU厂商的联合调校深度,目前来看都还有追赶的距离。美光则把重心放在新兴市场和特定大客户订单上,产能爬坡速度相对保守。

这里有一个容易被忽略的技术细节:HBM3E的接口速度和信号完整性密切相关。引脚数增加意味着封装基板的布线复杂度上升,信号之间的串扰风险也在加大。SK海力士在存储行业里跟英伟达配合多年,对GPU侧对HBM的物理层要求理解得更深,这其实是一种“软实力”,不是光看产线设施就能判断的。

1.4 对国内产业链的启示:不只是“买得到”的问题

HBM3E量产对国内的影响,最直接的就是训练用加速卡能配到更大带宽的显存。但更值得关注的反面是——HBM的供给格局愈是集中在少数厂商手里,就愈是凸显了国内在DRAM先进工艺和3D封装上的两头短板。HBM的技术路径依赖设备的精度和工艺整合能力,这需要长期的产线验证。短期内指望靠哪一家独立把HBM做出来,都不太现实,真正务实的路线是先把封测端的TSV和单片薄化工艺打磨起来,同时推动国产DRAM逐步向更高的接口频率演进。

有一位做存储芯片的朋友跟我聊过,说HBM领域的竞争本质上是“工艺整合的综合体操”:DRAM单元设计、TSV工艺、热管理、测试筛选、与GPU的联合调优,五个环节缺一个就量产不了。这个说法很准确。所以看到SK海力士量产HBM3E的新闻,不应该只停留在“牛”这个层面,而要想清楚它在供应链里占据什么位置、这种位置是怎么建立的、替代者要补齐哪些短板。

2. 三星成立AGI计算实验室:巨头押注“下一层算力栈”

2.1 三星最缺的不是芯片,而是一个自己的“OpenAI时刻”

三星本来就有自己的AI部门,也有Exynos芯片和半导体代工业务,但过去很长一段时间,它在AI领域的形象是“硬核供应链公司”,而不是“AI应用/模型的领头羊”。对,它给苹果代工、给高通代工、给英伟达提供HBM和存储,但很少有人在讨论“三星的模型能力”或者“三星的AI产品体验”。

这次的AGI计算实验室,显然不是重组一个研发小组玩玩,而是要在算力架构层面真正把AGI的内存侧痛点吃透——三星最擅长的是什么?存储。而AGI模型训练对存储的依赖,恰恰是整个算力体系里最容易被低估、但需求最大的一环。

我个人的理解是:三星的AGI计算实验室瞄准的并非“训练出下一个GPT-5”,而是想要构建一套以存储为轴心、以算力架构为杠杆的综合解决方案,让未来的AGI训练集群更高效、更便宜、更能扩展。也就是说,它不去跟OpenAI拼模型参数,而是跑去做AGI基建生意的上游核心供应商——这条路对三星来说既契合技术基因,又避开了与现有头部模型厂商的正面消耗战。

2.2 AGI计算实验室的团队战略:为什么行业大佬纷至沓来

三星在成立这个实验室的时候,招募了包括之前在苹果、谷歌、英伟达等公司供职过的顶尖人才,说是“汇聚了全球顶级的计算架构和加速计算专家”。这其实是一个非常标志性的动作:AGI的竞争已经从单纯的算法竞赛,转向了“算法+工程+硬件+系统软件”的全栈竞争。

目前业内对AGI计算实验室的一个猜测是,三星会把它作为下一代AI专用存储和近存计算技术的孵化平台。近存计算(Near-Memory Computing)概念讲了十年,一直没有找到大规模落地的场景,但大模型的出现重燃了这个方向——如果你能把一部分计算直接放到存储旁边,而不是把数据搬回GPU核心里算,那么带宽瓶颈就可以缓解一个数量级。这件事,最适合做存储的人来做。

三星在卖存储芯片、代工逻辑芯片、制造HBM和DRAM这些方面的产业链纵深,恰好可以支撑近存计算的落地实验。这个实验室如果能在3-5年内做出量产级的产品,会改变目前AI计算体系里“以GPU为核心的搬运架构”,这比单纯做一个模型公司更有护城河。

2.3 从HBM到近存计算:AGI计算实验室的潜在技术方向推测

顺着三星的技术资产往下推,AGI计算实验室最可能的研发方向有这么几个:

  • 面向万亿级参数模型的存储访问优化,也就是把HBM3E、HBM4引入到自定义的互连和缓存一致性协议里,而不是等GPU厂商来定义标准。
  • 存内计算和近存计算引擎,用于Attention机制中高频的矩阵乘法和KV Cache读写。Attention的计算模式是“重读+轻算”,特别适合近数据计算。
  • 异构内存系统设计,比如让LPDDR、GDDR和HBM之间形成自动的数据分层调度,在训练效率与成本之间找到平衡。
  • AGI推理侧的低功耗计算,未来的AGI若进入手机和端侧设备,存储带宽和功耗必须同步压缩,这是三星终端业务天然的需求牵引。

这些方向没有一个会在短期内有爆炸性新闻,但它们的终点都是同一个:把AGI的算力成本从目前的“烧钱无底洞”压到“可商业闭环”的水平。

2.4 大厂AI实验室的军备赛正在从“参数竞赛”走向“内存架构竞赛”

过去两年,AI圈的主旋律是“发多少参数、多少token、多少能力指标”。但三星这个动作和SK海力士量产HBM3E,同时指向了一个信号:整个行业开始意识到,AGI时代的本质瓶颈不是模型能力,而是数据搬运能力。当模型能力因算法突破而趋同时,谁能更快、更省地把数据喂给计算单元,谁就在成本和效率上拉开代差。

打个比方,上一轮大厂竞争的焦点是“把发动机造得更猛”,现在开始有人意识到“油箱、油路和变速箱不重新设计,发动机猛也没用”。SK海力士和三星都看到了这个转变,而且它们手里握着油路的核心专利。这也是为什么这两条新闻放在同一天看会格外有意思——存储巨头正在从幕后走到AGI基建的中心舞台。

3. 英伟达的Project GR00T:仿生机器人的“ChatGPT时刻”

3.1 从GPU到机器人:英伟达为什么在这个时候下场

Project GR00T是英伟达最新推出的一个通用基础模型项目,目标是让人形机器人学会理解自然语言、模仿人类动作,并通过感知环境来执行复杂的物理任务。名字本身就是个彩蛋——GR00T是《银河护卫队》里格鲁特(Groot)的变体写法,英文的Groot念快一点就是GR00T,暗示“养成系”的机器人成长逻辑。

英伟达做这件事的动机非常清晰:他们在GPU上赚到的钱,靠的是全球AI训练算力的需求爆发。但这个需求终有一天会从模型训练转向物理世界的交互数据。而物理AI(Physical AI)——也就是能感知、理解、决策、行动的智能体——正是英伟达计算平台的下一个增长点。所以Project GR00T不只是一个人形机器人项目,它实际上是英伟达把CUDA生态从“大模型训练平台”拓展到“具身智能开发平台”的战略锚点。

3.2 GR00T到底要解决什么:具身智能的“通用大脑”

现在市面上很多机器人创业公司做的是“专机专用”:专门送餐的机器人、专门搬运的机器人、专门跳舞的机器人。Project GR00T的思路是完全相反的——它想做一个通用的“机器人大脑”,让任何人类形态的机器人硬件,插上这个大脑之后,就能听得懂自然语言指令、看懂周围场景、自主规划动作序列并执行。

这其实比做语言模型难得多。语言模型处理的是符号序列,而机器人模型处理的是连续空间里的物理运动——关节角度、力矩、接触力、目标位置、障碍物判断,这些东西都属于高维连续变量,不是简单地把token预测对就算完。GR00T的路线是通过海量的人类演示视频和物理交互数据,训练一个多模态模型,让机器人学会把视频观察到的动作“翻译”成自己的关节控制指令。

3.3 Isaac平台与GR00T的协同:英伟达的“机器人安卓时刻”

光有通用机器人大脑还不够,你需要一整套开发工具链把训练好的模型部署到真实机器人上。英伟达在这块下了重注:Isaac机器人平台、Isaac Sim仿真环境、Jetson Thor边缘计算模块、以及Omniverse里基于物理准确的仿真世界。英伟达的意图很明确:让开发者可以在仿真环境里用海量数据和物理模拟训练GR00T,再把训练好的策略模型部署到真实硬件,最后通过实际场景的数据回流进一步迭代。

这个闭环像极了当年的安卓:Google不做手机硬件,但提供操作系统和应用生态。英伟达说了“帮助机器人公司开发人形机器人,而不是自己做机器人”,策略上就是明确要做“机器人大脑+开发平台”的安卓角色,把具体的机械设计和落地场景交给特斯拉、波士顿动力、Figure这些硬件玩家。

3.4 人形机器人的难点:不是“像人”而是“像人一样泛化”

很多人对Project GR00T的理解停留在“让机器人更像人”。但真正的难点在于“泛化能力”。工业机械臂在一个固定工位重复执行同一动作,本质上只需要固定的轨迹规划,这在几十年前的工业自动化里就实现了。但人形机器人面对的是开放世界——桌子上的杯子位置随时会变,门把手的高矮各不相同,光照条件、地面摩擦、物体材质都在变。模型如果只在有限场景里训练,换个环境就抓瞎。

GR00T想做到的是“像人一样举一反三”:看到一次倒水的动作,就能迁移到不同的杯子和水壶上;学会开门,就能应对各种方向的推拉门。这种跨场景迁移能力,正是大模型里的泛化能力在物理世界的延伸。英伟达的思路是用大量高质量的人类视频做预训练,然后在仿真环境里强化学习细节动作,让模型建立起物理世界的内部表征——这是目前行业里公认最有可能通往通用机器人的技术路径。

3.5 Project GR00T的行业连锁反应:机器人公司的新物种浮现

如果GR00T当真达到预期的能力水平,不用怀疑,行业会出现一轮洗牌。硬件公司的估值逻辑会从“我有更好的机械臂”转向“我的机械臂适配GR00T这类通用大脑的程度更高”;软件公司的壁垒则转向“谁能积累更多更好的机器人物理交互数据”;而数据采集、仿真场景生成、关节执行器精度这些原本冷门的赛道会一夜之间成为投资热点。

回头再看英伟达为什么做这件事,逻辑就完全闭环了:先让大模型学会理解世界(语言+视觉),再让机器人学会在物理世界执行(GR00T大脑),再让开发者用同一套GPU和仿真工具链进行研发和部署(Omniverse+Isaac),英伟达自然而然成为从数字智能到具身智能的最大基础设施提供商。

4. 聊点产业规律与个人观察:这场AGI竞赛里真正稀缺的能力

4.1 存储巨头集体放量HBM的背后,是AI泡沫论最有力的反驳

在我接触到的从业者里,对AI有过“泡沫质疑”的人不少。但如果你认真看HBM3E的量产排期和各厂商的扩产计划,你会发现一个很现实的事情:如果大模型训练需求没有真实落地,存储厂商不会砸那么多资本开支新增产线。因为存储是一个周期性极强的行业,上产能容易、下产能难,一旦判断失误,库存就会变成巨大的财务包袱。

SK海力士、三星的HBM产能全部提前锁定,美光也开始跟进,这本身就是市场给出的答案:AI的算力需求不是资本市场的叙事,而是实打实的晶圆订单。而且需要看到,HBM的毛利率远高于传统DRAM,对整个存储行业的利润结构也是一次重塑。过去的存储周期是“随波逐流”,现在则是被AI需求拽着走——这就是产业结构的切换信号。

4.2 AGI算力竞争的下半场关键词:内存带宽、物理AI、仿真

把三条新闻放在一起看,可以提炼出三个下半场关键词:

第一是内存带宽。大模型的时代瓶颈在数据搬运,谁能把带宽和容量做上去、把功耗压下来,谁就能占据算力供应链的核心位置。HBM3E量产是这条赛道的标志性节点,HBM4则已经提上日程。

第二是物理AI。从语言模型到做事的智能体,AI正在从屏幕里的文本输出,走向真实世界的感知与执行。Project GR00T跑通的那一天,就是AGI从“会聊天”跨越到“会干活”的分水岭。

第三是仿真。GR00T依赖Omniverse仿真环境来生成训练数据和测试策略,三星的AGI计算实验室大概率也会用仿真来做存储架构验证——物理世界里的实验成本太高,价值正在无限放大。

4.3 给做AI应用和做硬件的人各一句实在话

如果你做的是AI应用层,我身边经验是:不要只盯着模型榜单升级,要多关注底层硬件变化。HBM3E这类存储升级带来的性能红利,会直接传导到应用层的推理成本——当GPU利用率因为带宽提升而上涨,你的推理单价就会下降,商业模式的天花板会被抬高。早点把硬件参数变化纳入你的成本模型预算表里,是相当实用的习惯。

如果你做的是硬件或芯片方向,我的建议是:从现在开始,把“物理AI”当作一个真实的市场来研究,而不是概念。人形机器人和具身智能不只是一堆demo视频,它已经在拉动传感器、执行器、仿真软件和边缘算力的真实需求。如果你所在的团队目前还没有任何物理AI相关的技术储备,那么在接下来的24个月里,这可能是一个需要认真决策的议题。

我自己最近在整理一套关于大模型推理集群的显存配比和HBM带宽利用率的数据分析,跟很多做Infra的朋友聊过之后一个很深的感触是,行业跑得比新闻快:当你看到HBM3E量产的新闻时,那些头部厂商的HBM4需求规格书早就已经写完了。等新闻进入大众视野,机会窗口往往已经过半,真正能抓住红利的方法只有一个——保持对技术供应链底层的持续追踪,而不是只看应用层的热闹。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/26 8:23:54

北理工数据结构实战资源:C++二叉树与排序调试指南

简介:本资源是北京理工大学2020年《数据结构》课程的完整学习套件,面向C编程初学者及计算机专业本科生,聚焦数据结构核心概念的理解与工程实现能力培养。资源共65个文件,涵盖29个C源码(含股票撮合、迷宫求解、关键路径…

作者头像 李华
网站建设 2026/9/26 8:22:44

OpenClaw本地部署实战:环境、时序与配置深度调优指南

1. OpenClaw不是“装完就能跑”的玩具,而是需要亲手调校的精密仪器 OpenClaw这个名字最近在AI Agent开发圈里火得有点突然——它不像Ollama那样主打“一键拉模型”,也不像Dify那样强调可视化编排,而是以“轻量级、可嵌入、强可控”为标签&…

作者头像 李华
网站建设 2026/9/26 8:22:04

Git Worktree 并行多会话:Claude Code 开发效率提升实战

1. 为什么单会话模式正在拖垮你的开发效率 如果你现在还在一个终端窗口里跟 AI 编程助手一问一答,那你大概率已经感受到了那种"排队等回复"的窒息感。我最初用 Claude Code 的时候也是这样,一个会话跑到底,改完一个模块再改下一个&…

作者头像 李华
网站建设 2026/9/26 8:20:49

AIO Sandbox:把浏览器、Shell、MCP和VSCode装进同一个Agent沙箱

做 Agent 项目的朋友应该都经历过这种循环:先配好 Playwright 环境,跑通一个浏览器自动化脚本;接着要执行清理命令,又得切到另一套容器;数据落到文件里,还得把卷挂出来让另一个服务读到。我自己之前维护的工…

作者头像 李华
网站建设 2026/9/26 8:19:34

OpenTTD 货运分配链路图(Link Graph)机制与性能调优指南

游戏开发 【免费下载链接】OpenTTD OpenTTD is an open source simulation game based upon Transport Tycoon Deluxe 项目地址: https://gitcode.com/gh_mirrors/op/OpenTTD 点击查看 免费下载 本文以 docs/linkgraph.md 为主线,结合 OpenTTD 源码中 s…

作者头像 李华