**一句话结论:HBM(High Bandwidth Memory,高带宽内存)不是更快的内存条,而是把 DRAM 芯片垂直摞起来、再用一条超宽接口怼到计算芯片旁边的内存子系统。**它用「立体堆叠换距离、并行换速度」两个动作,把带宽做到同代 DDR 的十几倍,代价是价格数倍于普通内存、产能常年紧张——今天买 AI 加速卡,花在 HBM 上的钱可能占整机物料成本的三分之一以上,这也是为什么每一条 HBM 新闻都能影响整个 AI 产业链。
先说问题:算力涨得快,喂饭的管子跟不上
GPU 的算力(FLOPS)这些年是指数级增长,但内存带宽的增速远远落后——1995 年 Wulf 和 McKee 就提出过「内存墙」(memory wall)这个说法:处理器性能每 年涨 50% 以上,而内存延迟和带宽的改善慢得多,迟早会变成瓶颈。
大模型把这个老问题变成了生死问题。推理时每生成一个 token,都要把模型权重(动辄上百 GB)和不断增长的 KV Cache 从显存里搬进计算单元。算子的算术强度很低——读几百字节权重,只做几次乘加——所以大部分时间计算单元在等数据。这就是为什么 H100 跑大模型推理,实测利用率常常只有三到五成:不是算不动,是喂不饱。
上一篇文章 《一篇读懂 KV Cache》讲过显存里的账怎么算;这篇讲的是那根「喂饭的管子」本身。
HBM 的两个关键动作
动作一:把内存摞起来
传统内存条是平铺的:DRAM 颗粒躺在 PCB 上,距离计算芯片几厘米,信号要走长长的走线。HBM 的做法是把 4 到 16 片 DRAM 裸片(die)垂直堆叠,片与片之间用 TSV(硅通孔,Through-Silicon Via)——也就是在硅片上打穿垂直导电的「隧道」——直接连接,整个堆叠再通过硅中介层(interposer)贴在 GPU 旁边,距离从「几厘米」缩到「毫米级」。
flowchart TB
subgraph HBM 堆叠
D4[DRAM 裸片 ×N] --- D3[DRAM 裸片] --- D2[DRAM 裸片] --- D1[逻辑裸片 base die]
end
D1 == TSV 垂直互联 ==> I[硅中介层 Interposer]
subgraph GPU
C[计算裸片]
end
I --- C
I === 超宽并行接口 1024/2048-bit === C
距离短了,信号又宽又并行,每个引脚就不用跑太高频率——这意味着更低延迟、更低功耗。DDR5 单根跑 6400 MT/s 要靠高时钟硬顶,HBM 每个引脚只要 6.4~9.6 Gb/s,但引脚数量是它的成百上千倍。
动作二:把接口加宽
HBM1/HBM2/HBM3 用的都是 1024-bit 超宽接口(对比:DDR5 单通道 64-bit、GDDR6X 显存接口 384-bit)。带宽的账很简单:
带宽 = 接口位宽 × 每引脚速率。位宽 16 倍于 GDDR,每引脚速率只需要它的四分之一左右,总带宽就能反超数倍。
到 HBM4,JEDEC 干脆把接口再翻倍到 2048-bit、32 个独立通道,配合每引脚 8 Gb/s,单堆叠带宽达到 2 TB/s。
四代演进:十年,单堆叠带宽 16 倍
| 代际 | JEDEC 规范 / 时间 | 每堆叠带宽 | 关键变化 |
|---|---|---|---|
| HBM | JESD229,2013-10 | ~128 GB/s | 奠定 TSV 堆叠 + 1024-bit 接口;2015 年首用于 AMD Radeon Fury X |
| HBM2 | JESD235A,2016-01 | ~256 GB/s | 堆叠容量翻倍(8-high),带宽翻倍 |
| HBM3 | JESD238,2022-01 | 819 GB/s | 独立通道 8→16,速率 6.4 Gb/s,支持 12 层堆叠 |
| HBM3E | HBM3 的增强版,2023 起 | ~1.15 TB/s | 12 层 36GB 产品 2024-09 由 SK hynix 率先量产,引脚速率 9.6 Gb/s |
| HBM4 | JESD270-4,2025-04 | 2 TB/s | 接口 1024→2048-bit(32 通道),每引脚 8 Gb/s,支持 16 层堆叠 |
(来源:JEDEC 官方公告与 SK hynix 量产新闻稿,见文末参考资料。)
规律很清楚:HBM1→HBM3 主要靠提频率和加通道,HBM4 开始直接把接口位宽翻倍——因为单纯提频已经撞上功耗和信号完整性的墙,「加宽」比「加速」更可持续。
旗舰加速卡对照:一半身价在内存上
| 加速卡 | 显存 | 显存带宽 | 备注 |
|---|---|---|---|
| NVIDIA A100 (80GB) | 80 GB HBM2E | ~2 TB/s | 2020 年,训练卡标配的起点 |
| NVIDIA H100 (SXM) | 80 GB HBM3 | 3.35 TB/s | 2022 年,首代用上 HBM3 |
| NVIDIA H200 | 141 GB HBM3E | 4.8 TB/s | 2024 年,首款 HBM3E 卡 |
| NVIDIA B200 | 192 GB HBM3E | 8 TB/s | Blackwell,双裸片设计 |
| AMD MI300X | 192 GB HBM3 | 5.3 TB/s | AMD 以「堆显存」对抗 CUDA 生态的卖点 |
(容量与带宽均以各厂商官方规格页为准,截至 2026-10-08。)
看这张表能理解两件事:
- 两代 GPU 之间带宽涨 2~4 倍,跟 FLOPS 的涨幅同一量级——HBM 没有掉队,是因为它自己也在快速迭代。
- AMD MI300X 的竞争策略就是显存:算力生态打不过 CUDA,就给你 192GB 大显存 + 5.3TB/s 带宽,让 70B 级模型一张卡装下。内存容量成了差异化武器。
为什么难:贵和缺的根源
良率账:一个 12 层 HBM 堆叠要 12 片 DRAM 全部合格才能出厂。假设单片良率 90%,十二片全好的概率只有 28%。虽然实际生产中会修复和分档(这也是为什么同代 HBM 会有不同规格的 bin),但堆叠层数越高,良率越敏感。SK hynix 做 12 层 HBM3E 时专门把 DRAM 裸片削薄了 40%,才能在 8 层的厚度里塞进 12 层。
封装账:HBM 和 GPU 之间要靠硅中介层(如台积电 CoWoS 这类 2.5D 封装)连接,中介层面积大、工艺复杂,2023 年以来 CoWoS 产能一直是 NVIDIA 出货节奏的卡点。一片 GPU 周围贴 6~8 个 HBM 堆叠,对封装良率是双重考验。
散热账:堆叠让发热密度暴涨,DRAM 对温度又敏感(高温漏电、刷新变频繁)。SK hynix 用 MR-MUF(液态热固材料 + 底部填充)、三星用 TC-NCF(热压缩非导电薄膜)等不同封装工艺解决层间散热——这也是三家的核心工艺差异。
格局账:HBM 是个典型的三强市场——SK hynix、三星、美光。SK hynix 凭借在 HBM3/HBM3E 上先发卡位 H100/H200 供应链,处于领先位置;三星高管近期公开预计 HBM 将占到 DRAM 行业总产能的近 30%(截至 2026-10 的行业预期)——传统 DRAM 产线向 HBM 转产,本身就在改变整个存储行业的供给结构。
争议与边界:HBM 不是终点
- 太贵:每比特成本是普通 DDR 的数倍。推理服务商会算另一笔账:同样的预算,用更多便宜的内存换更低的带宽行不行?这就是 CXL 内存扩展、甚至 LPDDR 方案存在的原因——用容量换带宽,适合对延迟不敏感的批量任务。
- 另一个极端是干脆不用 DRAM:Groq 的 LPU 用几百 MB 的超大片上 SRAM 装整个模型,把带宽问题从「墙」变成「不存在」,代价是模型一大就要几百颗芯片组网。SRAM 快但贵、密度低,这条路目前只在特定推理场景成立。
- HBM4 引入新变量:接口翻倍后,base die(堆叠底部的逻辑裸片)的职责加重,行业出现了「base die 定制化」的动向——不同客户要求不同的基底逻辑(更好的纠错、缓存或直连 I/O),存储厂商和晶圆代工厂开始在这一层分工协作。这会让 HBM 从「标准品」慢慢长出「半定制」属性,也是各家拉开差距的新战场(截至 2026-10 的行业动向)。
小结
回到开头的问题:AI 加速卡的规格表应该先看哪一行?**先看显存带宽,再看容量,最后才是 FLOPS。**大模型推理是带宽受限的负载,带宽决定每秒能生成多少 token,容量决定能装多大的模型和上下文,而 FLOPS 只决定你花电费等数据的时候芯片空转得多体面。
HBM 的本质是把「内存离计算太远」这个四十年的老问题,用立体堆叠和超宽接口硬摞矮了。它贵、缺、被三家公司卡着脖子,但至少今天,它仍是喂饱大模型最经济的那根管子。
参考资料
- JEDEC: JEDEC and Industry Leaders Collaborate to Release JESD270-4 HBM4 Standard(2025-04,HBM4 规范官方公告)
- SK hynix Newsroom: Begins Volume Production of the World's First 12-Layer HBM3E(2024-09,36GB 12 层 HBM3E 量产,1.15TB/s)
- AMD Instinct MI300X Accelerator 官方规格页(192GB HBM3 / 5.3TB/s)
- NVIDIA DGX B200 / HGX 官方规格(B200 8TB/s HBM3E;H200 141GB / 4.8TB/s)
- JEDEC: HBM3 Update (JESD238) Press Release(2022-01,819GB/s、16 通道)
- Wikipedia: High Bandwidth Memory(HBM/HBM2 代际时间线综述)
- Wulf & McKee, Hitting the Memory Wall: Implications of the Obvious(1995,「内存墙」概念出处)
读者留言
COMMENTS 暂无还没有留言,来说第一句?