这是「DRAM 六十年」工程笔记的下篇。上篇建立了 1T1C 的物理坐标系——6F²、tRC、prefetch;本篇直接沿用这些概念,回答更"硬"的问题。
为什么 DRAM 缩不下去的卡点永远是那只电容?80:1 的高宽比是怎么被一步步逼出来的?1α/1β/1γ 到底是几纳米?EUV 在 DRAM 上为什么三巨头给出三个不同答案?HBM 一代代往上叠,钱到底花在哪几道工序?4F²、3D DRAM、IGZO、PIM、CXL,哪个是"PPT"、哪个已经做出来了?
📊 核心数据一览
一、真正的物理边界:那只电容
DRAM 缩不下去,卡点几乎永远是那只电容。读出时感放需要至少 ~100 mV 的信号摆幅,它由电容上的电荷重新分布给位线寄生电容(C_BL ≈ 几十 fF)算出来:
📐 ΔV_BL = (V_cell − V_BL_pre) × C_cell / (C_cell + C_BL)
要保证 ΔV ≥ 100 mV、压差 ≈ 500 mV(VDD/2),代入可得:单元电容至少 ~10 fF
但单元在平面上只有 6F² ≈ 1000 nm²,平面电容做到 1–2 fF 就到顶——所以必须把电容做成立式柱状。
1.1 为什么电容必须"立起来"
立式电容值 ≈ ε × (2πr × H) / d,侧面积跟柱高 H 成正比——把柱子做高(1.5 → 2 → 2.5 μm)就能补上单元面积变小带来的损失。代价是高宽比 A/R = H / Ø 越做越大,从早期 ~20:1 一路爬到现在的 ~80:1。
1.2 高 k 介质材料的军备竞赛
电容公式 C = ε × A / d 里,除了拉大 A(柱子做高),还能提高 ε、减小 d。介质材料一路演化:
| 材料 | 介电常数 ε | 大致阶段 |
|---|---|---|
| SiO₂ | ≈ 3.9 | 1990s |
| Si₃N₄ / ONO 多层 | ≈ 7–8 | 2000s 初 |
| Al₂O₃ | ≈ 9 | 2000s 中 |
| HfO₂ / ZrO₂ | ≈ 25 | 2010s 起主流 |
| ZAZ(ZrO₂/Al₂O₃/ZrO₂)多层 | ≈ 30 | 现在主流 |
| SrTiO₃ 等候选 | ≈ 200+ | 研究中 |
代价是高 k 材料漏电大、ALD(原子层沉积)难、界面态难控。当代 DRAM 电容典型介质厚度 d ≈ 5 nm。
1.3 现在的 A/R 与极限
🔩 A/R = 80:1 意味着要挖一个直径 30 nm、深约 2.4 μm 的高纵深比孔,几道工序都极难:
🔩 HARC 蚀刻:垂直挖出近 100:1 的孔,孔底不能比孔口窄太多——东京电子(TEL)和 Lam Research 近乎独占
🔩 侧壁 ALD:在 2 μm 深的孔壁均匀沉积 5 nm 介质,每层均匀度 < 1%
🔩 顶板填充:用 W、TiN 把柱子内部填满,不能有空隙
业界共识:A/R > 100:1 在量产规模上风险很大。所以 1γ 之后再想缩单元,靠"更小、更高"的传统路线撑不下去了,必须换架构——这就引出第五章的 4F² 与 3D DRAM。
二、节点命名、EUV,与三家不一样的路线
2.1 1x / 1y / 1z / 1α / 1β / 1γ 到底是几纳米
DRAM 节点命名其实是营销,不是物理——"1α nm"不是 1 纳米,只是"1x → 1y → 1z 之后的下一个节点",希腊字母纯粹为了不再用字母 abc。
| 节点名 | 约对应有效线宽 | 首发 / 公开量产窗口 |
|---|---|---|
| 20 nm class | ~24–22 nm | 2012–2014 |
| 1x nm | ~19–20 nm | 2014–2016 |
| 1y nm | ~17–18 nm | 2016–2017 |
| 1z nm | ~15–16 nm | 2018–2019 |
| 1α nm (1a) | ~14 nm | 2021(美光首发量产) |
| 1β nm (1b) | ~12 nm | 2023 |
| 1γ nm (1c) | ~10–11 nm | 2024–2026 |
| 1δ nm (1d) | ~9 nm 量级 | 2026+ 规划 / 研发 |
缩微在明显变慢:1y → 1z 三星花了 18 个月,1z → 1α 花了 30 个月。30 年前的"每 18 个月翻一倍",在 DRAM 上已经变成"每 30 个月单元面积缩 ~30%"。
2.2 EUV 选择题:三家不一样
EUV 在逻辑芯片上从 7 nm 就大规模上车;在 DRAM 上来得晚得多——因为 DRAM 层数少(约 30 层金属 vs 逻辑的 80+ 层)、对图形复杂度不那么苛刻,多重曝光还撑得住。三家的策略明显不同:
| 厂商 | 首次 EUV 节点 | 时间 | 策略 |
|---|---|---|---|
| 三星 | 1α (1a) | 2021 Q3 | 激进派,一开始就上 EUV,只用单层、用在最关键图形层 |
| SK 海力士 | 1α (1a) | 2021 Q4 | 跟进派,与三星节奏接近 |
| 美光 | 1γ (1c) | 2025 | 谨慎派,1α/1β 两代用多重曝光浸没式撑过去,1γ 才首次导入 EUV |
为什么美光晚?EUV 设备贵——每台 ASML NXE:3600D 报价约 1.8 亿美元,最新高 NA 的 EXE 系列超 3.5 亿美元,产能爬坡慢、晶圆成本上升。美光算账的结论:1α、1β 用多重曝光还能压住成本曲线;到 1γ 关键层曝光步骤太多、良率下不来,才转向 EUV。
💡 回头看,三条路线都 work。但到 1γ 这一代,EUV 已经从"可选题"变成"主线题"——多重曝光在关键层继续硬撑的边际成本越来越高。
2.3 节点缩微的边际收益在衰减
每代节点线宽缩 ~15%、单元面积缩 ~25–30%,但良率、缺陷密度、电容做高的成本也随之上升。综合算下来:bit/wafer 增加 ~25–30%、wafer 成本上升 ~10–15%,单位 bit 成本每代只下降约 10–15%——比早年每代 30% 差得多。这正是三星与 SK 海力士过去 10 年另辟 HBM、CXL、PIM 等高溢价战场的原因。
三、三条平行分支:LPDDR、GDDR、HBM
DDR 主线之外,还有三条走不同 trade-off 的平行分支——同一颗 DRAM 内核,三种取舍。
3.1 LPDDR:移动设备的功耗优先
🔋 电压更低:LPDDR5 VDD1 1.8 V / VDD2 1.05 V / VDDQ 0.5 V
🔋 去掉 DIMM 接口:BGA 颗粒直接焊主板(PoP/on-board),不可拆卸,但走线短、信号完整性好
🔋 更宽内部 prefetch:LPDDR5 是 16n × 2 子通道,与 DDR5 类似
有意思的是 LPDDR 现在跑得比 DDR 还快——LPDDR5X 8533 MT/s、LPDDR5T 9600 MT/s,2025 年定稿的 LPDDR6 首发目标约 10.7 Gbps、规划拉到 14.4 Gbps。原因是手机 SoC 对带宽的渴求(端侧 AI、4K 录像、高刷屏)拉得更猛,而 LPDDR 板级走线短,比 DIMM 容易跑高速。苹果 M 系列把 LPDDR5 直接做进 SoC 封装(统一内存架构),是这条路线的极致。
3.2 GDDR:图形卡的带宽优先
GDDR 是 GPU 显存,和 DDR 同源但走另一种 trade-off:宽接口 + 高速率,不太关心容量与功耗。
| 代际 | 起始年 | 接口 | 速率 | 信号编码 |
|---|---|---|---|---|
| GDDR5 | 2008 | 32-bit | 5–8 Gbps | NRZ |
| GDDR5X | 2016 | 32-bit | 10–14 Gbps | QDR |
| GDDR6 | 2018 | 32-bit | 14–20 Gbps | NRZ |
| GDDR6X | 2020 | 32-bit | 19–24 Gbps | PAM4 |
| GDDR7 | 2024 | 32-bit | 32–40 Gbps | PAM3 |
GDDR6X 是美光与 NVIDIA 合作,引入 PAM4 每符号塞 2 bit;GDDR7 又转回 PAM3(每符号 1.58 bit)——因为 PAM4 在 36+ Gbps 下信号完整性极难维护、误码率太高。GDDR 的天花板是它做不了极宽接口:每通道 32-bit,一块 RTX 5090 用 16 颗 GDDR7 也只能拼出 512-bit 总线,带宽极限约 1.7 TB/s。而 HBM 一个 stack 就是 1024-bit。
3.3 HBM:AI 把存储推上 C 位
HBM 是 2013 年 JEDEC 标准化、专门为 GPU 和 AI 加速器设计的 3D 堆叠 DRAM。关键设计选择:
🧱 超宽接口:单 stack 1024-bit(HBM1–HBM3E),HBM4 升到 2048-bit
🧱 TSV + microbump:8/12 颗 DRAM die 上下堆叠,靠垂直穿透硅的通孔通信
🧱 interposer(2.5D 转接板):HBM stack 和 GPU 焊在同一块硅转接板上,距离 < 1 cm
🧱 慢时钟 + 宽接口:HBM3E 单 pin 只有 9.6 Gbps,但 1024 pin × 9.6 Gbps = 1.23 TB/s 单 stack
HBM 已是 AI 训练 GPU 的标配:H100 SXM 配 5 个 HBM3 = 80 GB / 3.35 TB/s;H200 配 6 个 HBM3E = 141 GB / 4.8 TB/s;Blackwell B200 SXM 使用 8 个 HBM3E stack,标称 180 GB / 最高 8 TB/s。
四、HBM 详细拆解
4.1 TSV + microbump + interposer
🔬 TSV:直径 ~5 μm 的垂直通孔,穿透每颗 DRAM die(厚约 50 μm)把上下层连通
🔬 microbump:直径 ~25 μm 的小焊球,一个 stack 数量在 5000–8000 量级
🔬 Base die:stack 最底层,负责 PHY、TSV 驱动、刷新管理(到 HBM3E 为止仍沿用存储厂自有工艺;HBM4 起转向逻辑工艺/逻辑代工协同)
🔬 Silicon Interposer:台积电 CoWoS-S 是主流,本质是薄硅片上做几层金属互连,路径毫米级
每个 stack 的成本大头,是 TSV 蚀刻、晶圆减薄、microbump 焊接、KGD(Known Good Die)测试这几道。HBM 良率比单颗 DRAM 低一个数量级——一个 12-Hi stack 里只要坏一颗 die,整个 stack 报废。
4.2 HBM1 → HBM4 演进
| 代际 | 量产年 | 接口 | 速率/pin | 单 stack 带宽 | 最高层数 | 单 stack 容量 |
|---|---|---|---|---|---|---|
| HBM | 2015 | 1024-bit | 1 Gbps | 128 GB/s | 4-Hi | 1–4 GB |
| HBM2 | 2016 | 1024-bit | 2 Gbps | 256 GB/s | 8-Hi | 4–8 GB |
| HBM2E | 2019 | 1024-bit | 3.6 Gbps | 461 GB/s | 8-Hi | 8–16 GB |
| HBM3 | 2022 | 1024-bit | 6.4 Gbps | 819 GB/s | 12-Hi | 16–24 GB |
| HBM3E | 2024 | 1024-bit | 9.2–9.6 Gbps | 1.18–1.23 TB/s | 12-Hi | 24–36 GB |
| HBM4 | 2026 | 2048-bit | 6.4–8 Gbps | 1.6–2.0 TB/s | 16-Hi | 36–64 GB |
一个反直觉的点:HBM3 → HBM3E 每 pin 速率翻倍(6.4 → 9.6 Gbps),但 HBM3E → HBM4 每 pin 速率反而降低(回到 6.4–8 Gbps)。因为 HBM4 把接口从 1024-bit 扩到 2048-bit,靠宽度补吞吐,每 pin 速率不必再推——拉低速率反而能在 16-Hi 高堆叠下控制功耗(HBM3E 12-Hi 单 stack 已接近 15 W、逼近热墙)。
4.3 HBM4 的两个跳跃
⚡ 接口宽度翻倍:1024 → 2048-bit。一颗 GPU 配 8 个 HBM4,需要 8 × 2048 = 16384 个数据 IO,加控制/电源接近 2 万 pin。CoWoS interposer 的金属密度必须翻倍,台积电 CoWoS-L 是配套方案。
⚡ Base die 升级为逻辑工艺 / 逻辑代工协同:为支撑 2048-bit 接口和更多 PHY 与管理逻辑,三星走自家逻辑工艺协同,SK 海力士与台积电合作开发。
4.4 Hybrid bonding:下一道工艺鸿沟
microbump(25 μm 间距)已接近物理极限。下一代叠层用 hybrid bonding:硅片直接对硅片、铜对铜键合,间距可做到 < 5 μm 甚至 1 μm 量级。优点是互连密度提升 10–100 倍、寄生小;缺点是对表面平整度(颗粒缺陷 < 100 nm)、对准精度(纳米级)要求极高,单台键合机报价数千万美元。业界路线大致是:HBM4 仍以 microbump 为主,hybrid bonding 到 HBM4E / HBM5 才成为主流(预计 2027–2028)。
五、未来路线:4F²、3D DRAM、IGZO、PIM、CXL
VCAT:把晶体管从"平躺"改成"竖立"
6F² 已接近平面布线极限,下一个目标是 4F²。VCAT(垂直沟道阵列晶体管)是三星与海力士都在推的下一代结构——沟道垂直、栅极环绕(GAA),位线埋底、电容长顶,一个单元目标占地 4F²,比 6F² 少 33%。需强调:这仍是研发/路线图目标,尚未大规模量产,社区估算三星可能在 1δ 之后的节点窗口导入。
像 NAND 一样把单元层数堆起来
VCAT 是单层 4F²,再往后是 3D DRAM。但 DRAM 比 NAND 难得多:单元有电容怎么垂直堆(目前主流是"横向电容 + 垂直晶体管")、retention 要求高对漏电极敏感、I/O 速率高(GHz vs NAND 的 MHz)。三星、SK 海力士、美光都在做原型,社区估计首次量产 32 层 3D DRAM 在 2027–2030 之间,单 die 容量可从 16–32 Gbit 跳到 64–128 Gbit。
让"刷新"这件事名存实亡
垂直晶体管硅做不动了,新候选是 IGZO(氧化铟镓锌):室温 < 400°C 沉积方便堆叠;关态漏电比硅低 10⁴–10⁶ 倍,retention 可拉到秒级甚至更长。目前只有 NMOS(PMOS 还没有匹配的氧化物)。如果 IGZO + 3D DRAM 走通,DRAM 那个"D"(动态、需刷新)就名存实亡了。先行者 imec 早在 IEDM 2020/2021 就展示了无电容 2T0C IGZO 单元,商业化时间表在 2028+。
把计算带到内存
PIM(存内计算)把简单算术单元直接做进 DRAM 颗粒。三星 2021 年发布业界首个 HBM-PIM 原型(Aquabolt-XL,基于 HBM2),每个 bank 旁附加 PCU 做 16-bit 浮点乘加;SK 海力士对应产品是 GDDR6-AiM(2022 年,后做成 AiMX 加速卡)。PIM 真正落地的场景是 embedding lookup(推荐、RAG)、注意力 KV cache——"数据多、计算少、对带宽极敏感"的负载。但在通用大模型训练上收益不大,MatMul 密集计算还得靠 GPU/NPU。
把内存做成可共享、可池化
CXL 是 Intel 主导、跑在 PCIe 5.0/6.0 物理层之上的协议。CXL 1.1 做 cache 一致性,2.0 引入内存池,3.0/3.1 支持多主机共享。瓶颈不是带宽而是延迟:CXL Type-3 设备访问延迟约 200–300 ns,而 DDR5 直连约 80 ns。最具体的产品形态是 CXL DIMM——一块 PCIe 卡上焊一组 DDR5 颗粒,三星、SK 海力士、美光、Astera Labs、Marvell 都有产品,规模化还在等软件生态成熟。
💡 三大趋势观察
趋势一:存储与计算的成本比正在反转
一颗 GPU 配 8 个 stack、一个 stack 12 层 die、一个 12-Hi stack 比一整根 32 GB GDDR 显存还贵——存储:计算成本比从 2018 年的约 1:5 变成 2024 年的接近 1:1。"算力即存储"不是营销,是 BOM 表上的事实。
趋势二:DRAM 产业"换轨"——工艺与架构双线作战
2020 年后的 DRAM 工业不再指望单一指标一年翻一倍。它一半精力放在工艺(EUV、A/R)继续刷剩下的窗口,另一半放在架构(HBM 3D 堆叠、CXL 池化、PIM 计算)开新战场,分裂成 DDR、LPDDR、GDDR、HBM 四条各跑各 trade-off 的产品线。
趋势三:下一个五年,盯三件事
HBM4/HBM4E 能否如期量产、良率如何——它决定 2026–2028 的 AI 算力天花板;3D DRAM 工程化进度——单 die 容量能否突破 64 Gb;IGZO/无电容单元能否走出实验室——它决定"刷新"这件事十年后还存不存在。
DRAM 这一行的有趣之处在于:它的物理决定了它无法像 NAND 一样轻易做 3D,
它的市场又决定了它无法像逻辑芯片一样轻易溢价。
所以每一代的进步都更费力,也更值得看清楚——每一步到底是怎么走过来的。
来源:芯智荟 微信公众号 · 转载至科技频道 · 数据口径说明:JEDEC 标准号、电压、prefetch、速率取自 JEDEC 公开标准;前瞻路线部分为社区估算/传闻