众力资讯网

专家访谈纪要:美光如何提升 HBM 速度? 🎯 一、访谈背景与核心视角 这是一场与美光 HBM 接口设计工程师的深度对谈。专家早年任职三星做高速接口设计,如今负责 HBM 基座裸片(Base Die)两侧接口的设计: 🔗 一侧通过硅中介层连接 GPU(外部接口) 🔗 一侧通过 TSV 连接上方的 DRAM 核心裸 ​

专家访谈纪要:美光如何提升 HBM 速度?

🎯 一、访谈背景与核心视角

这是一场与美光 HBM 接口设计工程师的深度对谈。专家早年任职三星做高速接口设计,如今负责 HBM 基座裸片(Base Die)两侧接口的设计:

🔗 一侧通过硅中介层连接 GPU(外部接口)

🔗 一侧通过 TSV 连接上方的 DRAM 核心裸片(内部接口)

整场访谈最耐人寻味的转变是:主持人起初问的是"怎么让 HBM 变快",聊到最后发现真正的问题是"这颗越来越复杂的内存,每一部分由谁设计、价值由谁捕获"。

🔌 二、HBM 的两个接口与 SerDes 机制

接口电路的核心是发送器(TX)、接收器(RX)以及串化/解串器(SerDes)——把多路并行数据合并成高速串行流发送,接收端再展开还原

信号经过信道(PCB 或硅中介层)会失真,需要均衡器补偿

关键认知:外部引脚速率 ≠ 内部通路速率。通往 DRAM 的数据可以拆分到更多通路上以更低速率传输(例如 32Gbps 的一路输入拆成 4 条 8Gbps 内部通路)

代价是 TSV 数量成倍增加(1,024 条外部通路 → 约 4,000 条内部通路),推高面积、布线难度和制造成本

核心要点 1:拆分数据能减轻 DRAM 压力,但要在 DRAM 工作裕量、布线、面积与成本之间找平衡,而不是盲目堆 TSV。

🚀 三、为什么先进逻辑工艺还不够

基座裸片用先进逻辑工艺打造,能承受高速信号;但上方 DRAM 核心裸片是另一种工艺,天然不以高速见长

如果把高速外部数据直接灌给 DRAM,接收端采样跟不上,时序错配就会出错

所以提引脚速率不只是把逻辑裸片做快,连着的 DRAM 也必须接得住——解串比(4:1、8:1 还是 16:1)正是预研阶段的关键决策

同架构小幅提速 vs 重构架构,是两个难度完全不同的问题

核心要点 2:三星 HBM 论文中 TSV 数量偏高,一种合理推断是他们提高了解串比,给 DRAM 裸片留出更多速率裕量。

⚡ 四、HBM5 的挑战:接收与布线同时变难

设想外部引脚速率从约 16Gbps 提到约 32Gbps:

但 DRAM 工艺优化方向是低漏电、存储单元和电容,与高速逻辑是两个方向,速率很难一代翻倍

外部速率翻倍 → 解串比翻倍 → 内部通路数量翻倍 → 布线管理大变

同时速率升高让中介层信道损耗增大,信号波形展宽、混入噪声,接收端区分 0 和 1 更难,均衡器和接收电路负担加重

核心要点 3:不能只盯着"引脚速率翻倍",接收端、速率转换、TSV、布线的难度是层层叠加的。

🛠️ 五、定制 HBM:设计方式的根本改变

大客户的逻辑(内存控制器、基础计算功能)被放进基座裸片,接口面积、均衡器、RX 架构的选择空间都受到约束,整颗裸片必须作为一个整体设计

接口可能更多以 IP 块形式使用(如 UCIe 这类开放规范),还可借助代工厂逻辑工艺的丰富 IP 库

反直觉的一点:定制 HBM 对存储公司未必是"更多工作"——如果外部接口改由客户或其他 IP 实现,接口设计师过去的角色反而可能消失

NVIDIA 似乎倾向亲自承接更大份额的设计(它本就有极高速接口经验,而存储公司是从相对低速往上走)

存储公司的应对思路:把不含客户 IP 的部分打包成可复用 IP,减轻逐客户从零设计的负担

🏢 六、美光如何构建 HBM 能力

三星:从各部门抽人组建特别工作组,集中资源但留下团队空缺

美光:激进对外招聘资深工程师,持续从其他存储公司挖人

弊端:容易形成"倒金字塔"——资深多、初级少,长期难持续,需要同步多招应届生

主持人提醒:靠招聘快速获得专长 ≠ 培养出能长期支撑组织的人才;接口设计进展也说明不了量产良率和客户认证

📊 七、堆叠层数之争:8 层还是 4 层?

听到层数减少,别急着推断"工艺良率出问题"或"AI 容量需求下滑"

更可能的原因:客户分层——要标准品的客户本就不需要超大容量;大客户则可能因供给紧张选择"更多颗 8 层堆栈"替代"更高单层堆叠"

设计视角:接口按高层数(12/16 层)的最坏电气负载设计,层数减少反而带来速率或降低解串比的裕量

"减少层数的请求" ≠ "总容量需求下降",两者不能混为一谈

🧊 八、3D 堆叠:内存直接堆在计算芯片之上

垂直堆叠让外部中介层连接消失、部分 SerDes 负担减轻,但散热是更大的难题——下方是 XPU 计算裸片,产热更多

SerDes 不会完全消失:逻辑和 DRAM 之间的速率差依然存在,速率转换功能仍必须在,只是比例重新设计

若 TSV 按客户计算模块定制摆放,上方 DRAM 核心裸片也要跟着改——公共核心裸片无法复用,设计按客户分叉,需要更多团队

👑 九、全文最重要的一课:设计主导权之争

主持人原以为 3D 堆叠会扩大存储公司的角色,专家指出了相反可能:客户承接控制器、逻辑与接口设计后,存储公司可能只剩 TSV I/O

这也是存储公司纷纷组建 SoC、RTL、计算团队的原因——PIM/CIM(存内计算)本质上是在争夺"谁来负责计算、谁来掌控设计"

关键区分:"技术变得更复杂" ≠ "存储公司捕获这份复杂性的价值"

核心要点 4:3D 堆叠的进步并不保证设计主导权。评估定制价值,要看核心裸片是否被迫改动、多少设计可复用、哪些电路归客户哪些归供应商。

🔭 十、展望未来:三个值得持续跟踪的问题

内部架构如何适应更高的外部速率?(解串比、TSV、布线的平衡)

裸片贴得更近之后,热怎么散走?(接口省电 ≠ 整体散热解决)

架构背后的设计主导权与知识产权由谁保留?

💡 总结

这场访谈表面上谈"如何让 HBM 更快",实质上揭示了一个产业格局问题:HBM 每提速一分,内部架构、TSV 布局、散热与分工的复杂度就叠加一层——而技术进步的红利最终流向谁,取决于谁握有设计主导权,这不是堆叠技术本身能自动决定的。