三星 zHBM:把 AI 响应速度提升 10 倍

据韩媒《朝鲜日报》(The Chosun Daily)报道,当地时间 9 月 16 日,在美国加州圣克拉拉会议中心举行的“AI 基础设施峰会”上,AI 内存的未来成为核心议题,多家半导体企业同步公布了新产品路线图。三星电子提出,希望借助上个月发布的下一代 AI 内存 zHBM,将 AI 加速器的响应速度提升 10 倍。

从每秒 100 词元到 1000 词元

三星电子美国公司(DSA)负责存储产品规划的高管金仁东(音译)在会上介绍,现有的对话式 AI 系统为每位用户每秒处理约 100 个词元(Token),而三星的目标是将其跃升至每秒 1000 个词元,从而更好地支撑智能体(Agent)类应用对实时性的要求。

zHBM 的关键思路,是把高带宽内存(HBM)直接垂直堆叠在 AI 加速器之上。金仁东将其比喻为“在酒店客房里安装一部直达一楼大堂的专用电梯”——数据不再需要绕远路,延迟随之显著下降。据称,这项设计可使性能最高达到现有 HBM5 的 8 倍,能效达到其 3 倍。

三星的存储路线图不止 zHBM

除了 zHBM,三星还在会上宣布,计划从 2028 年起提供三维存储方案 zNAND-O 的样品。这意味着三星正从“内存”与“存储”两端同时发力,试图在 AI 基础设施的存储层形成更完整的布局。

CXL 能否替代 HBM 仍存争议

会上,常被视作 HBM 补充方案的 CXL(Compute Express Link,计算快速链路)技术遭到了部分与会者的质疑。CXL 是一种下一代内存互连标准,可让计算设备连接更多内存、为服务器扩容,也能让不同服务器共享内存。有观点乐观地认为,CXL 普及后有望缓解 HBM 价格高、供应不足的问题,即便减少 HBM 用量,服务器也能保持相近性能,从而大幅降低搭建成本。

不过,反对声音同样明确。OpenAI 负责 AI 加速器设计的研究员丹尼尔·莫里斯(Daniel Morris)持保留态度:“就 AI 模型的实际运行而言,我找不到 CXL 能用在哪里。如果一定要找一个用途,那就是存放大型 AI 模型中很少用到的冷数据。”英特尔 AI 片上系统(SoC)架构负责人维迪娅·蒂亚加拉詹(Vidya Thyagarajan)也指出,用 CXL 整合内存确实有益,但它补充的是辅助存储,无法替代 HBM;GPU 之间通过 CXL 传输数据,速度远远比不上 HBM。

市场格局短期难改

尽管围绕技术路线存在分歧,主导 HBM 市场的三星电子与 SK 海力士,仍被普遍看好将继续保持良好的发展势头。在 AI 算力需求持续扩张的背景下,谁能在内存带宽、能效与成本之间取得更好平衡,谁就掌握了下一代 AI 基础设施的关键话语权。