内存墙有解:美光 160TB 机架级内存池落地

在 AI 数据中心里,算力增长常常快过内存的容量与带宽,大模型推理和科学研究因此频繁「等数据」。美光(Micron)联手 Liqid 与太平洋西北国家实验室(PNNL),在机架层面把内存变成可按需调度的资源,试图推倒这堵「内存墙」。

从单机内存到机架级内存池

这套名为 Abaco 的内存中心化计算系统,由美光为美国能源部下属的 PNNL 设计,Liqid 提供可扩展的内存池。借助 CXL 2.0 内存池化与共享技术,单个机架最多可将 160TB 的 DRAM 专用于一台主机,或动态分配给最多 16 个服务器节点共享。

美光还贡献了 famfs 这一 Linux 内核增强,让跨系统的内存共享具备软件层缓存一致性;借助 famfs,Liqid 系统里被解聚的内存池能以文件系统形式直接暴露给主机操作系统,无需改动应用层即可享受池化内存的延迟与带宽优势。

基准测试中的显著收益

美光实验室采用代表性负载进行的测试显示:图分析类任务的处理速度最高提升约 30 倍;在部分 KV 缓存负载上,每秒生成的 token 数量最高提升约 7 倍。这些数字验证了 CXL 内存池化对 AI 与科学计算的价值,后续随着平台新特性启用,还有进一步优化空间。

仍处在实验室阶段

需要清醒看待的是,该部署目前停留在国家实验室层面,尚不代表主流数据中心已准备好围绕解聚内存重构架构。对延迟敏感的应用,未必能容忍远程内存访问;当内存池跨多个节点共享时,一旦交换 fabric 或管理层故障,受影响的主机范围也会更大。把昂贵的内存从「焊死在单台服务器里」变成「可统一调度的资源」,方向已经明确,但大规模落地仍需结合真实负载反复验证。

对正在建设大规模 AI 数据中心的市场而言,这一思路同样有参考意义:当单台机器的内存容量触顶,把内存当作整层基础设施来规划,可能比不断堆高单机配置更经济。