浪潮 SD200 Ultra:单机承载 2.8 万亿参数 Kimi K3

9 月 21 日,在 2026 人工智能计算大会(AICC2026)上,浪潮信息发布元脑 SD200 Ultra 超节点人工智能服务器,以及元脑 HC2000 多元算力机组。其中 SD200 Ultra 面向大模型推理场景,官方称其单机即可承载运行参数规模达 2.8 万亿的 Kimi K3 大模型。

时延首次压到 5.85 毫秒以内

浪潮信息介绍,SD200 Ultra 的 Token(词元)生成时延首次降至 5.85 毫秒以内,换算成单用户速度为 170 Tokens/s,达到业界平均水平的 5 倍。该机型还支持 10 万亿参数规模的前沿模型在单机运行。

Token 生成时延指大模型每输出一个词元所需的平均时间,是衡量推理响应速度的核心指标之一。这一数字越小,用户等待答案的时间越短。

128 颗本土芯片的紧耦合

SD200 Ultra 基于国产人工智能芯片打造,采用 3D Hyper Mesh 架构,紧耦合 128 颗本土 AI 芯片,提供 8TB 统一编址显存与 64TB 内存。系统采用原生内存语义通信,通信时延低至 0.69 微秒。

它通过全局统一编址、虚拟影子设备映射、跨域地址翻译与路由,实现 GPU 跨主机域的统一寻址访问,构建出百纳秒级的低时延内存语义互连域。借助对称内存技术,SD200 Ultra 首次在基于本土 AI 芯片的超节点上实现 GPU 显存直连,使 GPU 能够直接访问远端显存,官方称 AllReduce(全规约)通信时间降低 3.5 倍。

为 Kimi K3 定制超级算子

针对 Kimi K3 的推理,SD200 Ultra 使用 Kimi K3 构建了超级算子智能体,实现通算融合、Tile 级流水的超级算子,将 KDA、Gated MLA、MoE 中的基础算子进行融合。结果是算子数量降低 10 倍,推理性能提升 3 倍以上。

同期发布的元脑 HC2000 多元算力机组采用 DirectCom 2.0 极速架构,基于高密液冷 AI 整机柜,搭配 MCIS 推理软件栈,可动态匹配计算负载。官方称在同等投资下 Token 产能提升 10 倍。

Agent 时代的两类智算

浪潮将 Agent(智能体)时代的 AI 计算划分为两个方向:能力型智算(Capability AI Compute)支撑突破智能上限,容量型智算(Capacity AI Compute)实现智能的充分供给。

其判断依据是模型规模的一组变化:前沿模型参数已从 DeepSeek R1 的 6710 亿增长到 Kimi K3 的 2.8 万亿,并走向 10 万亿级;上下文长度从 128K 扩展到 1M 以上;Agent 从单体走向成百上千个协同。模型权重、键值缓存(KV Cache)与并发任务规模同步增长,对显存容量、高速互连和并行扩展效率提出更高要求。

复杂 Agent 任务包含大量”推理—工具调用—反馈—重新规划”循环,每一轮时延都会累积。浪潮信息表示,时延已不只是体验指标,还可能影响任务能否及时完成。这类任务往往需要连续运行数小时甚至数天,期间经历大量模型调用、工具调用与数据交互,任何计算、通信或软件故障都可能中断任务。

(本文基于 IT之家及多家媒体报道整理)