DeepSeek 于 9 月 30 日通过官方渠道宣布,正式开源面向华为昇腾算力平台的基础设施组件,涵盖 TileLang 高级语言编译工具、计算库以及分布式通信库。这批组件与此前面向英伟达平台开源的组件一一对应,意味着模型从英伟达生态迁移到国产算力平台时,开发者可以复用一套相近的工具链。

六大核心组件
此次开源的核心组件包括:DeepGEMM 用于加速通用矩阵运算;DeepEP 提供高效的大规模跨设备通信;TileKernels 提供常规向量计算与内存访问算子;FlashMLA 提供稀疏注意力算子,可提升长上下文处理效率;DeepSelect 则实现高效的数据筛选。DeepSeek 表示,在多项关键测试用例中,上述组件的计算与通信性能已接近硬件上限。
与华为深度协作
DeepSeek 透露,在面向昇腾平台的研发过程中,华为团队给予了大力支持,双方紧密合作,共同推进基于昇腾 950 的 128 卡超节点方案,并对计算与通信进行了深度优化。
在编程工具层面,TileLang 旨在让开发者更便捷地编写算子——即模型运行时执行矩阵运算、数据处理等具体计算的程序。DeepSeek 称,相比用 CUDA 编程,TileLang 可以简化代码、提高开发效率,同时保留针对芯片特性进行优化的能力。这条路线先在英伟达平台上得到验证,目前已用于 DeepSeek V4 系列模型训练中的大部分算子;昇腾版本则把底层 Ascend C 指令封装起来,让开发者通过更高层语言编写程序,且每一个 TileLang 算子都已有对应的昇腾高性能实现。
实测性能数据
FlashMLA 的项目文档给出了一组具体结果:在昇腾 950 上,处理输入上下文的预填充阶段,稀疏注意力算子最高达到硬件理论峰值的 95%;在逐步生成内容的解码阶段,最高达到 83%。这两项均为项目方公布的测试成绩。
在分布式通信方面,DeepEP 昇腾版负责大规模跨设备通信。对于混合专家模型,不同数据会被分发给不同专家网络处理,计算结果再汇合;DeepEP 提供这类分发与汇合操作,并将公开接口与英伟达版本对齐,方便开发者沿用已有的调用方式。
分析认为,DeepSeek 将自研基础设施组件同时开源到英伟达与昇腾两大平台,有助于降低模型适配国产算力芯片的门槛,推动开放软件生态的建设。







