墨芯稀疏推理芯片亮相外滩大会:不堆卡,砍掉冗余计算

在当前的人工智能产业里,”算力不够用”几乎是所有从业者的共同焦虑。扩充算力供给是一条路,但在芯片供给与能耗都存在现实约束的情况下,另一条路正在被更多厂商认真对待:把计算中本来就不必要的部分砍掉,让同样的硬件跑出更多有效运算。

9 月 9 日至 12 日,以”共创AI新经济”为主题的 2026 Inclusion·外滩大会在上海黄浦世博园举行。作为蚂蚁集团生态合作伙伴,国产 AI 芯片企业墨芯人工智能(MOFFETT AI)在大会上展出了自研 AI 计算卡产品,完整呈现了以专用稀疏推理芯片提升算力效能的技术路径。

稀疏化:从底层架构削减冗余计算

墨芯成立于 2018 年,总部位于深圳,在上海、北京和硅谷设有办公室。创始团队包括卡内基梅隆大学的 AI 科学家,以及来自英特尔、高通等半导体公司的芯片研发核心成员,累计拥有数十款产品、超过 50 亿颗主流芯片的量产经验。

这家公司自称是”双稀疏算法”的发明者,在全球持有百余项专利,其技术路线是从算法和软件出发反向定义硬件,针对稀疏化做专门的架构设计。首款芯片 Antoum 支持 32 倍稀疏率,主要面向云端人工智能推理场景,可编程支持 CNN、RNN、LSTM、Transformer、BERT 等网络模型,并兼容浮点与定点数据类型。基于这颗芯片,墨芯陆续推出了 S4、S10、S30、S40 等系列 AI 计算卡。

在公开基准测试中,这套方案有过可查的成绩:MLPerf Inference v3.0 中,S40 计算卡在 ResNet-50 模型上单卡算力达到 127375 FPS。公司方面称其计算卡在视觉、自然语言处理、大模型等主流任务上具备领先能效比与单位算力推理吞吐量,并连续三届在 MLPerf 推理测试中夺冠。

落地四大片区,新一代 SparsePrime 年内推出

算力的价值最终要落到场景里。据介绍,基于自研芯片构建的推理集群,墨芯已经在西北、西南、华东、华北四大片区的数据中心实现部署,结合各地产业与资源特点,为智能制造、生命科学、城市治理等不同场景提供推理支撑。

面向不断演进的推理负载,墨芯即将推出新一代 SparsePrime 计算卡。该产品基于自研 Antoum 2.0 架构,专为大模型与复杂推理场景优化设计,广泛适配主流 Transformer 模型。在软件兼容层面,现有的 PyTorch、TensorRT、vLLM 等推理框架可近乎零代码修改迁移,同时支持 Triton 自定义算子开发。官方表述是”初步实现精度无损、算力翻倍的技术路径可能”——注意这是一个技术路径上的阶段性结论,而非已量产的确定指标。

此前在 ICDIA 2026 上,墨芯的 S40AC 计算卡入选”2026 强芯 TOP100″。S40AC 采用主动涡轮散热设计,主打满负荷运行下的低温稳定,配合工业级强化设计支撑长时间运行。

标准与联盟:降低产业链适配成本

要让更高效的计算方式真正服务于产业,还需要降低技术适配与协同的门槛。今年 7 月,墨芯成为工业和信息化部人工智能标准化技术委员会成员单位,依托稀疏计算领域的技术积累,参与 AI 基础硬件、软件平台及大模型等方向的标准研制。8 月,墨芯又发起成立稀疏计算产学研联盟,围绕前沿研究、关键技术攻关和成果转化开展协同创新。

2025 年,墨芯入选国家发改委《中国战略性新兴产业典型案例》。从芯片架构创新,到标准共建与联盟协同,这家公司试图说明的是:在推理需求持续攀升的阶段,提升算力效能与扩充算力供给同样重要。