2.8万亿参数Kimi K3开源,美国云平台连夜抢着接入

7月27日,月之暗面(Moonshot AI)正式开源旗舰大模型 Kimi K3 的完整权重,这是全球首个进入「3万亿参数俱乐部」的开源模型。仅一天之后,美国通信云服务商 Telnyx 就宣布将 Kimi K3 上架自家推理平台 Telnyx Inference API——在此之前,Together AI 和 Modal 已经实现了「零日接入」。一款中国开源模型发布即被海外平台争相上架,这在以往并不多见。

2.8万亿参数背后的技术账

Kimi K3 采用混合专家(MoE)架构,总参数量高达 2.8 万亿,内置 896 个路由专家,每个 token 仅激活其中 16 个。这意味着虽然参数规模惊人,但单次推理的实际计算量只是总参数的一小部分,兼顾了规模与效率。

模型的另外几项核心规格同样抢眼:上下文窗口达到 100 万 token(精确值为 1,048,576),可以直接处理整个代码库或超长文档;原生支持视觉能力,文本、图片、视频输入共用同一个模型,无需外挂视觉适配器。

支撑这些能力的是两项架构创新——Kimi Delta Attention(KDA)混合线性注意力和 Attention Residuals(注意力残差)。官方技术报告显示,与上一代 K2 相比,K3 的参数规模扩大约 3 倍,整体扩展效率反而提升了约 2.5 倍。

除模型权重外,月之暗面还同步开源了三项训练基础设施:面向超大规模 MoE 的高性能通信库 MoonEP、KDA 高性能算子 FlashKDA(在英伟达 H20 上预填充速度较基线提升 1.72 至 2.22 倍),以及与 KVCache.ai 合作开发的智能体沙箱系统 AgentEnv。

海外平台为何抢着上架

Telnyx 在发布说明中列出了接入 Kimi K3 的理由:可配置的推理强度(低、高、最大三档)、函数调用与 JSON 结构化输出、默认开启的提示词前缀缓存——这些都是构建智能体应用的关键能力。在 Telnyx 平台上,K3 与 Kimi K2.6、GLM-5.2-FP8、MiniMax M3 等模型并列可选。

Telnyx 还给出了一个耐人寻味的判断:AI 行业的竞争优势,正在从「谁能造出最聪明的模型」转向「谁掌握决定每个请求跑在哪里的基础设施」,而 K3 的出现恰恰说明,模型侧的问题正在被开源力量解决。该公司认为,K3 在编程、推理和智能体任务的基准测试中已能与海外头部闭源模型正面竞争,「开源与前沿实验室的差距没有想象中大,某些场景甚至已经追平」。

生态连锁反应已经出现

开源发布后,产业链反应迅速:阿里云千问平台宣布上线 K3;华为昇腾完成「零日适配」,这是首个在中国自研芯片上跑通的开放 3 万亿级模型。投行也给出了评价——摩根士丹利称,Kimi K3 证明中国大模型在规模、性能、定价三个层面实现了全方位追赶;高盛则认为,中国开源模型的智能水平已达到全球大规模普及的临界点。

不过,「开源」不等于「人人可用」。2.8 万亿参数的体量意味着本地部署门槛极高,仅加载模型就需要至少 10 张 GB300 级别的 GPU。也正因如此,K3 上线后不久便因算力紧张暂停了新用户订阅——对绝大多数开发者而言,通过云平台调用 API 仍是现实的选择,这也解释了海外推理平台为何急于第一时间上架。

来源:Telnyx 官方发布说明、Hacker News、Pandaily、腾讯新闻