跑 Kimi 慢了一点,成本反降三成

你在海外应用里用到的 AI,背后越来越可能是中国团队做的模型。Cloudflare 8 月 3 日发的一篇工程博客里,被挑出来重点优化的两个模型,正是月之暗面的 Kimi K 系列和智谱的 GLM——文章开头就写明,这两家的模型「用起来非常舒服,但因为显存吃紧,非常难高效地跑起来」。

三位工程师讲了三招。第一招,把模型用来记住上下文的「键值缓存」从 16 位精度压到 8 位,Kimi K2.6 能同时装下的上下文量从约 68.6 万词元翻到约 137 万。反常识的地方在这儿:单个请求反而更慢了(每秒 137 个词元降到 125),可同时能处理的请求数从 32 个上限顶到 64 个,峰值吞吐比原来高出 41%,每词元成本降约三成。第二招,把 GLM 5.2 的权重从 8 位浮点压成 4 位整数,模型文件从 705GB 缩到 421GB,单张显卡占用从约 88GB 降到 52GB,解码速度不降反升 55%。

说白了,这是拿「单个用户慢一点」换「同时能服务的人多一倍」——云厂商算的是总账,不是单笔账。而两项常用测评的分数几乎没掉(94.24 对 94.09、89.11 对 89.04),说明这笔账划得来。第三招则是给共享缓存加了一层校验,防止上百个请求读串页,代价不到 1% 的吞吐。

有意思的是,中国开源模型如今成了海外云厂商眼里「最难伺候、也最值得下功夫」的一类。如果要接一个大模型进自己的项目,你会先看效果还是先看单价?

来源:Cloudflare 官方博客《Smaller, faster, safer: running Kimi and GLM at scale》,作者 Alex Reneau、Kevin Flansburg、Chi McIsaac,2026 年 8 月 3 日