中国 AI 公司的「军备竞赛」又往上跳了一级。英国《金融时报》8 月 7 日援引三位知情人士称,字节跳动正在训练一个最高可达 10 万亿参数的超大模型,规模逼近 Anthropic 最先进的 Mythos 系统。如果这个数字属实,它将成为中国企业训练过的最大模型,也把国内大模型的天花板直接抬到了美国前沿实验室的门口。

比现有国产最大模型大三倍多
参数是衡量模型「体量」最直观的指标,指的是模型在训练中学到的那组数值,决定了它存储信息和记忆的上限。据《金融时报》报道,字节跳动这一模型目前处于预训练的早期阶段,这一阶段通常要持续三到六个月,之后如果顺利,才会进入微调和最终发布,确切规模要到更后期才能确定。
横向一比就清楚了:月之暗面的 Kimi K3 是此前中国已发布的最大模型,参数为 2.8 万亿;阿里的 Qwen 3.8-Max 为 2.4 万亿;DeepSeek 的 V4-Pro 约 1.6 万亿。字节跳动这枚新模型最高可达 10 万亿,相当于 Kimi K3 的三倍多,把 Alibaba 和 DeepSeek 一并甩在身后。
美国那边,Anthropic 从不公开自家模型的参数规模。业内普遍估计,其最先进的 Mythos 5 大约在 8 万亿参数上下,更广泛开放的 Fable 5 约 5 万亿。也就是说,若字节跳动真冲到 10 万亿,它在「体量」这一项上已经和美国最顶尖的系统处在同一区间。
钱和人早就铺好了
能撑起这种量级的训练,靠的是真金白银。报道提到,字节跳动已将 2026 年的 AI 资本开支计划从去年初拟定的 1600 亿元人民币,上调到 2000 亿元以上(约 300 亿美元),其中大约一半用于采购芯片。
带队的是内部的研究组织 Seed 团队,由前 Google DeepMind 科学家吴永辉领衔,目前在中外合计约 2000 人。在消费者端,字节跳动的豆包 AI 助手月活已达约 3.24 亿,是国内最大的 AI 应用;视频生成模型 Seedance 也被不少从业者视为当前全球表现最好的同类产品。从短视频起家的公司,已经把地基挖到了基础模型的深处。
创始人张一鸣给团队定了一条有点「轴」的规矩:不要依赖「蒸馏」——也就是拿更强模型的输出去训练或改良自己的小模型——哪怕短期性能会因此吃亏。在他看来,抄近路会伤到长期的技术突破,宁可慢一点也要走自研。这也能解释为什么字节跳动至今坚持闭源路线,和阿里、DeepSeek 走开源的思路截然不同。
但「10 万亿」不等于「比 Anthropic 强」
说白了,参数规模是最容易被误读的数字。字节跳动披露的是「总参数」,而决定模型实际能力的,还有架构、数据质量和训练方法。当前几乎所有前沿模型都采用混合专家(MoE)架构,推理时只激活一小部分参数:DeepSeek 的 V4-Pro 总参数 1.6 万亿,真正在每次推理时激活的只有约 490 亿,仅占总量的 3%。换句话说,10 万亿描述的是「要存多大」,而不是「有多聪明」。
《金融时报》也明确点出,这枚模型尚未完成训练,更没有经过独立基准测试,现在就拿它和 Anthropic 比高下为时过早。但它释放的信号足够清晰:中国 AI 公司不再满足于做低成本、跟跑式的模型,而是开始正面冲击前沿。
按三到六个月的预训练节奏推算,这枚模型最早也要到 2027 年初才可能公开亮相。在那之前,外界能做的只有一件事——等它练完,再看激活参数到底是多少。
来源:英国《金融时报》(FT)、路透社







