你让大模型帮你写个网页,它写完能不能自己”看一眼”效果对不对?这个看似很小的问题,正在把中国头部大模型分成两条路。

月之暗面在 7 月发布的 Kimi K3,总参数 2.8 万亿、每个词元激活约 1040 亿,走的是把视觉从预训练阶段就揉进主模型的路子,还从零训练了约 4 亿参数的视觉编码器 MoonViT-V2,不再借用现成的图文对比预训练权重。效果很直接:K3 发布后以 1679 分登上 Arena 前端代码榜首,这个榜单由用户盲选模型生成的可交互网页排名,看的不只是代码能不能跑,还包括页面最终长什么样。浏览器开发平台 Puter 在测试页里埋了 5 处视觉偏差,K3 对照目标页和运行页截图全部找出,没有误报。月之暗面把这种”写完代码看一眼页面再改”的循环叫作视觉在环。
几周后 DeepSeek 给了另一种答案。V4-Flash 正式版总参数 2840 亿、每个词元激活 130 亿,分别只有 K3 的十分之一和八分之一,架构和参数规模都没动,全部力气花在后训练上,在考察网页开发和多轮工具操作的 Arena 网页开发榜上一度冲到 1577 分。它证明了:不加视觉、不扩规模,光靠后训练一样能把编程能力顶上去。
说白了,两家争的从来不是”多模态该不该做”。DeepSeek 创始人梁文锋早就说过”多模态最终还是要做的”,分歧只在于什么时候做、愿意为此让出多少模型容量、数据和算力。多位业内人士的看法也一致:编程能力才是上牌桌的门槛。有意思的是,阿里刚发布的 Qwen3.8-Max 站到了和 K3 相近的一边——2.4 万亿总参数、激活 950 亿,视觉、编程、协作一起扛。
对普通用户,这个分岔的现实意义很具体:如果你常截图丢给模型改页面、做幻灯片,优先选原生带视觉的;如果只写代码、处理文档,小而便宜的纯文本模型性价比明显更高。你平时给模型喂图多,还是喂字多?
来源:36氪·智能涌现《Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差》,作者 李炤锋,编辑 张雨忻







