9月14日大模型榜单:开源权重成新分水岭

2026 年 9 月 14 日的国内大模型榜单日报给出一组耐人寻味的信号:海外头部这一周走的是”换架构、拼 Agent”路线,国产头部则走”不换基座、把后训练练透”路线;而把三张主流榜单叠在一起看,”开源权重”正在成为区分各家模型的新分水岭。中文场景与开源生态这两块,国产模型已经不用仰视谁,但在”让人愿意投票”和”端到端把活干完”两个更偏体验的维度上,海外头部仍领先半个到一个身位。

两条不同的技术路线

海外头部本周的重心在架构与智能体。OpenAI 把 GPT-6 Astra 定位成能直接操作电脑的智能体,Anthropic 则靠 Claude Fable 5.1 在专业任务上继续拉开身位。国产头部则明确表态”架构没动”,提升全部来自强化学习与长程任务环境。智谱官方博客里有一句话很实在:模型能力的提升正在从”模型”转移到”环境”——难点不再是让模型更聪明,而是给它搭出足够接近真实工作的测试环境。

开源权重:一条新分水岭

谁把权重真正放出来、以什么协议放出,正在成为区分模型开放程度的分水岭:

DeepSeek 的 V4.1-Flash 用 MIT 协议直接放出权重; – Meta 的 Muse Glimmer 采用 Apache-2.0 协议; – 智谱 则选择延后两周、做完安全加固再开源。

三家都开源,但节奏与顾虑完全不同。智谱的谨慎有出处:GLM-5.3 那 2436 个漏洞发现记录,让同一项能力交到谁手里、结果差得很远。这也说明,开源不再只是”放不放权重”的二元题,而是”以何种安全姿态放出”的工程与治理题。

差距究竟在哪里

在中文场景与开源生态两块,国产模型已具备对等实力。SuperCLUE 中文榜前十被国产模型包揽,LMArena 与国际模型大致”五五开”即是证据。但在另两个维度上,海外头部仍然领先:

让人愿意投票:盲测偏好测的是”聊得舒不舒服”; – 端到端把活干完:Agent 能力测的是”活干没干完”。

GPT-6 Astra 的盲测反差、Anthropic 约 16 分的领先,都在说明这两套尺子量出来的东西并不相同。

跨榜单的交叉观察

把单个模型在不同榜单上的名次摆在一起,能看出明显的”偏科”:

DeepSeek V4.1-Flash:在 SuperCLUE 上排国产第 2,中文能力没得说;到了 LMArena 公司榜却只排第 11(1450.77 分),连前 10 都没进。中文评测与国际盲测之间的落差,在它身上体现得最明显。 – OpenAI Astra:在自家评测体系里全面领先,LMArena 上却比 GPT-5.5 低 29 分——盲测与 Agent 能力是两套不同的尺子。 – 智谱 GLM-5.3:LMArena 第 5、SuperCLUE 第 3,两张榜都稳,是这一周表现最均衡的国产模型。

开源权重榜本身也印证了国产的站位。在 LMArena 开源模型榜单中,智谱 GLM-5.3 以约 1477.5 的 Arena 评分位居第一,月之暗面 Kimi K3 约 1471.9 居第二,GLM-5.3-Flash 约 1471.6 居第三,DeepSeek V4.1-Flash 约 1450.8 紧随其后——开源前五中,国产模型占据多席。

对选型意味着什么

对关注大模型选型的中国用户而言,这组信号有两点实用价值:其一,若场景以中文、长文档、国产开源生态为主,国产模型在能力与成本上已可放心作为主力;其二,若场景强依赖”像人一样愿意聊”的盲测体验或”完整把长任务干完”的 Agent 能力,海外头部仍有一段身位优势,需按真实工作负载而非单一榜单分数做判断。

结语

模型江湖瞬息万变。9 月这一周的榜单真正值得记下的,不是谁又涨了几分,而是竞争维度正在悄然切换:从”谁的基座更强”,转向”谁把后训练练得更透、谁把权重更负责任地开源”。开源权重,正在成为继参数规模之后,衡量一家模型公司的新分水岭。