国产大模型周榜突围:千问登顶前端榜,阿里视频挤进前三

Arena 平台于近日发布 2026 年第 36 周(8 月 31 日至 9 月 6 日)AI 大模型盲测排名。本期多个重量级新模型入榜,其中多款国产模型在细分榜单实现突破。阿里通义千问系列在前端开发榜首次入榜即跻身前列,阿里万相(wan3.0)在 AI 视频榜直接冲进前三,智谱 GLM-5.3-Flash 则在代码榜杀入前十。

综合榜:头部格局稳定,国产稳居中上游

本期综合榜头部排名整体稳定。Anthropic 的 claude-fable-5 以 1507 分蝉联榜首,claude-opus-4-6-high 以 1505 分紧随其后,两者分差仅 2 分,在误差范围内可视为接近。

本周有两款新模型首次入榜。Anthropic 的 claude-fable-5.1-max 直接冲入前三,ELO 得分 1504 分,位列第 3;谷歌的 gemini-3.8-flash-high 位列第 8,ELO 得分 1494 分,目前仍处于 preliminary(初步)阶段。头部前 10 名分数均在 1492 分以上,分差均小于 30 分,整体竞争非常胶着。

国产模型整体处于中上游位置,梯队相对稳定。月之暗面的 kimi-k3-max 排名最高,位列第 12 名,ELO 1489 分,排名持平;智谱的 glm-5.3-max 位列第 20 名,ELO 1482 分,较上周下降 5 位;阿里的 qwen3.8-max 位列第 22 名,ELO 1480 分,排名下降 2 位。

前端开发榜:阿里千问强势登顶

在前端开发细分榜单中,阿里 qwen3.8-max-0902 首次入榜即位列第 4,展现出国产模型在工程代码领域的强劲竞争力。与此同时,阿里 qwen3.8-flash-next、腾讯 hy4-preview、智谱 glm-5.3-flash 也同步首次入榜并杀入前 15,国产模型在该榜单形成扎堆突破的态势。

AI 视频榜:阿里万相冲进前三

在 AI 视频生成榜单中,阿里 wan3.0 首次入榜直接冲进前三,展现国产生成视频模型的最新竞争力。这一成绩延续了国产厂商在文生视频赛道的领先势头,此前在多项第三方评测中,中国厂商已多次包揽文生视频榜单前列。

代码榜:国产 GLM-5.3-Flash 杀入前十

代码榜头部格局同样稳定,claude-opus-4-7-high 和 claude-opus-4-6-high 同以 1552 分并列前两位,claude-fable-5 以 1551 分紧随其后,前三名均为 Anthropic 模型。

本周谷歌 gemini-3.8-flash-high 首次入榜即位列第 7,ELO 1537 分;OpenAI 的 gpt-5.5-high 也首次入榜,位列第 28,ELO 1520 分。国产模型 glm-5.3-flash 排名上升 2 位,来到第 9,表现亮眼。国产模型在代码榜已有多款进入前列,进步速度值得关注。

理性看待榜单

需要指出的是,本榜单基于 Arena(arena.ai)平台的匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映的是用户主观偏好而非绝对能力测试。不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。

整体来看,头部格局仍以海外模型为主,但国产模型在细分领域的进步速度明显。随着更多国产大模型新版本发布,后续排名竞争预计将进一步加剧。