智谱 GLM-5.3 发布:编程最强开源模型

基座不变,后训练把编程上限抬了上去

8 月 14 日,智谱发布新一代旗舰模型 GLM-5.3。与上一个版本 GLM-5.2 相比,新模型的基座并没有更换,全部提升来自后训练阶段的强化学习——智谱称其为「后训练 Scaling」:依托 IndexShare、SAO 以及新一代 Slime 框架,在完全相同的基座上把训练时长、任务环境种类与长程任务规模都做了大幅扩展。用官方的话说,这个基座的智能上界还远未被开发完。

在内部体感评测中,GLM-5.3 的编程能力较前代提升约 50%,在多项公开基准上登顶开源模型第一。智谱将其定位为「为编程而生,为网络防御就绪」,并称其编程与智能体能力已接近 Claude Fable 5,编程体感超过其他国产模型。

基准分数:编程与安全双双跃升

具体来看,在衡量真实终端环境复杂任务完成的 Terminal-Bench 3.0 上,GLM-5.3 得分从 4.6 提升到 28.3;在长程软件工程与持续代码修改的 DeepSWE v1.1 上,从 46.2 提升到 66.9;在跨工具协作与长程任务的 Agents Last Exam 上,从 23.8 提升到 28.5;在覆盖 44 种职业真实知识工作的 GDPval-AA v2 中得分 1769,呈现出基于编程能力涌现出的专业任务执行力。

网络安全是这一版最突出的新增方向。在白盒代码审查与漏洞发现任务中,GLM-5.3 的表现与闭源标杆 Mythos 5 持平;在漏洞验证基准 CyberGym 中取得 84.5% 的成绩,高于 GLM-5.2 的 77.2%,也略高于 Mythos 5 的 83.8% 与 GPT-5.6 Sol 的 83.6%。在 Z.ai Code Bench 高档位端到端测试中,其准确率达到 31.4%,超过 Claude Opus 4.8 最高档位的 29.5%。

两周后开源,工具链同日上线

智谱表示,GLM-5.3 的全部提升都来自后训练,因此模型权重将在发布约两周后开放,前提是完成必要的安全评估与加固,以限制其潜在的攻击能力、保留防御价值。这是智谱(Z.ai)十三个月内发布的第七款旗舰模型。

与模型同步,智谱官方编程工具 ZCode、效率工具 AutoClaw 已于发布当日上线,GLM Coding Plan 面向全量用户开放订阅;Trae、扣子、WorkBuddy/CodeBuddy、Qoder、CatPaw、JoyCode、OpenCode 等多家编码平台也获得抢先体验资格。

来源:智谱官方公告(经 IT之家、澎湃新闻、新浪科技、AI Release Tracker 等转述与整理)