GLM-5.3-Flash 上线 LM Studio:百万上下文,成本降九成

智谱(Z.ai)刚把 GLM-5.3-Flash 正式发布出来,几小时后,桌面端大模型工具 LM Studio 就把这个模型接进了自家的智能体平台 Bionic。据 9to5Mac 8 月 26 日报道,此次接入带来了三样变化:支持图像输入的多模态能力、100 万 token 的上下文窗口,以及比 GLM-5.2 明显更低的调用价格。

Bionic 是什么:从聊天窗口走向干活的智能体

LM Studio 长期以来被当作一款在本地运行开源大模型的桌面工具,用户下载模型权重,在自己的电脑上推理。今年 7 月中旬,它推出了 Bionic,把能力从”对话”扩展到”办事”:这是一个面向 Mac 和 Windows 的智能体应用,主打编程、资料研究,以及处理文档和文件这类需要多步操作的任务。

Bionic 的模型来源有两条路。一条是本地运行的模型,全部计算发生在自己的机器上;另一条是云端托管模型,服务器位于美国,LM Studio 表示这部分适用严格的零数据保留策略,即不留存用户数据。

模型阵容的扩张速度不慢。Bionic 发布后不久,LM Studio 先接入了月之暗面的 Kimi K3,时间是 7 月 27 日。8 月 26 日这次,轮到了智谱的 GLM-5.3-Flash,走的是云端调用通道。

价格是这次最实际的变化:最多便宜十倍

对使用智能体的人来说,最直接的感受往往不是跑分,而是账单。智能体任务动辄要读一整个代码仓库、翻几十页文档、反复调用工具,token 消耗远高于普通聊天,单价的差别会被放大很多倍。

LM Studio 给出的说法是,GLM-5.3-Flash 的运行成本最多可以比 GLM-5.2 低十倍,也就是降到约十分之一。这个量级的降幅,意味着一些原本因为太贵而不敢长时间跑的自动化流程,重新变得可行。

模型本身:3200 亿参数,激活 180 亿

按 9to5Mac 的介绍,GLM-5.3-Flash 是一个 3200 亿参数的混合专家(MoE)模型,推理时激活 180 亿参数,支持图像和文本两种输入,上下文窗口为 100 万 token。混合专家架构的特点是总参数量很大,但每次推理只唤醒其中一小部分,这也是它能把单价压下来的技术前提。

在智谱自己列出的基准测试中,GLM-5.3-Flash 全面超过上一代 GLM-5.2;与 Anthropic、OpenAI、Google 和深度求索(DeepSeek)的前沿模型相比,成绩大体处于同一区间。

这款模型在正式发布前还有一段插曲:它曾以代号”Ox Alpha”在 OpenCode 和 OpenRouter 上匿名接受测试,凭表现积累了不少讨论度,直到官方揭晓身份,外界才知道匿名模型出自智谱。

对中国用户意味着什么

有几点值得区分清楚。Bionic 的云端通道服务器在美国,实际可用性取决于网络环境;而本地模型这条路不受此限——只要机器带得动,权重下载到本机就能离线跑,数据不出设备,这对处理合同、代码、内部资料等敏感内容的人来说是实质性的优势。

也就是说,GLM-5.3-Flash 进入 LM Studio 生态,真正的看点不在于”又多了一个可选模型”,而在于国产开源模型正在成为桌面端智能体工具的默认选项之一。开源权重加上大幅下降的调用成本,让”把智能体跑在自己电脑上”这件事的门槛,比半年前低了一截。

想尝试的用户可以在 LM Studio 官网的 Bionic 页面查看具体接入方式和当前可用模型清单。