千问首度开放 Max 级权重:2.4 万亿参数模型可本地部署

阿里千问团队把自家的旗舰模型权重正式放上了 Hugging Face 与 ModelScope,模型名 Qwen3.8-2.4T-A95B。这是千问历史上第一次向社区开放「Max 级」旗舰权重——过去这类顶级模型通常只以云端 API 形式提供,如今任何人都能下载、修改、自行部署。

2.4 万亿参数,每步只激活 950 亿

这组数字的命名已经写明了规格:「2.4T」代表模型总参数量达到 2.4 万亿;「A95B」代表每次前向计算只为单个词元激活 950 亿参数。实现这一点的,是混合专家(MoE)结构:模型共 92 层,每层拥有 512 个专家,每个词元只路由到其中 10 个路由专家加 1 个共享专家。底层采用 Qwen3.5 架构,并混合了门控 DeltaNet 与门控注意力机制。

相比训练一个 2.4 万亿参数的稠密模型,MoE 让「模型很大、跑起来却只需算一小部分」成为可能,大幅压低了推理成本。原生上下文长度为 262144 个词元,最长可扩展至约 101 万词元,足以覆盖长文档与长周期智能体任务。

和云端 Max 版不是一回事

需要区分的是,放权的开源版与早先上线的云端版 Qwen3.8-Max 并不完全相同。云端 Max 于 8 月初发布,额外支持视觉输入、可关闭的思考模式、默认 100 万词元上下文,以及官方内置工具;而开源版 Qwen3.8-2.4T-A95B 目前只有文本输入,且思考模式默认开启、无法关闭——模型在给出最终回答前会先生成推理过程,并通过 preserve_thinking 标记在多次对话间保留推理上下文,适合需要跨步骤保持「草稿」的智能体循环。

在官方公布的基准中,同架构的云端版本 Qwen3.8-Max 在论文复现基准 PaperBench 取得 93.0 分、在计算机操作基准 OSWorld-Verified 取得 86.1 分、在参数化 CAD 基准取得 91.5 分,均居参评模型前列;不过在 TerminalBench 2.1(86.6)与 SWE-bench Pro(67.7)上仍略低于部分对手。整体定位被千问团队形容为「除 Fable 5 外最强的模型之一」。

自己跑起来要多少硬件

开源权重意味着可以本地部署。官方支持通过 Hugging Face Transformers、SGLang、vLLM、TokenSpeed 等推理框架加载,正式部署时需使用各框架针对 Qwen3.8 的最新配方,并按权重精度与 GPU 数量选择并行策略。

全精度权重体积可观,但开源社区已经给出了瘦身方案。Unsloth 团队用动态 1-bit 分层选择性量化技术,把原始约 4.9TB 的模型压到 397GB,存储空间缩减约 91%;借助其 Unsloth-Desktop 工具,只要设备的内存与显存合计达到 410GB 以上,就能在本地把模型跑起来。对没有数据中心的中小团队而言,这意味着前沿级能力第一次能以自托管的形式落在自己手里。

许可证与价格

开放不等于完全自由。Qwen3.8-2.4T-A95B 采用千问自定义许可证,而非早先常见的 Apache 2.0:个人下载、修改、部署不受限,但大规模商业使用需要另行取得授权。配套发布的还有一颗约 270 亿参数的稠密伴随模型 Qwen3.8-27B,面向算力有限的场景,不过在开源权重放出时尚未同步上线。

云端 Qwen3.8-Max 的国内 API 定价为每百万词元输入 12 元、输出 36 元,海外为每百万词元输入 2 美元、输出 6 美元。

为什么这件事值得关注

把旗舰级权重交到社区手中,意义不只在「又大了一点」。过去一年,西方实验室谈开源时往往只放出 200 亿到 300 亿参数量级的中等模型,而阿里这次直接把自家最强旗舰摆上了桌面。无论动机如何,实际效果是:当前能完全自托管、可离线运行的最强模型之一,来自于中国的开源阵营,且差距明显。

对开发者与研究者来说,这意味着不必再为前沿能力向专有 API 持续付费,也能在本地做微调、评测与私有化部署;对下游应用,则把竞争拉回了「在模型之上能做出什么」这一层。

来源:Hugging Face 模型页 / 千问团队(经 Hacker News 收录)