AMD 开源 Instella-MoE:160 亿参数大模型

AMD 于 7 月 24 日发布并开源了 Instella-MoE-16B-A3B,一个完全开放的混合专家(MoE)大语言模型。所谓”完全开放”,指的是从预训练到后训练每个阶段的权重、训练配置、数据混合比例、中间检查点乃至推理代码全部公开,模型权重与代码分别托管在 Hugging Face 与 GitHub(AMD-AGI/Instella-MoE)。

在架构上,这是一款 Decoder-only 的稀疏专家模型:总参数量 160 亿,但每处理一个 token 只激活 28 亿参数。它包含 27 个解码层、隐藏维度 2048,采用门控多头潜在注意力(Gated MLA)。专家层面设有 2 个共享专家与 64 个路由专家,每个 token 实际只激活其中 6 个路由专家,再加上 2 个共享专家——稀疏结构让它的计算开销更接近一个参数少得多的稠密模型。

训练方面,Instella-MoE 在 AMD Instinct MI300X 与 MI325X 显卡、ROCm 软件栈上完成了 7.1T(万亿)tokens 的预训练,上下文窗口从初始的 4K 经 YaRN 位置编码扩展至 64K。后训练依次经历监督微调、DPO 偏好对齐与强化学习蒸馏,并推出了”Think”思考模型。

基准表现上,基础模型在标准评测平均得分 76.7,为当时全开放模型最高;在 WinoGrande 拿到 86.5,HumanEval+ 为 65.7,64K 长上下文 RULER 平均 79.4。思考模型平均 73.22,其中 IFEval 83.70、AIME25 73.40、AGIEval 82.50。横向比较,其基础模型强于 SmolLM3-3B、OLMo-3-7B、OLMoE 等开放模型,略低于 Qwen3.5-4B-Base(79.5);思考模型则高于 Olmo3-7B-Think、Gemma-4-E4B、Qwen3.5-4B 等开放权重模型。

需要留意的是,Instella-MoE 采用 Research RAIL 许可证,仅限学术与研究用途,并非完全自由的商业授权。它的意义更多在于展示 AMD 的 ROCm 生态与开放模型路线——在英伟达几乎主导训练硬件的背景下,一个能完整复现训练全程的开放 MoE,对想要摆脱单一厂商绑定的研究团队颇具价值。

来源:AMD ROCm Blogs《Instella-MoE》(Jiang Liu 等,2026-07-24)