星辰 Xing4.0-29B 开源:29B 大模型激活仅 4B

中国电信人工智能科技有限公司于 9 月 17 日正式发布新一代星辰大模型 Xing4.0-29B-A4B。该模型聚焦复杂任务理解、任务规划、工具调用与自主执行等能力,支持长上下文处理,可应用于代码开发、数据分析、办公自动化及生活服务等场景,定位为面向智能体时代的轻量级代码智能体大模型。

架构:29B 总参数,仅激活 4B

Xing4.0-29B-A4B 采用混合专家(MoE)架构,总参数 29B,每令牌仅激活约 4B 参数,由 64 个路由专家加 1 个共享专家组成,每令牌选择 4 个路由专家参与计算。模型原生支持 256K 上下文,并可扩展至 512K。在评测表现上,其在 SWE-bench Verified 上取得 75.0 分,接近 Qwen3.6-35B-A3B 的 76.0 分,并超过 Gemma4-26B-A4B 的 53.0 分;在 Terminal-Bench 2.1 上取得 57.5 分,同样高于 Qwen3.6-35B-A3B 的 51.5 分;在 SuperCLUE 智能体能力评测中以 93.52 分位列第三。

全栈国产训练链路

据介绍,该模型是国内首个基于昇腾 Atlas 900 A3 SuperPoD 液冷超节点与昇思 MindSpore 框架完成训练的百亿参数大模型。在昇腾超节点集群上,通过多层次软硬件协同优化,训练吞吐较开箱性能提升约 96%。经过 4 比特量化后,模型显存占用可降至 15GB,使用 RTX 3090、RTX 4090 等 24GB 显存的消费级显卡即可本地运行长上下文任务。

开源与生态适配

Xing4.0-29B-A4B 以 Apache 2.0 协议开源,权重已上线 GitHub、HuggingFace、Gitee、魔搭与魔乐五个开源社区。在工具链方面,模型兼容 SGLang、vLLM、KTransformers 等推理框架,并支持 LLaMA-Factory 与 MindFormers 微调;同时针对 OpenCode、Claude Code、OpenClaw、Hermes 等开发工具做了定向适配,开发者可将其无缝接入现有工作流。华为方面表示,昇腾目前已支持 40 余个业界头部模型完成原生训练。