星辰 Xing4.0-29B 发布:全栈国产代码智能体大模型

星辰 Xing4.0-29B 发布

中电信人工智能科技有限公司于 9 月 17 日正式发布新一代星辰大模型 Xing4.0-29B-A4B。据 IT之家报道,该模型聚焦复杂任务理解、任务规划、工具调用与自主执行等能力,支持长上下文处理,可应用于代码开发、数据分析、办公自动化及生活服务等场景,是面向智能体(Agent)时代的轻量级代码智能体大模型。

全栈国产训练链路

华为官方介绍,Xing4.0-29B-A4B 总参数量 29B,激活参数仅 4B,是国内首个基于昇腾 Atlas 900 A3 SuperPoD 液冷超节点与昇思 MindSpore 框架完成训练的百亿参数级大模型,并面向复杂工程任务做了深度优化。
模型采用新一代架构设计,进一步提升长程任务处理与多步骤执行能力,能够根据用户给出的目标自主规划任务路径、调用工具并完成复杂任务。

架构与训练细节

在架构层面,模型专为长程 Agent 任务设计:MLA 多头潜变量注意力用于压缩 KV 缓存;MTP 多 Token 预测增强生成连贯性;mHC 流形约束超连接用于解决训练数值不稳定的问题;Muon 与 QK-Clip 优化器保障训练稳定。
训练采用分阶段递进策略,序列长度从 4K 逐步扩展至 32K、128K、256K,系统性构建长程能力。

工程优化方面,Xing4.0-29B-A4B 在昇腾超节点集群上通过多层次软硬件协同优化实现训练性能提升约 96%,接近翻倍:基于 MindSpore 全栈适配 mHC 多残差连接与 DSA 长序列机制,针对细粒度 MoE(64 路由专家、Top4 激活),通过专家负载均衡、Grouped GEMM、通信计算重叠及 DVM 图算融合,吞吐提升 32%;层级与算子级选择性重计算再提升 19%;自研 Ascend C mHC 融合算子解决 Sinkhorn 碎片化,计算效率提升 30%,整网吞吐再提升 25%。
此外,模型基于昇腾生态完成了 Slime 强化学习框架适配,面向 Agent、Coding、Reasoning 开展多专家强化学习训练,并通过 MOPD 技术实现多专家能力的高效融合。

评测表现与落地门槛

在落地门槛上,模型原生支持 256K 上下文,可扩展至 512K;4-bit 量化后显存占用降至 15GB(较 FP16 节省约 75%),意味着 RTX 3090、RTX 4090 等 24GB 显存的消费级显卡即可本地运行长上下文任务。

评测成绩单显示:SWE-bench Verified 达到 75.0,接近 Qwen3.6-35B-A3B 的 76.0,超过 Gemma4-26B-A4B 的 53.0;Terminal-Bench 2.1 为 57.5,超过 Qwen3.6-35B-A3B 的 51.5;SuperCLUE 智能体能力 93.52,位列第 3,与两款头部 Qwen 模型差距不足 1 分。

全面开源

目前模型权重已上线 GitHub、HuggingFace、魔搭(ModelScope)、Gitee、魔乐(Modelers)五个开源社区,采用 Apache 2.0 许可。模型兼容 SGLang、vLLM、KTransformers 推理框架,以及 LLaMA-Factory、MindFormers 微调工具,并对 OpenCode、Claude Code、OpenClaw、Hermes 等智能体框架做了定向适配。

据华为方面披露,昇腾已支持 40 多个业界头部模型完成原生训练,也是国内唯一支持商用大规模预训练并训练落地 SOTA 大模型的厂商。Xing4.0-29B-A4B 以「总参 29B、激活仅 4B」的轻量化设计,把大模型私有化部署的门槛从「先买一台服务器」降到了「用你手边的显卡」,为开发者、政企与中小企业提供了一条自主可控的代码智能体落地路径。