科大讯飞于 2026 年 9 月 1 日通过全资子公司词元星火开源星火 X2.5-4B 与星火 X2.5-1.7B 两款端侧大模型,其中 4B 版本成为业界首个原生支持最长 100 万 Token 上下文的端侧通用模型。这意味着手机、PC 与机器人可在本地一次性处理数十万字文档而无需切片,长文本理解、智能体与本地代码开发首次在断网环境也能完整跑通。
端侧模型为什么需要百万 Token 上下文
>
过去端侧模型处理长内容时,常要把文档切成几段分别处理,容易忘记前情、遗漏信息。星火 X2.5-4B 与 1.7B 原生支持百万级上下文,目标不是”塞下更多字”,而是让模型基于完整信息在连续交互中持续理解与处理复杂问题。
长上下文解决”信息能不能看全”,智能体与工具调用能力解决”看完之后能不能动手”。依托科大讯飞在 AI 研发、智能办公与智能硬件的积累,星火 X2.5 可面向个人办公、代码开发、智能硬件与机器人等场景提供本地化能力。
两款模型的定位与能力差异
>
星火 X2.5-4B 与 1.7B 均采用混合注意力架构,并围绕智能体、代码、数学与指令遵循等核心能力优化。两款模型基于全国产算力平台完成全流程训练,使用约 20 万亿 Token 多样化数据预训练,再通过高质量监督微调与强化学习持续提升推理、代码、智能体与指令遵循表现。
| 对比项 | 星火 X2.5-4B | 星火 X2.5-1.7B |
|---|---|---|
| 参数量 | 40 亿 | 17 亿 |
| 原生上下文 | 最长 100 万 Token | 最长 100 万 Token |
| 典型场景 | 代码开发、多步智能体 | 移动端与嵌入式轻量任务 |
| 能力对标 | 代码可对标大 2 至 3 倍的云端模型 | 轻量级本地推理 |
在代码开发场景中,星火 X2.5-4B 在算法实现、代码补全与生成等任务中可对标参数规模大 2 至 3 倍的云端模型。开发者可通过 DeepSeek Harness、OpenCode、Codex、Pi 等开源 Harness 将模型接入本地开发与自动化脚本流程。
如何本地部署星火 X2.5
>
部署层面,两款模型支持英伟达、华为、海光及后摩等硬件平台,兼容 vLLM、SGLang、llama.cpp 等主流推理框架,可通过 Ollama、LM Studio 等工具快速部署,并支持使用 LLaMA-Factory 开展增量训练。多硬件、多框架适配进一步降低了开发者在不同环境部署、微调与应用的门槛。
在个人办公场景,星火 X2.5 可覆盖数据处理、文档生成与文档翻译;在机器人场景,模型可部署于本体或边缘设备,支持操作控制、目标追踪与导航决策,减少对云端连接与固定预设程序的依赖。
端侧开源意味着什么
>
2026 年端侧模型密集落地,轻量模型此前多主打”断网能聊几句”,而星火 X2.5-4B 把百万级上下文带进本地设备,标志着端侧竞争从”能不能跑”转向”能不能基于完整上下文持续干活”。对隐私敏感的医疗、政企文档与无稳定网络的现场作业,本地长上下文推理价值尤为突出。
与云端大模型相比,端侧部署无需持续联网、不泄露原始数据、且边际成本趋近于零,适合高频、重复的办公与代码任务。星火 X2.5 以开源方式发布,模型权重与代码已在 Hugging Face 公开,开发者可基于自有数据微调,构建可控的本地智能体。

本文基于哪些信息
>
本文基于科大讯飞官方发布信息及中国日报 2026 年 9 月 2 日报道整理,关键数据(100 万 Token 上下文、约 20 万亿 Token 预训练、多硬件适配)均来自厂商公开披露。模型许可与部署细节以 Hugging Face 与官方仓库最新说明为准。







