讯飞 Spark-Audio 发布:纯国产算力炼出语音大模型

科大讯飞于 9 月 16 日宣布 Spark-Audio-1.0-Preview 上线。这是一款基于全国产化算力训练的语音基座大模型,标志着智能语音从“听清”向“听懂”迈进。

从级联到端到端

过去,大模型处理音频大多采用级联方案:先把语音转成文字,再交给大模型理解。这种做法存在两个短板:一是信息丢失,文字只能记录说了什么,会丢掉语音里的语气、情绪与背景环境音等关键信息;二是链路割裂,语音转写、声纹识别、语音翻译等能力被拆成独立模块串联,模块间存在断点,容易累积错误并带来延迟。

语音基座大模型要解决的正是这些问题:它不再只做语音转文字,而是直接理解语音,一次性听懂人声、环境音、音乐,并理解声音里的语义、情绪与场景。

模型结构

此次首发的 Spark-Audio-1.0-Preview 采用 0.65B(Dense 结构)的音频编码器,搭配 30B-A3B(MoE 结构)的大语言模型,使用了 1300 万小时音频以及大量文本数据,基于纯国产算力集群训练完成。在同一个模型中可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务。

评测表现

Spark-Audio-1.0-Preview 可支持 99 种语言及 202 种方言的识别。与同尺寸的 Qwen3.5-omni-flash(35B-A3B)相比,其在多语言、多方言语音识别上展现优势;与尺寸高一个数量级的 Qwen3.5-omni-plus 效果接近。在 Fleurs、KeSpeech、LibriSpeech 等中英文、多语言、多方言语音识别评测任务中,Spark-Audio-1.0-Preview 得分高于 Gemini-3.1 Pro;在 Fleurs-中文测试集中取得了 SOTA。面向更实际的应用场景,在高噪声、小音量等复杂条件下的语音识别评测任务中,该模型也有较为明显的领先优势。

在通用知识、数学与代码等任务上,Spark-Audio-1.0-Preview 没有出现明显降智;同时在指令遵循、对话、音频理解等任务上仍有进步追赶空间。

全栈国产化

作为业界首个基于全国产算力训练的语音基座大模型,Spark-Audio-1.0-Preview 在华为昇腾 910B、海光 BW1000 等国产芯片上完成了音频编码器、预训练、后训练的全流程高效训练。这证明了在国产算力上同样能够训练出效果达到业界领先水平的语音基座大模型。

目前,Spark-Audio-1.0-Preview 已正式开放体验,API 后续将上线讯飞开放平台。