阿里 Qwen3.8-Omni-Flash 上线:全模态,百万 Token 0.8 元

原生全模态:四种输入同时处理

9 月 18 日,阿里千问正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash,并已在千问 AI 平台提供。与”先理解文本、再外接模块处理音视频”的做法不同,该模型从架构层面同时处理文本、图像、音频和视频输入,支持 1M(百万)上下文窗口,官方称可原生处理最长约一小时的连续音视频流。

全模态模型的定位正在从”理解内容”走向”规划任务、调用工具并完成创作”。官方表示,Qwen3.8-Omni-Flash 在保持同尺寸文本模型能力的同时,全模态能力较上一代明显提升。

30 项评测平均提升超 26%

在累计 30 项评测上,Qwen3.8-Omni-Flash 相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%。具体来看:

– 音视频 Agent、Coding 和长程任务:WildClawBench-MM 提升 36.5 分,AgenticVBench 提升 22.3 分,UniClawBench 取得 69.6 分;<br/>- 长音频理解:LongAudioSpan 提升 8.3 分;<br/>- 视频理解:OmniVideoBench 提升 9.6 分;<br/>- 会议场景:AliMeeting 的说话人分离错误率(DER)从 88.11% 降至 3.35%,词错率(cpWER)从 89.61% 降至 17.18%。

官方称,其音视频能力接近 Gemini 3.8 Flash,音频能力整体超过 Gemini 3.8 Flash。

价格打到”基础能力”区间

最引人注目的是定价策略。Qwen3.8-Omni-Flash 的百万 Token 图文音视频输入定价为 0.8 元,API 每小时音频输入价格降幅超过 98%,每小时音视频输入价格降幅超过 93%。把全模态打到 0.8 元每百万 Token,意味着开发者以往因成本不敢全量调用的会议录音、访谈整理、视频内容生产等场景,如今具备了规模化调用的空间。

能”看”能”听”还能”动手”

为支持长音视频,官方扩展了 Qwen-MM-Plugins,并开源 Qwen-Live Harness。前者面向长程工作流的按需感知、工具调用与执行,后者面向实时、持续的全模态交互。

在 Agentic 长音视频理解中,OmniVideoBench 准确率从 63.4 提升至 67.8,Token 消耗从 145,736 降至 79,117,降幅约 45.7%。会议场景下,模型支持最长一小时音视频输入,可完成说话人切分、内容转录与身份对应,生成会议纪要和待办事项,并分析项目风险;结合工具调用,还可发送邮件、整理任务或编码。

音视频生产方面,Music2MV 可理解歌曲结构、节奏与情绪,输出带时间戳的句级歌词;短剧翻译可完成角色识别、口语化翻译、角色克隆配音、音轨重混与成片质检;长电影解说中,用户给出影片和一句话需求,Agent 即可完成全模态理解、关键情节提炼、解说规划、配音配乐、剪辑渲染与成片质检。

实时版与”听声辨位”

实时版 Qwen3.8-Omni-Flash-Realtime 可在音视频流输入的同时完成感知与响应,并结合实时上下文调用工具。官方称它是首个支持”听声辨位”的全模态大模型,融合空间声音与视觉信息,判断声源方向和距离;还支持实时口语陪练,联合建模发音与语义,理解受口音影响的非标准表达。

在”模型优化模型”的实验中,Qwen3.8-Omni-Flash 在 12 小时内自主选定评测集、经 4 轮实验构建 3413 条训练数据,将 Qwen2.5-Omni-3B 的四川话识别字符错误率从 25.79% 降至 15.30%,相对下降约 40.7%。官方同时开源了 Qwen-MM-Plugins 中的 Video2Note(将数小时视频生成图文对应 PDF 笔记)与 Omni Skill Creator(从操作演示中提炼标准作业流程并转为可复用 Agent Skill)。