<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>全模态大模型 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%85%a8%e6%a8%a1%e6%80%81%e5%a4%a7%e6%a8%a1%e5%9e%8b/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Fri, 18 Sep 2026 04:36:56 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>阿里 Qwen3.8-Omni-Flash 上线：全模态，百万 Token 0.8 元</title>
		<link>https://mylogs.cn/%e9%98%bf%e9%87%8c-qwen3-8-omni-flash-%e4%b8%8a%e7%ba%bf%ef%bc%9a%e5%85%a8%e6%a8%a1%e6%80%81%ef%bc%8c%e7%99%be%e4%b8%87-token-0-8-%e5%85%83/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 18 Sep 2026 04:36:56 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI 模型]]></category>
		<category><![CDATA[Gemini 3.8 Flash]]></category>
		<category><![CDATA[Qwen3.8-Omni-Flash]]></category>
		<category><![CDATA[会议转录]]></category>
		<category><![CDATA[全模态大模型]]></category>
		<category><![CDATA[开源]]></category>
		<category><![CDATA[阿里]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e9%98%bf%e9%87%8c-qwen3-8-omni-flash-%e4%b8%8a%e7%ba%bf%ef%bc%9a%e5%85%a8%e6%a8%a1%e6%80%81%ef%bc%8c%e7%99%be%e4%b8%87-token-0-8-%e5%85%83/</guid>

					<description><![CDATA[原生全模态：四种输入同时处理 9 月 18 日，阿里千问正式上线新一代原生全模态模型 Qwen3.8-Omni [&#8230;]]]></description>
										<content:encoded><![CDATA[<h2 class="wp-block-heading">原生全模态：四种输入同时处理</h2>
<p class="wp-block-paragraph">9 月 18 日，阿里千问正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash，并已在千问 AI 平台提供。与&#8221;先理解文本、再外接模块处理音视频&#8221;的做法不同，该模型从架构层面同时处理文本、图像、音频和视频输入，支持 1M（百万）上下文窗口，官方称可原生处理最长约一小时的连续音视频流。</p>
<p class="wp-block-paragraph">全模态模型的定位正在从&#8221;理解内容&#8221;走向&#8221;规划任务、调用工具并完成创作&#8221;。官方表示，Qwen3.8-Omni-Flash 在保持同尺寸文本模型能力的同时，全模态能力较上一代明显提升。</p>
<h2 class="wp-block-heading">30 项评测平均提升超 26%</h2>
<p class="wp-block-paragraph">在累计 30 项评测上，Qwen3.8-Omni-Flash 相比上一代 Qwen3.5-Omni-Plus 平均得分提升超过 26%。具体来看：</p>
<p class="wp-block-paragraph">&#8211; 音视频 Agent、Coding 和长程任务：WildClawBench-MM 提升 36.5 分，AgenticVBench 提升 22.3 分，UniClawBench 取得 69.6 分；&lt;br/&gt;- 长音频理解：LongAudioSpan 提升 8.3 分；&lt;br/&gt;- 视频理解：OmniVideoBench 提升 9.6 分；&lt;br/&gt;- 会议场景：AliMeeting 的说话人分离错误率（DER）从 88.11% 降至 3.35%，词错率（cpWER）从 89.61% 降至 17.18%。</p>
<p class="wp-block-paragraph">官方称，其音视频能力接近 Gemini 3.8 Flash，音频能力整体超过 Gemini 3.8 Flash。</p>
<h2 class="wp-block-heading">价格打到&#8221;基础能力&#8221;区间</h2>
<p class="wp-block-paragraph">最引人注目的是定价策略。Qwen3.8-Omni-Flash 的百万 Token 图文音视频输入定价为 0.8 元，API 每小时音频输入价格降幅超过 98%，每小时音视频输入价格降幅超过 93%。把全模态打到 0.8 元每百万 Token，意味着开发者以往因成本不敢全量调用的会议录音、访谈整理、视频内容生产等场景，如今具备了规模化调用的空间。</p>
<h2 class="wp-block-heading">能&#8221;看&#8221;能&#8221;听&#8221;还能&#8221;动手&#8221;</h2>
<p class="wp-block-paragraph">为支持长音视频，官方扩展了 Qwen-MM-Plugins，并开源 Qwen-Live Harness。前者面向长程工作流的按需感知、工具调用与执行，后者面向实时、持续的全模态交互。</p>
<p class="wp-block-paragraph">在 Agentic 长音视频理解中，OmniVideoBench 准确率从 63.4 提升至 67.8，Token 消耗从 145,736 降至 79,117，降幅约 45.7%。会议场景下，模型支持最长一小时音视频输入，可完成说话人切分、内容转录与身份对应，生成会议纪要和待办事项，并分析项目风险；结合工具调用，还可发送邮件、整理任务或编码。</p>
<p class="wp-block-paragraph">音视频生产方面，Music2MV 可理解歌曲结构、节奏与情绪，输出带时间戳的句级歌词；短剧翻译可完成角色识别、口语化翻译、角色克隆配音、音轨重混与成片质检；长电影解说中，用户给出影片和一句话需求，Agent 即可完成全模态理解、关键情节提炼、解说规划、配音配乐、剪辑渲染与成片质检。</p>
<h2 class="wp-block-heading">实时版与&#8221;听声辨位&#8221;</h2>
<p class="wp-block-paragraph">实时版 Qwen3.8-Omni-Flash-Realtime 可在音视频流输入的同时完成感知与响应，并结合实时上下文调用工具。官方称它是首个支持&#8221;听声辨位&#8221;的全模态大模型，融合空间声音与视觉信息，判断声源方向和距离；还支持实时口语陪练，联合建模发音与语义，理解受口音影响的非标准表达。</p>
<p class="wp-block-paragraph">在&#8221;模型优化模型&#8221;的实验中，Qwen3.8-Omni-Flash 在 12 小时内自主选定评测集、经 4 轮实验构建 3413 条训练数据，将 Qwen2.5-Omni-3B 的四川话识别字符错误率从 25.79% 降至 15.30%，相对下降约 40.7%。官方同时开源了 Qwen-MM-Plugins 中的 Video2Note（将数小时视频生成图文对应 PDF 笔记）与 Omni Skill Creator（从操作演示中提炼标准作业流程并转为可复用 Agent Skill）。</p>
<figure data-wp-context="{&quot;imageId&quot;:&quot;6aace6e7a7b0d&quot;}" data-wp-interactive="core/image" data-wp-key="6aace6e7a7b0d" class="wp-block-image wp-lightbox-container"><img decoding="async" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/09/ithome049_header.webp" alt="阿里发布 Qwen3.8-Omni-Flash 全模态模型"/><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption>图片来源：阿里 / IT之家</figcaption></figure>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
