<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>多模态 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%a4%9a%e6%a8%a1%e6%80%81/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Tue, 04 Aug 2026 22:30:28 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>3B打平20B，这个开源安全模型改规则只需一句话</title>
		<link>https://mylogs.cn/mistral-shieldstral-open-safeguard-model/</link>
					<comments>https://mylogs.cn/mistral-shieldstral-open-safeguard-model/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 22:30:08 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI安全]]></category>
		<category><![CDATA[Mistral]]></category>
		<category><![CDATA[内容审核]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/mistral-shieldstral-open-safeguard-model/</guid>

					<description><![CDATA[任何一款接入大模型的产品，迟早要回答这类问题：这段内容是否在煽动针对特定群体的暴力？这张图适合展示给未成年人吗 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">任何一款接入大模型的产品，迟早要回答这类问题：这段内容是否在煽动针对特定群体的暴力？这张图适合展示给未成年人吗？助手刚才那句话算不算拒答？</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a729c8b002da&quot;}" data-wp-interactive="core/image" data-wp-key="6a729c8b002da" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="716" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header.webp" alt="3B打平20B，这个开源安全模型改规则只需一句话" class="wp-image-3592" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header-300x179.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header-1024x611.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header-768x458.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Mistral AI</figcaption></figure>





<p class="wp-block-paragraph">麻烦在于，答案取决于产品形态、面向的人群，甚至具体场景。同一段文本，放在网络安全研究工具里完全正常，放在心理健康平台上就可能造成伤害。而绝大多数「护栏模型」把一套固定的风险分类硬编码进了权重里，换一个使用场景就得重新训练。更根本的问题是，安全定义本身在不同应用和领域之间就不统一，压根不存在一套「正确」的通用分类。</p>



<p class="wp-block-paragraph">法国人工智能公司 Mistral AI 在 8 月 4 日发布的 Shieldstral，走的是另一条路。</p>



<h2 class="wp-block-heading">把审核变成一道是非题</h2>



<p class="wp-block-paragraph">Shieldstral 是一个 30 亿参数的开放权重多模态安全分类器，采用 Apache 2.0 许可发布在 Hugging Face 上，支持 12 种语言，单张 16GB 的英伟达显卡就能跑起来。它的底座是 Mistral 自家的小型多模态模型 Ministral-3-3B，图像输入由 Pixtral 视觉编码器处理，模型卡标注的训练上下文为 32k token。</p>



<p class="wp-block-paragraph">它的核心设计是把内容审核彻底改写成一道二元问答题。每次请求由三部分组成：`&lt;Instruct&gt;` 给出评判语境、严格程度，以及（可选的）什么算作不安全内容的定义；`&lt;Query&gt;` 是一个是非问句，例如「这段内容是否在鼓励肢体暴力？」；`&lt;Document&gt;` 则是待判定的对象，可以是一段提示词、一次模型回复、一组提示与回复的配对，或者一张（可带文字的）图片。</p>



<p class="wp-block-paragraph">推理时，模型只读取 yes 和 no 两个 token 的 logits，做 softmax 归一化，输出一个连续的安全分数，默认以 0.5 为阈值切分结论。</p>



<p class="wp-block-paragraph">这个看似朴素的形式做成了两件事。一是把提示词分类、回复审核、拒答检测、毒性检测统统折叠成同一个问题；二是让策略完全活在提示词里——同一份权重文件，在部署时就能适配全新的规则，不需要重新训练。</p>



<h2 class="wp-block-heading">54 亿样本堆出来的以小博大</h2>



<p class="wp-block-paragraph">Mistral 给出的思路是：只要数据处理得当，小模型完全可以打赢大得多的对手。技术报告披露，训练用了约 5410 万条样本，其中 4520 万条来自公开文本安全数据集，440 万条是合成的对比样本，450 万条为多模态样本。</p>



<p class="wp-block-paragraph">第一步是统一异构数据。公开的安全数据集在分类体系、标签形式和标注惯例上互不兼容，从简单的安全/不安全二元标记，到细粒度的多标签体系都有。Mistral 为每个数据集写了单独的处理器，把它们全部转换成同一套「指令—问句—文档」格式，并刻意变换指令措辞、问句写法和分隔符，避免模型只学会一种固定表达。同时按数据来源校准严格程度——面向对抗性越狱的数据从严，面向回复质量的数据从宽——让模型学到有校准的判定边界。</p>



<p class="wp-block-paragraph">第二步是教会模型「分辨」而不是「背诵」。如果只用固定的策略标签训练，模型学到的只是把内容归入预设类别，而不是理解某条规则的精确边界，遇到没见过的新规则就会失灵。Mistral 的做法是构造一批刻意相似、极易混淆的策略，再让大模型把安全文本改写成对比样本：每一条改写都精确地违反其中一条策略，却不违反与它相邻的另一条。这套对比样本是围绕一个 73 类的分类体系生成的，训练出的能力可以迁移到用户自定义的、从未见过的策略上。</p>



<p class="wp-block-paragraph">第三步是补齐图像。不安全的图片没法像文本那样由大模型合成，视觉安全数据天然稀缺。团队用通用图像数据集补充高质量负样本，通过变换问句扩充数据，再用视觉语言重排序模型过滤每一组图文配对，减少错标和幻觉。</p>



<p class="wp-block-paragraph">最后一步是模型融合。团队用 LoRA 微调出多个检查点，再通过球面线性插值（SLERP）把三者合并：一个在公开数据上完成校准，一个从生成数据里获得细粒度的策略辨别力，第三个是基础指令模型。合并后的单一模型同时保留了策略校准、策略适应性，以及来自基础模型的指令跟随能力。整套训练在 Mistral 自研的 Forge 平台上完成。</p>



<h2 class="wp-block-heading">成绩单与它的注脚</h2>



<p class="wp-block-paragraph">Mistral 在 16 项基准上、对照 10 个开源基线做了评测，所有评测样本都从训练集中剔除。对照组包括 ShieldGemma 2、WildGuard、Llama Guard 4（12B）、Qwen3Guard（8B）以及 gpt-oss-safeguard 系列。</p>



<p class="wp-block-paragraph">技术报告给出的主要数字是：文本安全类基准平均 F1 达到 84.9%，与参数量约为其 7 倍的 GPT-OSS-Safeguard-20B 持平，在 4B 到 20B 区间的模型中排名第一；多模态安全类基准平均 F1 为 83.8%，超过次优的 OmniGuard-7B 的 77.6%，在三项图像安全基准中的两项领先；专门构建的策略适应性评测拿到 91.3% F1，略低于 GPT-OSS-Safeguard-20B 的 94.1%——不过后者在给出答案前要先生成一长串推理链，而 Shieldstral 只输出一个 token。</p>



<p class="wp-block-paragraph">需要标注的是，这些都是厂商自测数据，基准也由 Mistral 自行挑选，目前尚无第三方复现。报告本身也留了两处自我约束：策略适应性评测刻意使用了与训练完全不同的分类体系，且由不同的大模型生成和校验，以排除「背下了分类」的可能；而在多语言提示词分类上，附录显示 Shieldstral 在阿拉伯语和印尼语上落后于若干基线，语言覆盖不均被列为公开的局限。</p>



<p class="wp-block-paragraph">对工程团队来说，实际部署相当朴素，用 vLLM 起服务即可：</p>



<p class="wp-block-paragraph">&#8220;`</p>



<p class="wp-block-paragraph">vllm serve mistralai/Shieldstral-1.0-3B &#8211;max-model-len 32768</p>



<p class="wp-block-paragraph">&#8220;`</p>



<p class="wp-block-paragraph">Shieldstral 是 Mistral 的第三款审核模型，前两款都是托管 API，这是第一款以开放权重形式放出的。它同时也是 Mistral 与英伟达等机构共同发起的 Open Secure AI Alliance 的首批成果之一。对应的技术报告已于 7 月 28 日发布在 arXiv 上。</p>



<p class="wp-block-paragraph">真正被改变的，是安全工作的重心：从「训练更大的模型」转向「把策略写清楚」。规则可以进版本库、走代码评审、跑自动化测试，出问题时也留得下审计痕迹。代价是策略措辞、阈值选择和持续评测的活儿一件都少不了，而且全部落在使用方自己头上。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Mistral AI 官方博客，补充资料来自 Unite.AI、SourceFeed、Scalevise</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/mistral-shieldstral-open-safeguard-model/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>Kimi 给模型装了眼睛，DeepSeek 偏不装</title>
		<link>https://mylogs.cn/kimi-k3-deepseek-v4-native-multimodal-routes/</link>
					<comments>https://mylogs.cn/kimi-k3-deepseek-v4-native-multimodal-routes/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 11:40:36 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI编程]]></category>
		<category><![CDATA[DeepSeek]]></category>
		<category><![CDATA[Kimi]]></category>
		<category><![CDATA[国产大模型]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[月之暗面]]></category>
		<guid isPermaLink="false">https://mylogs.cn/kimi-k3-deepseek-v4-native-multimodal-routes/</guid>

					<description><![CDATA[你让大模型帮你写个网页，它写完能不能自己&#8221;看一眼&#8221;效果对不对？这个看似很小的问题，正在 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你让大模型帮你写个网页，它写完能不能自己&#8221;看一眼&#8221;效果对不对？这个看似很小的问题，正在把中国头部大模型分成两条路。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a729c8b00fdd&quot;}" data-wp-interactive="core/image" data-wp-key="6a729c8b00fdd" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="600" height="400" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/kimids_header.webp" alt="Kimi 给模型装了眼睛，DeepSeek 偏不装" class="wp-image-3525" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/kimids_header.webp 600w, https://mylogs.cn/wp-content/uploads/2026/08/kimids_header-300x200.webp 300w" sizes="(max-width: 600px) 100vw, 600px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：36氪（原文配图由 AI 生成）</figcaption></figure>





<p class="wp-block-paragraph">月之暗面在 7 月发布的 Kimi K3，总参数 2.8 万亿、每个词元激活约 1040 亿，走的是把视觉从预训练阶段就揉进主模型的路子，还从零训练了约 4 亿参数的视觉编码器 MoonViT-V2，不再借用现成的图文对比预训练权重。效果很直接：K3 发布后以 1679 分登上 Arena 前端代码榜首，这个榜单由用户盲选模型生成的可交互网页排名，看的不只是代码能不能跑，还包括页面最终长什么样。浏览器开发平台 Puter 在测试页里埋了 5 处视觉偏差，K3 对照目标页和运行页截图全部找出，没有误报。月之暗面把这种&#8221;写完代码看一眼页面再改&#8221;的循环叫作视觉在环。</p>



<p class="wp-block-paragraph">几周后 DeepSeek 给了另一种答案。V4-Flash 正式版总参数 2840 亿、每个词元激活 130 亿，分别只有 K3 的十分之一和八分之一，架构和参数规模都没动，全部力气花在后训练上，在考察网页开发和多轮工具操作的 Arena 网页开发榜上一度冲到 1577 分。它证明了：不加视觉、不扩规模，光靠后训练一样能把编程能力顶上去。</p>



<p class="wp-block-paragraph">说白了，两家争的从来不是&#8221;多模态该不该做&#8221;。DeepSeek 创始人梁文锋早就说过&#8221;多模态最终还是要做的&#8221;，分歧只在于什么时候做、愿意为此让出多少模型容量、数据和算力。多位业内人士的看法也一致：编程能力才是上牌桌的门槛。有意思的是，阿里刚发布的 Qwen3.8-Max 站到了和 K3 相近的一边——2.4 万亿总参数、激活 950 亿，视觉、编程、协作一起扛。</p>



<p class="wp-block-paragraph">对普通用户，这个分岔的现实意义很具体：如果你常截图丢给模型改页面、做幻灯片，优先选原生带视觉的；如果只写代码、处理文档，小而便宜的纯文本模型性价比明显更高。你平时给模型喂图多，还是喂字多？</p>



<p class="has-small-font-size wp-block-paragraph">来源：36氪·智能涌现《Kimi K3与DeepSeek V4之间，隔着原生多模态的时间差》，作者 李炤锋，编辑 张雨忻</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/kimi-k3-deepseek-v4-native-multimodal-routes/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>让大模型看视频，选帧比选模型更重要</title>
		<link>https://mylogs.cn/%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e7%9c%8b%e8%a7%86%e9%a2%91%ef%bc%8c%e9%80%89%e5%b8%a7%e6%af%94%e9%80%89%e6%a8%a1%e5%9e%8b%e6%9b%b4%e9%87%8d%e8%a6%81/</link>
					<comments>https://mylogs.cn/%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e7%9c%8b%e8%a7%86%e9%a2%91%ef%bc%8c%e9%80%89%e5%b8%a7%e6%af%94%e9%80%89%e6%a8%a1%e5%9e%8b%e6%9b%b4%e9%87%8d%e8%a6%81/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 01:18:48 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI大模型]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[开源项目]]></category>
		<category><![CDATA[抽帧]]></category>
		<category><![CDATA[视频理解]]></category>
		<guid isPermaLink="false">https://mylogs.cn/?p=3469</guid>

					<description><![CDATA[你把一段视频丢给大模型，它其实并没在&#8221;看&#8221;视频——它看到的是从里面抽出来的一沓静态截图 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你把一段视频丢给大模型，它其实并没在&#8221;看&#8221;视频——它看到的是从里面抽出来的一沓静态截图。开发者黄志弘在自己的工程笔记里给了个很直白的数字：受上下文预算所限，一段视频现实中最多只能塞进约 150 张图。抽哪 150 张，决定了模型是真看过，还是只看了一份关于它的幻灯片。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a729c8b018ea&quot;}" data-wp-interactive="core/image" data-wp-key="6a729c8b018ea" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/7c93e5a1b84d47f2a0c61d8e3f52b9a7_header.webp" alt="让大模型看视频，选帧比选模型更重要" class="wp-image-3474" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/7c93e5a1b84d47f2a0c61d8e3f52b9a7_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/7c93e5a1b84d47f2a0c61d8e3f52b9a7_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/7c93e5a1b84d47f2a0c61d8e3f52b9a7_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/7c93e5a1b84d47f2a0c61d8e3f52b9a7_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub / claude-real-video 项目页</figcaption></figure>





<p class="wp-block-paragraph">他做的开源工具叫 claude-real-video，采用 MIT 许可、完全在本地运行。核心结论是：抽帧不该按秒数均匀采样。定时采样会同时犯两个错——把一堆几乎一样的人头特写塞满预算，又恰好跳过真正发生事情的那一秒。</p>



<p class="wp-block-paragraph">他的做法是让阈值自己浮动：先算出每一帧的画面变化分数，再跟滚动平均值比，高动态素材自动抬高门槛，安静素材自动降低，不用人调参。去重则拆成三条通道——全局通道用 16×16 的色彩指纹判断整体变化；动作通道改用 32×32 网格，只要少数格子剧烈变化就保留，专治&#8221;画面里的人只占半个百分点&#8221;这类小主体；第三条通道精度提到 192×192，专门抓字幕更换、白板上多出一行字这种局部微变。有意思的是，第二条通道不是测出来的，是一位用户跑了 2181 段真实视频之后反馈出来的。</p>



<p class="wp-block-paragraph">说白了，视频理解眼下卡的不是模型看不懂，而是给它看什么。这跟写提示词是同一件事：信息密度比信息总量重要。</p>



<p class="wp-block-paragraph">如果你在做视频相关的自动化，不妨先检查一下自己的抽帧逻辑，是不是还停在&#8221;每秒一帧&#8221;。</p>



<p class="wp-block-paragraph">来源：leoaido.com（作者黄志弘）</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e7%9c%8b%e8%a7%86%e9%a2%91%ef%bc%8c%e9%80%89%e5%b8%a7%e6%af%94%e9%80%89%e6%a8%a1%e5%9e%8b%e6%9b%b4%e9%87%8d%e8%a6%81/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>MiniMax H3 开源：音视频一锅端，2K 15 秒</title>
		<link>https://mylogs.cn/minimax-h3-%e5%bc%80%e6%ba%90%ef%bc%9a%e9%9f%b3%e8%a7%86%e9%a2%91%e4%b8%80%e9%94%85%e7%ab%af%ef%bc%8c2k-15-%e7%a7%92/</link>
					<comments>https://mylogs.cn/minimax-h3-%e5%bc%80%e6%ba%90%ef%bc%9a%e9%9f%b3%e8%a7%86%e9%a2%91%e4%b8%80%e9%94%85%e7%ab%af%ef%bc%8c2k-15-%e7%a7%92/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 04:54:46 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI视频]]></category>
		<category><![CDATA[AMD]]></category>
		<category><![CDATA[MiniMax]]></category>
		<category><![CDATA[国产AI]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[视频生成]]></category>
		<guid isPermaLink="false">https://mylogs.cn/minimax-h3-%e5%bc%80%e6%ba%90%ef%bc%9a%e9%9f%b3%e8%a7%86%e9%a2%91%e4%b8%80%e9%94%85%e7%ab%af%ef%bc%8c2k-15-%e7%a7%92/</guid>

					<description><![CDATA[MiniMax H3 开源：音视频一锅端，2K 15 秒]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你听过的AI视频生成工具，多数还卡在&#8221;文生视频&#8221;或&#8221;图生视频&#8221;两件事之间来回切换。2026年8月3日，MiniMax把H3正式开源，把文本、图像、视频、音频当成同一件事一起处理。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a729c8b02018&quot;}" data-wp-interactive="core/image" data-wp-key="6a729c8b02018" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="427" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/565a59cd4d1358cd81db97780e153724_header.webp" alt="MiniMax H3 开源：音视频一锅端，2K 15 秒" class="wp-image-3400" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/565a59cd4d1358cd81db97780e153724_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/565a59cd4d1358cd81db97780e153724_header-300x107.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/565a59cd4d1358cd81db97780e153724_header-1024x364.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/565a59cd4d1358cd81db97780e153724_header-768x273.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：MiniMax Research</figcaption></figure>





<p class="wp-block-paragraph">H3是个通用多模态生成模型，输出15秒、2K分辨率（短边约1440像素）、24帧每秒的视频，画面与原生立体声音频在同一次生成中同步产出。同一段提示词里可以塞进至多9张图、3段视频、3段音频。比如&#8221;参考视频1的希区柯克运镜，让图片2里的角色按音频3开口唱歌&#8221;，H3会自己理顺上下文的关系。</p>



<p class="wp-block-paragraph">核心架构由四部分撑起来：Contextual Omni Representation把上百K token的原始素材压缩到约4K token，让语言成为跨模态的通用桥梁；H3-VAE把序列有效长度扩展4倍，配合原生2K输出；H3-Omni Transformer把理解与生成的算力分离，训练吞吐约提高30%；In-Context Regeneration让2K输出由模型自身在上下文内重画，不用外挂超分模块，小字、品牌标识都能保住。</p>



<p class="wp-block-paragraph">生成任务分三档：纯文本驱动的t2va、首尾帧关键帧驱动的fl2va，以及参考素材驱动的ref2va——后者能绑定主体图像与参考音色，做口型同步与语音克隆。</p>



<p class="wp-block-paragraph">价格上，2K同档每秒单价不到主流闭源模型的三分之一，768p每秒不到主流模型720p的一半。硬件适配是同步推进的：AMD用SGLang在MI355X和MI300X上跑出Day 0支持，8卡序列并行；摩尔线程同日在国产AI训推卡MTT S5000上完成适配。开源采用MiniMax Community License，权重将在未来几天放出。</p>



<p class="wp-block-paragraph">说白了，H3的看点不是又一个&#8221;文生视频&#8221;，而是把图像生成、参考控制、编辑拉到同一个框架里。OpenAI Sora 2、字节Seedance 2.5与谷歌Gemini Omni Flash分占不同赛道，H3在编辑与可控参考上领先，但纯文生视频和图生视频环节未必都第一。</p>



<p class="wp-block-paragraph">我的判断是，2026年下半年AI视频工具的PK标准会从&#8221;几秒高清&#8221;改成&#8221;多模态可控+开源可改+多硬件可跑&#8221;。H3把三条都点上了。想试的话，盯紧开源权重放出的那一天。</p>



<p class="wp-block-paragraph">来源：MiniMax Research 官方博客、AMD Developer Blog、36氪</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/minimax-h3-%e5%bc%80%e6%ba%90%ef%bc%9a%e9%9f%b3%e8%a7%86%e9%a2%91%e4%b8%80%e9%94%85%e7%ab%af%ef%bc%8c2k-15-%e7%a7%92/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>千问 3.8-Max 首发：2.4 万亿参数拐点在哪</title>
		<link>https://mylogs.cn/%e5%8d%83%e9%97%ae-3-8-max-%e9%a6%96%e5%8f%91%ef%bc%9a2-4-%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0%e6%8b%90%e7%82%b9%e5%9c%a8%e5%93%aa/</link>
					<comments>https://mylogs.cn/%e5%8d%83%e9%97%ae-3-8-max-%e9%a6%96%e5%8f%91%ef%bc%9a2-4-%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0%e6%8b%90%e7%82%b9%e5%9c%a8%e5%93%aa/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Mon, 03 Aug 2026 04:54:40 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI开源]]></category>
		<category><![CDATA[MoE]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[千问]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[阿里]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%8d%83%e9%97%ae-3-8-max-%e9%a6%96%e5%8f%91%ef%bc%9a2-4-%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0%e6%8b%90%e7%82%b9%e5%9c%a8%e5%93%aa/</guid>

					<description><![CDATA[千问 3.8-Max 首发：2.4 万亿参数拐点在哪]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你刷到一个数字，先别急着激动——2.4万亿参数、激活95B、千问史上首个开放权重的Max级模型，阿里2026年8月3日把Qwen3.8-Max端了出来。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a729c8b0279c&quot;}" data-wp-interactive="core/image" data-wp-key="6a729c8b0279c" class="wp-block-image size-large aligncenter wp-lightbox-container"><img loading="lazy" decoding="async" width="1200" height="674" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/e22f62889d07d84a84dffc5e953022d1_header.webp" alt="千问 3.8-Max 首发：2.4 万亿参数拐点在哪" class="wp-image-3398" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/e22f62889d07d84a84dffc5e953022d1_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/e22f62889d07d84a84dffc5e953022d1_header-300x169.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/e22f62889d07d84a84dffc5e953022d1_header-1024x575.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/e22f62889d07d84a84dffc5e953022d1_header-768x431.webp 768w" sizes="auto, (max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：腾讯网/IT之家</figcaption></figure>





<p class="wp-block-paragraph">它走的是稀疏MoE（混合专家）架构，总参数2.4万亿，每次推理只激活约950亿。上下文长度顶到1M tokens，硬件、显存、推理延迟这些事留给模型自己。定价是国际版每百万token输入2美元、输出6美元，对标Claude Opus 5只到对手的40%和24%。国内千问AI平台价格为每百万token输入12元、输出36元。</p>



<p class="wp-block-paragraph">动手能力方面，官方甩出三个真实案例：模型从零搭建oh-my-cli项目，无人工介入跑16天，265次提交、127个PR、151个issue；复现一篇推理论文并自我迭代，连续工作125小时、7600行代码、33轮GPU训练，AIME24比原方法再涨2.7分；参加WWW2025多模态对话挑战赛，24小时内击败458支人类队伍。芯片设计任务里，500轮交互把硬件门数从8298压到678，物理面积从106×106微米缩到46×46微米，整体缩小81%。</p>



<p class="wp-block-paragraph">基准上，PaperBench 93.0、IFBench 82.8、HealthBench 60.2、CoWorkBench 74.8、JobBench 53.4，多项超过Anthropic Fable 5和GPT-5.6 Sol；OSWorld-Verified 86.1、MLVU 90.8，多模态也不落下风。</p>



<p class="wp-block-paragraph">说白了，这版千问终于把&#8221;长程自主&#8221;摆到台面上了，标杆不再是单点刷分，而是能不能从一个空文件夹干完一个真实项目。权重下周登陆Hugging Face和ModelScope，Qwen3.8-27B同步开源。能调用Codex、Claude Code、Qoder这些主流框架，国内直接上qianwenai.com。</p>



<p class="wp-block-paragraph">我的判断是，国产大模型真正可用的临界点，不是榜单分数，而是这种&#8221;扔进去一个目标，干完十几个工作日&#8221;的工程闭环。等开源权重放出来，你会拿它跑什么？先想好怎么用。</p>



<p class="wp-block-paragraph">来源：千问官方博客、凤凰网科技、IT之家</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e5%8d%83%e9%97%ae-3-8-max-%e9%a6%96%e5%8f%91%ef%bc%9a2-4-%e4%b8%87%e4%ba%bf%e5%8f%82%e6%95%b0%e6%8b%90%e7%82%b9%e5%9c%a8%e5%93%aa/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
