<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>Mistral &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/mistral/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Fri, 14 Aug 2026 08:35:20 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>Mistral 推出 OCR 4.1：文档 AI 进入段落级时代</title>
		<link>https://mylogs.cn/mistral-ocr-4-1-document-ai/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 14 Aug 2026 08:35:00 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Mistral]]></category>
		<category><![CDATA[OCR]]></category>
		<category><![CDATA[RAG]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[企业AI]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[文档智能]]></category>
		<guid isPermaLink="false">https://mylogs.cn/mistral-ocr-4-1-document-ai/</guid>

					<description><![CDATA[Mistral 推出 OCR 4.1：文档 AI 进入段落级时代 法国人工智能公司 Mistral 于 7 月 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<h2 class="wp-block-heading">Mistral 推出 OCR 4.1：文档 AI 进入段落级时代</h2>



<p class="wp-block-paragraph">法国人工智能公司 Mistral 于 7 月发布 OCR 4.1 公开预览版，把文档识别从单纯的「文字提取」推进到「结构化理解」。新模型最大的变化，是能够输出段落级的边界框（Bounding Box）、结构化区块标签，以及区块级的置信度评分，让企业在把纸质或扫描文档喂给检索增强生成（RAG）系统之前，先对提取质量做更细的把控。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f5df7d7aee&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f5df7d7aee" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="630" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/89b0070b2ecdfe671a97f368f274ee64_header.webp" alt="Mistral 推出 OCR 4.1：文档 AI 进入段落级时代" class="wp-image-4818" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/89b0070b2ecdfe671a97f368f274ee64_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/89b0070b2ecdfe671a97f368f274ee64_header-300x158.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/89b0070b2ecdfe671a97f368f274ee64_header-1024x538.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/89b0070b2ecdfe671a97f368f274ee64_header-768x403.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Mistral</figcaption></figure>





<h2 class="wp-block-heading">不只是识别文字</h2>



<p class="wp-block-paragraph">传统 OCR 只关心「图里是什么字」，而 OCR 4.1 试图理解文档的结构。它借助计算机视觉处理复杂排版、手写体以及数学公式，把图像和 PDF 中的文本、公式与表格布局，以较高的精度转换为结构化的 Markdown 格式。对于 RAG 管线而言，这意味着预处理步骤可以被压缩成一次 API 调用。</p>



<p class="wp-block-paragraph">Mistral 在官方文档中介绍，OCR 4.1 的 API 新增了「block」级别的置信度粒度选项：除了原有的「page」（页面级）与「word」（词级）之外，开发者现在可以拿到页面级与区块级两套评分，从而判断某一段落、某张表格的提取是否可靠，再决定是自动入库还是转人工复核。</p>



<h2 class="wp-block-heading">对手与定位</h2>



<p class="wp-block-paragraph">在企业文档智能领域，Mistral 的对手包括亚马逊的 Textract 与谷歌云的 Document AI。前者能提取文本、手写、表格与表单，后者则将 OCR 与版式分析、分类、结构化提取结合。相比这些背靠大型云生态的平台，Mistral 选择了一条更聚焦的路线：用一个连接自有模型、Studio 工具链与企业 AI 栈的专用文档模型切入。</p>



<p class="wp-block-paragraph">不过价格引发了讨论。OCR 4.1 定价约为每千页 3.5 欧元（约合 4.38 美元），有开发者指出这比部分竞品贵出近一倍。但在处理历史文献、复杂版式时的稳定性，以及在合规与数据主权方面支持开放权重、可本地私有化部署的特性，让它成为文档 AI 赛道一个值得关注的变量。</p>



<h2 class="wp-block-heading">为什么重要</h2>



<p class="wp-block-paragraph">文档摄取是智能体（agent）落地企业场景的关键入口。一个模型即便推理能力很强，只要把表格压平错了、把页脚误认成正文，或者把低置信度的数字直接写进检索索引，最终输出仍可能出错。OCR 4.1 把改进点放在「喂给搜索、智能体与自动化决策的那条文档管道」内部，用段落级输出与置信度评分，给开发者更细的检视、路由与索引能力。在头部大模型比拼通用能力的当下，押注细分工具模型，也是欧洲 AI 避开正面战场的一种务实选择。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Mistral 官方文档与多家科技媒体综合整理</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>3B打平20B，这个开源安全模型改规则只需一句话</title>
		<link>https://mylogs.cn/mistral-shieldstral-open-safeguard-model/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 22:30:08 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI安全]]></category>
		<category><![CDATA[Mistral]]></category>
		<category><![CDATA[内容审核]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/mistral-shieldstral-open-safeguard-model/</guid>

					<description><![CDATA[任何一款接入大模型的产品，迟早要回答这类问题：这段内容是否在煽动针对特定群体的暴力？这张图适合展示给未成年人吗 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">任何一款接入大模型的产品，迟早要回答这类问题：这段内容是否在煽动针对特定群体的暴力？这张图适合展示给未成年人吗？助手刚才那句话算不算拒答？</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a8f5df7d8cfe&quot;}" data-wp-interactive="core/image" data-wp-key="6a8f5df7d8cfe" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="716" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header.webp" alt="3B打平20B，这个开源安全模型改规则只需一句话" class="wp-image-3592" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header-300x179.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header-1024x611.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header-768x458.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Mistral AI</figcaption></figure>





<p class="wp-block-paragraph">麻烦在于，答案取决于产品形态、面向的人群，甚至具体场景。同一段文本，放在网络安全研究工具里完全正常，放在心理健康平台上就可能造成伤害。而绝大多数「护栏模型」把一套固定的风险分类硬编码进了权重里，换一个使用场景就得重新训练。更根本的问题是，安全定义本身在不同应用和领域之间就不统一，压根不存在一套「正确」的通用分类。</p>



<p class="wp-block-paragraph">法国人工智能公司 Mistral AI 在 8 月 4 日发布的 Shieldstral，走的是另一条路。</p>



<h2 class="wp-block-heading">把审核变成一道是非题</h2>



<p class="wp-block-paragraph">Shieldstral 是一个 30 亿参数的开放权重多模态安全分类器，采用 Apache 2.0 许可发布在 Hugging Face 上，支持 12 种语言，单张 16GB 的英伟达显卡就能跑起来。它的底座是 Mistral 自家的小型多模态模型 Ministral-3-3B，图像输入由 Pixtral 视觉编码器处理，模型卡标注的训练上下文为 32k token。</p>



<p class="wp-block-paragraph">它的核心设计是把内容审核彻底改写成一道二元问答题。每次请求由三部分组成：`&lt;Instruct&gt;` 给出评判语境、严格程度，以及（可选的）什么算作不安全内容的定义；`&lt;Query&gt;` 是一个是非问句，例如「这段内容是否在鼓励肢体暴力？」；`&lt;Document&gt;` 则是待判定的对象，可以是一段提示词、一次模型回复、一组提示与回复的配对，或者一张（可带文字的）图片。</p>



<p class="wp-block-paragraph">推理时，模型只读取 yes 和 no 两个 token 的 logits，做 softmax 归一化，输出一个连续的安全分数，默认以 0.5 为阈值切分结论。</p>



<p class="wp-block-paragraph">这个看似朴素的形式做成了两件事。一是把提示词分类、回复审核、拒答检测、毒性检测统统折叠成同一个问题；二是让策略完全活在提示词里——同一份权重文件，在部署时就能适配全新的规则，不需要重新训练。</p>



<h2 class="wp-block-heading">54 亿样本堆出来的以小博大</h2>



<p class="wp-block-paragraph">Mistral 给出的思路是：只要数据处理得当，小模型完全可以打赢大得多的对手。技术报告披露，训练用了约 5410 万条样本，其中 4520 万条来自公开文本安全数据集，440 万条是合成的对比样本，450 万条为多模态样本。</p>



<p class="wp-block-paragraph">第一步是统一异构数据。公开的安全数据集在分类体系、标签形式和标注惯例上互不兼容，从简单的安全/不安全二元标记，到细粒度的多标签体系都有。Mistral 为每个数据集写了单独的处理器，把它们全部转换成同一套「指令—问句—文档」格式，并刻意变换指令措辞、问句写法和分隔符，避免模型只学会一种固定表达。同时按数据来源校准严格程度——面向对抗性越狱的数据从严，面向回复质量的数据从宽——让模型学到有校准的判定边界。</p>



<p class="wp-block-paragraph">第二步是教会模型「分辨」而不是「背诵」。如果只用固定的策略标签训练，模型学到的只是把内容归入预设类别，而不是理解某条规则的精确边界，遇到没见过的新规则就会失灵。Mistral 的做法是构造一批刻意相似、极易混淆的策略，再让大模型把安全文本改写成对比样本：每一条改写都精确地违反其中一条策略，却不违反与它相邻的另一条。这套对比样本是围绕一个 73 类的分类体系生成的，训练出的能力可以迁移到用户自定义的、从未见过的策略上。</p>



<p class="wp-block-paragraph">第三步是补齐图像。不安全的图片没法像文本那样由大模型合成，视觉安全数据天然稀缺。团队用通用图像数据集补充高质量负样本，通过变换问句扩充数据，再用视觉语言重排序模型过滤每一组图文配对，减少错标和幻觉。</p>



<p class="wp-block-paragraph">最后一步是模型融合。团队用 LoRA 微调出多个检查点，再通过球面线性插值（SLERP）把三者合并：一个在公开数据上完成校准，一个从生成数据里获得细粒度的策略辨别力，第三个是基础指令模型。合并后的单一模型同时保留了策略校准、策略适应性，以及来自基础模型的指令跟随能力。整套训练在 Mistral 自研的 Forge 平台上完成。</p>



<h2 class="wp-block-heading">成绩单与它的注脚</h2>



<p class="wp-block-paragraph">Mistral 在 16 项基准上、对照 10 个开源基线做了评测，所有评测样本都从训练集中剔除。对照组包括 ShieldGemma 2、WildGuard、Llama Guard 4（12B）、Qwen3Guard（8B）以及 gpt-oss-safeguard 系列。</p>



<p class="wp-block-paragraph">技术报告给出的主要数字是：文本安全类基准平均 F1 达到 84.9%，与参数量约为其 7 倍的 GPT-OSS-Safeguard-20B 持平，在 4B 到 20B 区间的模型中排名第一；多模态安全类基准平均 F1 为 83.8%，超过次优的 OmniGuard-7B 的 77.6%，在三项图像安全基准中的两项领先；专门构建的策略适应性评测拿到 91.3% F1，略低于 GPT-OSS-Safeguard-20B 的 94.1%——不过后者在给出答案前要先生成一长串推理链，而 Shieldstral 只输出一个 token。</p>



<p class="wp-block-paragraph">需要标注的是，这些都是厂商自测数据，基准也由 Mistral 自行挑选，目前尚无第三方复现。报告本身也留了两处自我约束：策略适应性评测刻意使用了与训练完全不同的分类体系，且由不同的大模型生成和校验，以排除「背下了分类」的可能；而在多语言提示词分类上，附录显示 Shieldstral 在阿拉伯语和印尼语上落后于若干基线，语言覆盖不均被列为公开的局限。</p>



<p class="wp-block-paragraph">对工程团队来说，实际部署相当朴素，用 vLLM 起服务即可：</p>



<p class="wp-block-paragraph">&#8220;`</p>



<p class="wp-block-paragraph">vllm serve mistralai/Shieldstral-1.0-3B &#8211;max-model-len 32768</p>



<p class="wp-block-paragraph">&#8220;`</p>



<p class="wp-block-paragraph">Shieldstral 是 Mistral 的第三款审核模型，前两款都是托管 API，这是第一款以开放权重形式放出的。它同时也是 Mistral 与英伟达等机构共同发起的 Open Secure AI Alliance 的首批成果之一。对应的技术报告已于 7 月 28 日发布在 arXiv 上。</p>



<p class="wp-block-paragraph">真正被改变的，是安全工作的重心：从「训练更大的模型」转向「把策略写清楚」。规则可以进版本库、走代码评审、跑自动化测试，出问题时也留得下审计痕迹。代价是策略措辞、阈值选择和持续评测的活儿一件都少不了，而且全部落在使用方自己头上。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Mistral AI 官方博客，补充资料来自 Unite.AI、SourceFeed、Scalevise</p>

]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
