<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>内容审核 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%E5%86%85%E5%AE%B9%E5%AE%A1%E6%A0%B8/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Tue, 11 Aug 2026 04:45:31 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>越用越反感：生成式 AI 的公众反弹正在见效</title>
		<link>https://mylogs.cn/ai-slop-backlash-having-impact/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 11 Aug 2026 04:45:11 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI伦理]]></category>
		<category><![CDATA[AI反弹]]></category>
		<category><![CDATA[AI垃圾内容]]></category>
		<category><![CDATA[内容审核]]></category>
		<category><![CDATA[数据隐私]]></category>
		<category><![CDATA[深度伪造]]></category>
		<category><![CDATA[生成式AI]]></category>
		<guid isPermaLink="false">https://mylogs.cn/ai-slop-backlash-having-impact/</guid>

					<description><![CDATA[生成式 AI 正在肉眼可见地渗入日常软件，但公众对它的耐心似乎正在耗尽。纽约大学数据新闻学教授 Meredit [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">生成式 AI 正在肉眼可见地渗入日常软件，但公众对它的耐心似乎正在耗尽。纽约大学数据新闻学教授 Meredith Broussard 的一句话被反复引用：「AI 革命已经发生了，但所有人都讨厌它。」一家近期发布的盖洛普民调给出了更硬的数字：在 18 至 29 岁群体中，近半数认为生成式 AI 带来的弊大于利——越熟悉，反而越反感。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7b46e98bbfd&quot;}" data-wp-interactive="core/image" data-wp-key="6a7b46e98bbfd" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="628" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/slop_header.webp" alt="越用越反感：生成式 AI 的公众反弹正在见效" class="wp-image-4407" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/slop_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/slop_header-300x157.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/slop_header-1024x536.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/slop_header-768x402.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：WIRED</figcaption></figure>





<h2 class="wp-block-heading">平台先动手：举报与发现流门槛</h2>



<p class="wp-block-paragraph">反感正在变成产品侧的调整。领英（LinkedIn）上线了一个「看起来像 AI 垃圾内容」的举报按钮，让用户直接标记平台上的机器生成内容；Snapchat 宣布完全由 AI 生成的视频将不再进入其发现流的推荐；写作平台 Substack 则加入了 AI 检测工具，用来审核作者发布的内容。三家公司动作的时间点很近，像是对同一股情绪的同步回应。</p>



<p class="wp-block-paragraph">这些改动并不等于封杀 AI。Snapchat 的规则针对的是推荐资格而非内容本身，用自带 AI 工具增强的真人创作仍可被推荐；Substack 的检测也只是辅助审核。真正的分歧在于：AI 是在辅助创作，还是彻底取代了创作过程。</p>



<h2 class="wp-block-heading">「我从未同意过」：同意权之争</h2>



<p class="wp-block-paragraph">WIRED 服务专栏作者 Reece Rogers 在报道中把矛头指向一个更底层的问题——同意。许多人的不满在于：自己的网络互动数据被大规模抓取去训练模型，Instagram 在未告知的情况下给账号开了允许他人生成我的深度伪造的开关，谷歌把 AI 生成的答案硬塞进搜索结果顶部。功能是一个个被塞进常用软件的，而用户几乎没有参与决策。</p>



<p class="wp-block-paragraph">Broussard 对 WIRED 说，同意权之所以重要，是因为它关联到女性、性少数、少数族裔在网络上长期被剥削和滥用的历史，科技公司从来对同意不敏感。塔夫茨大学研究科技与人类学的副教授 Nick Seaver 也指出，企业往往是先把功能铺开、看哪个能留下来，因为没人真正知道这东西到底要干嘛。</p>



<h2 class="wp-block-heading">关掉的功能与街头的抗议</h2>



<p class="wp-block-paragraph">公众的反击并非只停留在抱怨。谷歌在 404 Media 报道后，几乎立刻撤回了让用户用生成式 AI 修改谷歌地球卫星图像的功能；Meta 在舆论和数百万播放量的批评视频压力下，三天后就关掉了 Instagram 的那项深度伪造工具。营销物料里的生成式 AI 也遇冷：麦当劳、可口可乐把 AI 视觉塞进广告后，引来大量负面反应，连本地小店用 AI 海报宣传活动时也会挨骂。</p>



<p class="wp-block-paragraph">更上游的抵触转向了数据中心。AI 工具依赖的算力中心在许多社区拔地而起，《AI 骗局》（The AI Con）的合著者 Emily Bender 指出，数据中心是环境与经济损失的交汇点，正把不同政治立场的人拉到同一边，围绕数据中心的抗议近期出现了跨阵营联合。</p>



<p class="wp-block-paragraph">在旧金山，即便是热衷工具的软件开发者，许多使用也是被动的。一名 Block 公司在裁员期间对员工说，如果工具真的好，大家自己就会用，自上而下的强制推行反而招来抵触。Broussard 提醒，面对资金雄厚的大公司，集体行动依然有用——公开压力确实能让一些不受欢迎的 AI 功能下线。</p>



<p class="has-small-font-size wp-block-paragraph">来源：WIRED | Reece Rogers | https://www.wired.com/story/the-ai-slop-backlash-is-actually-having-an-impact/</p>

]]></content:encoded>
					
		
		
			</item>
		<item>
		<title>700 个社区先试，Reddit 请大模型来当版主</title>
		<link>https://mylogs.cn/reddit-rules-hub-llm-moderation-api-changes/</link>
					<comments>https://mylogs.cn/reddit-rules-hub-llm-moderation-api-changes/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Thu, 06 Aug 2026 07:43:45 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[Reddit]]></category>
		<category><![CDATA[内容审核]]></category>
		<category><![CDATA[大语言模型]]></category>
		<category><![CDATA[开发者平台]]></category>
		<category><![CDATA[数据抓取]]></category>
		<category><![CDATA[社区治理]]></category>
		<guid isPermaLink="false">https://mylogs.cn/reddit-rules-hub-llm-moderation-api-changes/</guid>

					<description><![CDATA[美国社区平台 Reddit 宣布，将引入基于大语言模型的自动化审核工具，帮助版主管理社区。这套工具从 8 月  [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">美国社区平台 Reddit 宣布，将引入基于大语言模型的自动化审核工具，帮助版主管理社区。这套工具从 8 月 5 日起向所有新建社区开放测试，并计划在 2026 年晚些时候全面上线。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7b46e98cac4&quot;}" data-wp-interactive="core/image" data-wp-key="6a7b46e98cac4" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="624" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/b8db39588a4f32aeb9c2a8c429d644a8_header.webp" alt="700 个社区先试，Reddit 请大模型来当版主" class="wp-image-3797" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/b8db39588a4f32aeb9c2a8c429d644a8_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/b8db39588a4f32aeb9c2a8c429d644a8_header-300x156.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/b8db39588a4f32aeb9c2a8c429d644a8_header-1024x532.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/b8db39588a4f32aeb9c2a8c429d644a8_header-768x399.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：The Verge</figcaption></figure>





<p class="wp-block-paragraph">Reddit 官方数据显示，该平台目前每天有超过 1.3 亿人访问，社区数量超过 10 万个。</p>



<h2 class="wp-block-heading">从「关键词匹配」改成「读懂规则意图」</h2>



<p class="wp-block-paragraph">这套工具被命名为 Rules Hub（规则中心）。版主可以在其中选择哪些社区规则需要自动执行、规则被触发后采取何种动作（送入审核队列、过滤或直接移除），并在正式启用前预览效果，事后还能查看日志与数据洞察，了解规则的实际运行情况。</p>



<p class="wp-block-paragraph">与现有方案最核心的区别在判定方式。眼下大量子版块依赖的自动审核工具 Automoderator（通常简称 Automod），其判定逻辑建立在精确的关键词与模式匹配之上——规则里写了哪个词，就拦哪个词，不看上下文。Rules Hub 则改用大语言模型来评估「一条帖子或评论是否符合某条规则的意图」。</p>



<p class="wp-block-paragraph">Reddit 在官方博客中表示，这种做法「能够更好地处理语义细微差别、自然语言和边缘情况，同时保留版主的控制权」。</p>



<p class="wp-block-paragraph">对这次替换，Reddit 首席执行官史蒂夫·霍夫曼的表态相当直白。他称 Automod 一直是「最重要的版主工具之一」，但同时也「难学、难维护，严重依赖脆弱的关键词匹配、正则表达式，以及那些继承下来、往往整个版主团队里没几个人真正搞得懂的配置」。他的结论是：「我们可以做得更好。」</p>



<h2 class="wp-block-heading">已在 700 多个社区测试数月</h2>



<p class="wp-block-paragraph">Reddit 称，Rules Hub 在过去数月中已经进行了早期测试，参与者是来自 700 多个社区的新手与资深版主，其中包括 Reddit 版主委员会网络的成员。</p>



<p class="wp-block-paragraph">现阶段测试范围扩大到所有新创建的社区。Reddit 发言人罗莎·金向 The Verge 确认，对新社区而言这项功能是可选的。</p>



<p class="wp-block-paragraph">不过从官方措辞看，Automod 的执行类功能长期看会被逐步淘汰。Reddit 在博客中表示，展望未来，Rules Hub 与 Post &amp; Comment Guidance（发帖与评论引导）、Safety Filters（安全过滤器）等较新的系统合在一起，最终可以取代社区目前依赖 Automod 的许多执行流程。需要说明的是，被替代的是 Automod 的规则执行环节，而非 Automod 这个工具本身；Reddit 也强调，在替代方案经过测试并与版主共同验证之前，不会改动任何现有的执行流程。</p>



<h2 class="wp-block-heading">同日宣布：第三方应用必须迁到开发者平台</h2>



<p class="wp-block-paragraph">审核工具只是这批平台公告中的一项。Reddit 同时宣布了针对开发者的重大调整：新的第三方应用今后必须构建在 Reddit 的开发者平台之上，而不是公共接口。</p>



<p class="wp-block-paragraph">Reddit 在公告中描述了这样一个目标：让平台上所有良性、可信的自动化程序都运行在一个官方能够提供支持、并一致地执行政策的生态里。为此，公共接口访问会继续保留但仅限于有限范围，新的申请将被逐步收紧，第三方应用则需迁移到开发者平台上运行。</p>



<p class="wp-block-paragraph">霍夫曼给出的理由是，Reddit 的公共接口不是为今天这样的规模、自动化滥用和商业化抓取设计的。按他的说法，平台希望有用的机器人、社区工具和善意的开发者拥有一条清晰、被良好支持的开发路径，但不希望恶意方无节制地抓取 Reddit、转售数据，或在不承担责任的情况下使用这些数据。</p>



<p class="wp-block-paragraph">为配合迁移，Reddit 推出了总额 100 万美元的应用迁移计划。</p>



<p class="wp-block-paragraph">这一调整很难不让人联想到 2023 年那场风波。当时 Reddit 大幅调整接口收费政策，目的是让人工智能公司为使用其数据付费，结果引发大规模抗议，多款广受欢迎的第三方客户端因此关停。目前若开发者想做 Reddit 移动应用，仍需向官方申请公共接口豁免，金表示这一点不会改变。至于强制迁移的时间表，Reddit 尚未确定，但承诺会「提前充分通知社区」并给出明确日程。新规将影响「除明确获得豁免之外的所有接口应用」。</p>



<h2 class="wp-block-heading">老版界面也要动，但官方称不会直接砍掉</h2>



<p class="wp-block-paragraph">第三项变动指向 old.reddit.com——那套沿用了 21 年的旧版桌面界面。Reddit 称，改动是其反抓取行动的一部分。</p>



<p class="wp-block-paragraph">该公司此前已经采取了一系列措施：屏蔽不付费搜索引擎的收录、起诉 Anthropic 与 Perplexity、封锁互联网档案馆以阻断人工智能公司借道抓取数据；今年 6 月起，使用老版界面还需要登录账号。</p>



<p class="wp-block-paragraph">具体会怎么改，Reddit 没有明说。金表示公司正在「评估不同方案」，短期内会将访问限制为登录用户，并迁移关键的机器人和版主工作流。霍夫曼的说法则更全面一些：为了保护平台、业务和用户，公司必须有所动作，而且要做的事不止一件——可选项包括限制访问、迁移重要用途，或者用现代技术栈重建，他认为这三件大概都会做。</p>



<p class="wp-block-paragraph">对于用户可能产生的抵触，霍夫曼也有所预判。他坦言，关于接口和老产品的公告总是带着一些历史包袱，仅凭一句「相信我们」远远不够；如果要求用户迁移到新方案上，那么新方案在实际使用中就必须达到同等水平或者更好，而不只是理论上如此。他承诺，在有可信的替代方案之前不会移除主要能力，并会在改动落地前逐步公布进展。</p>



<p class="wp-block-paragraph">真正的考验仍在后面：把规则执行权从字符串匹配交给一个会「理解意图」的模型，意味着判定结果不再可以逐条复现。当模型误读了某个小众社区的黑话、玩笑或反讽时，Reddit 需要给出的答案，不只是技术层面的。</p>



<p class="has-small-font-size wp-block-paragraph">来源：The Verge、Reddit 官方博客</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/reddit-rules-hub-llm-moderation-api-changes/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>3B打平20B，这个开源安全模型改规则只需一句话</title>
		<link>https://mylogs.cn/mistral-shieldstral-open-safeguard-model/</link>
					<comments>https://mylogs.cn/mistral-shieldstral-open-safeguard-model/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 22:30:08 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI安全]]></category>
		<category><![CDATA[Mistral]]></category>
		<category><![CDATA[内容审核]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[开源模型]]></category>
		<guid isPermaLink="false">https://mylogs.cn/mistral-shieldstral-open-safeguard-model/</guid>

					<description><![CDATA[任何一款接入大模型的产品，迟早要回答这类问题：这段内容是否在煽动针对特定群体的暴力？这张图适合展示给未成年人吗 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">任何一款接入大模型的产品，迟早要回答这类问题：这段内容是否在煽动针对特定群体的暴力？这张图适合展示给未成年人吗？助手刚才那句话算不算拒答？</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a7b46e98dad1&quot;}" data-wp-interactive="core/image" data-wp-key="6a7b46e98dad1" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="716" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header.webp" alt="3B打平20B，这个开源安全模型改规则只需一句话" class="wp-image-3592" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header-300x179.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header-1024x611.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/e30f62437bbf0c6edcbbda5831f8434e_header-768x458.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：Mistral AI</figcaption></figure>





<p class="wp-block-paragraph">麻烦在于，答案取决于产品形态、面向的人群，甚至具体场景。同一段文本，放在网络安全研究工具里完全正常，放在心理健康平台上就可能造成伤害。而绝大多数「护栏模型」把一套固定的风险分类硬编码进了权重里，换一个使用场景就得重新训练。更根本的问题是，安全定义本身在不同应用和领域之间就不统一，压根不存在一套「正确」的通用分类。</p>



<p class="wp-block-paragraph">法国人工智能公司 Mistral AI 在 8 月 4 日发布的 Shieldstral，走的是另一条路。</p>



<h2 class="wp-block-heading">把审核变成一道是非题</h2>



<p class="wp-block-paragraph">Shieldstral 是一个 30 亿参数的开放权重多模态安全分类器，采用 Apache 2.0 许可发布在 Hugging Face 上，支持 12 种语言，单张 16GB 的英伟达显卡就能跑起来。它的底座是 Mistral 自家的小型多模态模型 Ministral-3-3B，图像输入由 Pixtral 视觉编码器处理，模型卡标注的训练上下文为 32k token。</p>



<p class="wp-block-paragraph">它的核心设计是把内容审核彻底改写成一道二元问答题。每次请求由三部分组成：`&lt;Instruct&gt;` 给出评判语境、严格程度，以及（可选的）什么算作不安全内容的定义；`&lt;Query&gt;` 是一个是非问句，例如「这段内容是否在鼓励肢体暴力？」；`&lt;Document&gt;` 则是待判定的对象，可以是一段提示词、一次模型回复、一组提示与回复的配对，或者一张（可带文字的）图片。</p>



<p class="wp-block-paragraph">推理时，模型只读取 yes 和 no 两个 token 的 logits，做 softmax 归一化，输出一个连续的安全分数，默认以 0.5 为阈值切分结论。</p>



<p class="wp-block-paragraph">这个看似朴素的形式做成了两件事。一是把提示词分类、回复审核、拒答检测、毒性检测统统折叠成同一个问题；二是让策略完全活在提示词里——同一份权重文件，在部署时就能适配全新的规则，不需要重新训练。</p>



<h2 class="wp-block-heading">54 亿样本堆出来的以小博大</h2>



<p class="wp-block-paragraph">Mistral 给出的思路是：只要数据处理得当，小模型完全可以打赢大得多的对手。技术报告披露，训练用了约 5410 万条样本，其中 4520 万条来自公开文本安全数据集，440 万条是合成的对比样本，450 万条为多模态样本。</p>



<p class="wp-block-paragraph">第一步是统一异构数据。公开的安全数据集在分类体系、标签形式和标注惯例上互不兼容，从简单的安全/不安全二元标记，到细粒度的多标签体系都有。Mistral 为每个数据集写了单独的处理器，把它们全部转换成同一套「指令—问句—文档」格式，并刻意变换指令措辞、问句写法和分隔符，避免模型只学会一种固定表达。同时按数据来源校准严格程度——面向对抗性越狱的数据从严，面向回复质量的数据从宽——让模型学到有校准的判定边界。</p>



<p class="wp-block-paragraph">第二步是教会模型「分辨」而不是「背诵」。如果只用固定的策略标签训练，模型学到的只是把内容归入预设类别，而不是理解某条规则的精确边界，遇到没见过的新规则就会失灵。Mistral 的做法是构造一批刻意相似、极易混淆的策略，再让大模型把安全文本改写成对比样本：每一条改写都精确地违反其中一条策略，却不违反与它相邻的另一条。这套对比样本是围绕一个 73 类的分类体系生成的，训练出的能力可以迁移到用户自定义的、从未见过的策略上。</p>



<p class="wp-block-paragraph">第三步是补齐图像。不安全的图片没法像文本那样由大模型合成，视觉安全数据天然稀缺。团队用通用图像数据集补充高质量负样本，通过变换问句扩充数据，再用视觉语言重排序模型过滤每一组图文配对，减少错标和幻觉。</p>



<p class="wp-block-paragraph">最后一步是模型融合。团队用 LoRA 微调出多个检查点，再通过球面线性插值（SLERP）把三者合并：一个在公开数据上完成校准，一个从生成数据里获得细粒度的策略辨别力，第三个是基础指令模型。合并后的单一模型同时保留了策略校准、策略适应性，以及来自基础模型的指令跟随能力。整套训练在 Mistral 自研的 Forge 平台上完成。</p>



<h2 class="wp-block-heading">成绩单与它的注脚</h2>



<p class="wp-block-paragraph">Mistral 在 16 项基准上、对照 10 个开源基线做了评测，所有评测样本都从训练集中剔除。对照组包括 ShieldGemma 2、WildGuard、Llama Guard 4（12B）、Qwen3Guard（8B）以及 gpt-oss-safeguard 系列。</p>



<p class="wp-block-paragraph">技术报告给出的主要数字是：文本安全类基准平均 F1 达到 84.9%，与参数量约为其 7 倍的 GPT-OSS-Safeguard-20B 持平，在 4B 到 20B 区间的模型中排名第一；多模态安全类基准平均 F1 为 83.8%，超过次优的 OmniGuard-7B 的 77.6%，在三项图像安全基准中的两项领先；专门构建的策略适应性评测拿到 91.3% F1，略低于 GPT-OSS-Safeguard-20B 的 94.1%——不过后者在给出答案前要先生成一长串推理链，而 Shieldstral 只输出一个 token。</p>



<p class="wp-block-paragraph">需要标注的是，这些都是厂商自测数据，基准也由 Mistral 自行挑选，目前尚无第三方复现。报告本身也留了两处自我约束：策略适应性评测刻意使用了与训练完全不同的分类体系，且由不同的大模型生成和校验，以排除「背下了分类」的可能；而在多语言提示词分类上，附录显示 Shieldstral 在阿拉伯语和印尼语上落后于若干基线，语言覆盖不均被列为公开的局限。</p>



<p class="wp-block-paragraph">对工程团队来说，实际部署相当朴素，用 vLLM 起服务即可：</p>



<p class="wp-block-paragraph">&#8220;`</p>



<p class="wp-block-paragraph">vllm serve mistralai/Shieldstral-1.0-3B &#8211;max-model-len 32768</p>



<p class="wp-block-paragraph">&#8220;`</p>



<p class="wp-block-paragraph">Shieldstral 是 Mistral 的第三款审核模型，前两款都是托管 API，这是第一款以开放权重形式放出的。它同时也是 Mistral 与英伟达等机构共同发起的 Open Secure AI Alliance 的首批成果之一。对应的技术报告已于 7 月 28 日发布在 arXiv 上。</p>



<p class="wp-block-paragraph">真正被改变的，是安全工作的重心：从「训练更大的模型」转向「把策略写清楚」。规则可以进版本库、走代码评审、跑自动化测试，出问题时也留得下审计痕迹。代价是策略措辞、阈值选择和持续评测的活儿一件都少不了，而且全部落在使用方自己头上。</p>



<p class="has-small-font-size wp-block-paragraph">来源：Mistral AI 官方博客，补充资料来自 Unite.AI、SourceFeed、Scalevise</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/mistral-shieldstral-open-safeguard-model/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
