任何一款接入大模型的产品,迟早要回答这类问题:这段内容是否在煽动针对特定群体的暴力?这张图适合展示给未成年人吗?助手刚才那句话算不算拒答?

麻烦在于,答案取决于产品形态、面向的人群,甚至具体场景。同一段文本,放在网络安全研究工具里完全正常,放在心理健康平台上就可能造成伤害。而绝大多数「护栏模型」把一套固定的风险分类硬编码进了权重里,换一个使用场景就得重新训练。更根本的问题是,安全定义本身在不同应用和领域之间就不统一,压根不存在一套「正确」的通用分类。
法国人工智能公司 Mistral AI 在 8 月 4 日发布的 Shieldstral,走的是另一条路。
把审核变成一道是非题
Shieldstral 是一个 30 亿参数的开放权重多模态安全分类器,采用 Apache 2.0 许可发布在 Hugging Face 上,支持 12 种语言,单张 16GB 的英伟达显卡就能跑起来。它的底座是 Mistral 自家的小型多模态模型 Ministral-3-3B,图像输入由 Pixtral 视觉编码器处理,模型卡标注的训练上下文为 32k token。
它的核心设计是把内容审核彻底改写成一道二元问答题。每次请求由三部分组成:`<Instruct>` 给出评判语境、严格程度,以及(可选的)什么算作不安全内容的定义;`<Query>` 是一个是非问句,例如「这段内容是否在鼓励肢体暴力?」;`<Document>` 则是待判定的对象,可以是一段提示词、一次模型回复、一组提示与回复的配对,或者一张(可带文字的)图片。
推理时,模型只读取 yes 和 no 两个 token 的 logits,做 softmax 归一化,输出一个连续的安全分数,默认以 0.5 为阈值切分结论。
这个看似朴素的形式做成了两件事。一是把提示词分类、回复审核、拒答检测、毒性检测统统折叠成同一个问题;二是让策略完全活在提示词里——同一份权重文件,在部署时就能适配全新的规则,不需要重新训练。
54 亿样本堆出来的以小博大
Mistral 给出的思路是:只要数据处理得当,小模型完全可以打赢大得多的对手。技术报告披露,训练用了约 5410 万条样本,其中 4520 万条来自公开文本安全数据集,440 万条是合成的对比样本,450 万条为多模态样本。
第一步是统一异构数据。公开的安全数据集在分类体系、标签形式和标注惯例上互不兼容,从简单的安全/不安全二元标记,到细粒度的多标签体系都有。Mistral 为每个数据集写了单独的处理器,把它们全部转换成同一套「指令—问句—文档」格式,并刻意变换指令措辞、问句写法和分隔符,避免模型只学会一种固定表达。同时按数据来源校准严格程度——面向对抗性越狱的数据从严,面向回复质量的数据从宽——让模型学到有校准的判定边界。
第二步是教会模型「分辨」而不是「背诵」。如果只用固定的策略标签训练,模型学到的只是把内容归入预设类别,而不是理解某条规则的精确边界,遇到没见过的新规则就会失灵。Mistral 的做法是构造一批刻意相似、极易混淆的策略,再让大模型把安全文本改写成对比样本:每一条改写都精确地违反其中一条策略,却不违反与它相邻的另一条。这套对比样本是围绕一个 73 类的分类体系生成的,训练出的能力可以迁移到用户自定义的、从未见过的策略上。
第三步是补齐图像。不安全的图片没法像文本那样由大模型合成,视觉安全数据天然稀缺。团队用通用图像数据集补充高质量负样本,通过变换问句扩充数据,再用视觉语言重排序模型过滤每一组图文配对,减少错标和幻觉。
最后一步是模型融合。团队用 LoRA 微调出多个检查点,再通过球面线性插值(SLERP)把三者合并:一个在公开数据上完成校准,一个从生成数据里获得细粒度的策略辨别力,第三个是基础指令模型。合并后的单一模型同时保留了策略校准、策略适应性,以及来自基础模型的指令跟随能力。整套训练在 Mistral 自研的 Forge 平台上完成。
成绩单与它的注脚
Mistral 在 16 项基准上、对照 10 个开源基线做了评测,所有评测样本都从训练集中剔除。对照组包括 ShieldGemma 2、WildGuard、Llama Guard 4(12B)、Qwen3Guard(8B)以及 gpt-oss-safeguard 系列。
技术报告给出的主要数字是:文本安全类基准平均 F1 达到 84.9%,与参数量约为其 7 倍的 GPT-OSS-Safeguard-20B 持平,在 4B 到 20B 区间的模型中排名第一;多模态安全类基准平均 F1 为 83.8%,超过次优的 OmniGuard-7B 的 77.6%,在三项图像安全基准中的两项领先;专门构建的策略适应性评测拿到 91.3% F1,略低于 GPT-OSS-Safeguard-20B 的 94.1%——不过后者在给出答案前要先生成一长串推理链,而 Shieldstral 只输出一个 token。
需要标注的是,这些都是厂商自测数据,基准也由 Mistral 自行挑选,目前尚无第三方复现。报告本身也留了两处自我约束:策略适应性评测刻意使用了与训练完全不同的分类体系,且由不同的大模型生成和校验,以排除「背下了分类」的可能;而在多语言提示词分类上,附录显示 Shieldstral 在阿拉伯语和印尼语上落后于若干基线,语言覆盖不均被列为公开的局限。
对工程团队来说,实际部署相当朴素,用 vLLM 起服务即可:
“`
vllm serve mistralai/Shieldstral-1.0-3B –max-model-len 32768
“`
Shieldstral 是 Mistral 的第三款审核模型,前两款都是托管 API,这是第一款以开放权重形式放出的。它同时也是 Mistral 与英伟达等机构共同发起的 Open Secure AI Alliance 的首批成果之一。对应的技术报告已于 7 月 28 日发布在 arXiv 上。
真正被改变的,是安全工作的重心:从「训练更大的模型」转向「把策略写清楚」。规则可以进版本库、走代码评审、跑自动化测试,出问题时也留得下审计痕迹。代价是策略措辞、阈值选择和持续评测的活儿一件都少不了,而且全部落在使用方自己头上。
来源:Mistral AI 官方博客,补充资料来自 Unite.AI、SourceFeed、Scalevise

