产业 / 媒体
Mistral发布3B安全模型Shieldstral,以七分之一体量追平更大规模竞品
法国AI公司Mistral发布了一款名为Shieldstral的安全分类模型,参数量仅30亿,却在标准文本安全基准测试中与规模约为其七倍的OpenAI GPT-OSS-Safeguard-20B打成平手,F1分数同为84.9%。该模型的核心创新在于以自然语言问答替代固定分类体系——运营商可在运行时用「这段内容是否宣扬暴力?」等问题自定义审核标准,无需重新训练模型。Shieldstral同时支持文本与图像的多模态内容审核,在图像及图文混合分类任务上以83.8%的得分领先多个规模更大的竞品。该模型基于Mistral的Ministral-3B构建,采用Apache 2.0协议开源发布,可在本地部署运行。研究团队通过约5410万条合成训练样本提升模型对新规则的适应能力,使其在面对训练集之外的审核策略时仍能保持较高准确率。
Mistral于2026年8月发布安全分类模型Shieldstral,参数量为30亿。根据研究论文,该模型在综合文本安全基准测试中取得84.9%的F1分数,与OpenAI的GPT-OSS-Safeguard-20B持平,同时超越Qwen3Guard-8B(84.0%)、Nemotron-3.5-Safety-4B(83.3%)以及LlamaGuard-4-12B(69.1%)。在图像与图文混合分类任务上,Shieldstral以83.8%的得分领先OmniGuard-7B(77.6%)和LlavaGuard-7B(71.6%),创下该类任务的新高。
现有安全护栏模型通常依赖固定的内容分类体系,但Mistral联合创始人Guillaume Lample等研究人员指出这一方式存在两大问题:公开安全数据集对风险的划分标准差异过大,难以形成统一分类;同一套规则也无法适配所有使用场景。例如,适合网络安全工具的内容在心理健康平台上可能构成伤害。Shieldstral的解决方案是让运营商用自然语言描述审核标准,模型仅返回「是」或「否」,系统再将两种回答的概率转化为0到1之间的安全评分。
为提升模型对新规则的适应能力,研究团队构建了约5410万条训练样本,涵盖安全、有害内容和操控性内容三大类别,并对不同类型数据采用不同严格程度的标注标准。团队还借助另一个语言模型将安全文本改写为不安全变体,并在每条训练样本中加入一个相近但不同的错误类别,迫使模型学会区分高度相似的规则,而非仅做粗粒度的安全与否判断。验证实验显示,合成类别数据使F1分数提升了23.3个百分点,是模型适应新规则能力的主要来源。
在适应性基准测试中,GPT-OSS-Safeguard-20B以94.1%的得分领先,Shieldstral为91.3%。该测试使用的规则与训练类别不同或完全陌生。研究人员认为,尽管Shieldstral在此项测试中略逊一筹,但其实用性更强——GPT-OSS-Safeguard-20B和Nemotron-3.5-Safety在给出答案前需生成较长的中间推理序列,显著增加计算成本,而Shieldstral仅输出单个词元,在速度和成本上更具优势。
安全分类器通常部署在主语言模型的输入和输出两端,对每一条请求进行过滤,因此其体量、速度和成本的累积效应不可忽视。Anthropic的Claude Fable 5曾因过滤器调校不当引发争议:有分析发现系统将8%至9%的任务自动转至能力较弱的模型,一名医学物理学家因工作中频繁出现「核」字而称该模型无法使用,还有用户反映MRI分析内容被误判为生物恐怖主义。Shieldstral允许运营商在运行时自行编写筛选标准,为这一权衡提供了更精细的控制手段。
Shieldstral基于Mistral的Ministral-3B,并集成了Pixtral视觉编码器,以Apache 2.0协议开源发布,支持本地部署。安全分类器在行业中的应用正日益广泛:OpenAI将其用于ChatGPT的自动年龄检测,并通过安全过滤器将情感类请求路由至更严格的模型;Claude Code则使用分类器拦截外部脚本、生产部署和强制推送操作。Shieldstral的开放权重和可定制规则机制,为希望在安全性与可用性之间寻求平衡的开发者提供了一个更灵活的选项。
要点
- Shieldstral以30亿参数在文本安全基准测试中追平OpenAI 200亿参数的同类模型,F1分数同为84.9%。
- 模型以自然语言问答替代固定分类体系,运营商可在运行时自定义审核规则,无需重新训练。
- 约5410万条合成训练样本使模型具备对训练集外新规则的适应能力,合成类别数据贡献了23.3个百分点的F1提升。
- Shieldstral仅输出单个词元,相比需要生成中间推理序列的竞品在速度和计算成本上更具优势。
- 该模型以Apache 2.0协议开源,支持本地部署,为开发者提供了更高的数据隐私保障和部署灵活性。
原始标题:Mistral's open model Shieldstral matches much larger safety models at a fraction of the size
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。