AI资讯 / Agent

Agent / 官方

面向智能体 AI 的可扩展安全护栏框架

inclusionAI GitHub

蚂蚁集团 AI 安全实验室发布 SingGuard-NSFA,面向智能体 AI 的安全护栏框架。它针对提示注入、敏感信息窃取、恶意代码请求、危险工具滥用、资源耗尽等操作型威胁,构建了基于 CIA 三要素的 NSFA 风险分类体系,包含 7 个一级域、28 个二级风险和 185 个三级变体,并已与三份 OWASP 指南交叉验证。项目同步发布覆盖 133 种语言的多语言基准集,总样本超过 9.3 万,另有 3435 条跨源样本用于独立泛化验证。框架采用生成式推理与判别式分类双模式架构:前者用于离线可解释审计,后者面向在线实时拦截,延迟约 50 毫秒。其原生可扩展设计允许仅训练轻量级检测头即可覆盖 NSFA 之外的全新风险,无需重新训练主干,也支持作为插件增强现有护栏。开源版本提供 0.8B、2B、4B、9B 四档模型,在多语言基准上 F1 均超过 94%。

蚂蚁集团 AI 安全实验室近日开源了 SingGuard-NSFA,这是一套面向智能体 AI 的可扩展安全护栏框架。随着大模型从文本生成器演进为能够调用工具、执行代码并编排多步计划的自主智能体,安全威胁的重心也从模型说了什么,转向智能体做了什么,传统内容安全护栏已难以覆盖新的操作型风险。

项目的核心贡献之一是 NSFA 风险分类体系。该体系以 CIA 三要素(机密性、完整性、可用性)为根基,将查询侧和响应侧威胁组织为 7 个一级域、28 个二级风险和 185 个三级变体,并已与三份 OWASP 指南完成交叉验证。体系强调查询优先、响应兜底的拦截策略,以及单轮可检测性与多语言覆盖,确保在低延迟、无状态模式下也能阻止跨语种绕过。

在数据层面,团队构建了覆盖 133 种语言的多语言基准集,包括超过 9.3 万条面向 185 类风险变体的专用样本,以及 3435 条由 AgentDojo、InjecAgent、AgentHarm、AgentDyn、ATBench 等公开数据集改造而来的跨源样本。训练数据通过四阶段合成流水线生成:先由 74 个开源大模型无种子生成正负样本,再以种子增强扩展分布,随后借助 TranslateGemma-27B-IT 翻译至中文以及另外 131 种语言,最后由 Qwen3.5-397B-A17B 复核并丢弃有分歧的样本。

SingGuard-NSFA 在推理层面采用双模式架构:生成式推理沿链式思考生成基于 NSFA 定义的风险分析,用于离线审计和合规审查;判别式分类则由冻结主干加轻量级 MLP 检测头构成,面向在线实时拦截,延迟约 50 毫秒。每个领域检测头独立运行,支持多标签检测,并允许在不重训主干的情况下扩展至新风险,也可作为插件为 Llama Guard 3 等现有护栏带来约 17.6 个 F1 点的提升。

开源仓库同步发布了 0.8B、2B、4B、9B 共四档以 Qwen3.5-Base 为骨干的模型权重与训练代码。在多语言基准测试中,所有模型 F1 均超过 94%,相对当前最强的同类护栏领先 6 到 12 个绝对 F1 点。团队表示,相关模型与脚本已开放下载,旨在为智能体系统提供既可解释又可热插拔的安全防护底座。

要点

  • NSFA 风险分类包含 7 个一级域、28 个二级风险和 185 个三级变体,并已与三份 OWASP 指南交叉验证。
  • 多语言基准集覆盖 133 种语言,专用样本超过 9.3 万条,跨源样本 3435 条,用于独立泛化评估。
  • 框架采用生成式推理与判别式分类双模式,在线拦截延迟约 50 毫秒,兼顾可解释性与实时性。
  • 通过冻结主干加轻量级 MLP 检测头,可低成本扩展新风险,并为 Llama Guard 3 等现有护栏带来约 17.6 个 F1 点的提升。
  • 开源 0.8B、2B、4B、9B 四档模型,在多语言基准上 F1 均超过 94%,相对最强竞品领先 6 到 12 个绝对点。
查看原始来源

原始标题:inclusionAI/SingGuard-NSFA

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。