产业 / 官方
谷歌DeepMind发布AI控制路线图,为内部智能体构建纵深防御体系
谷歌DeepMind于2026年6月18日正式发布《AI控制路线图》,这是一套专为内部AI智能体设计的纵深防御框架。该框架在模型对齐的基础上增加系统级安全层,将内部智能体视为潜在的「内部威胁」加以管控,即便对齐训练存在缺陷,也能提供额外保障。路线图借鉴网络安全领域的MITRE ATT&CK框架,将潜在攻击分解为可追踪的战术与技术,并通过受信任的AI系统担任「监督者」,对工作中的智能体进行实时审查。团队已分析逾百万条编程智能体任务轨迹,从中提炼出高信号行为模式,并将研究成果应用于Gemini Spark智能体的实时监控。与此同时,DeepMind还面向政策制定者发布了配套技术文件《智能体安全的三个层次》,呼吁产业界、学术界与监管机构协同构建生态级安全标准。
AI智能体正在重塑人类与技术的关系。从网络防御到科学发现,再到产品开发,这些系统通过自主执行复杂任务,开启了新一轮生产力跃升。据估计,仅在美国,AI智能体到2030年就可能创造高达2.9万亿美元的经济价值。然而,能力越强的智能体,也意味着需要更为精密的安全保障机制。正是在这一背景下,谷歌DeepMind推出了《AI控制路线图》,作为在谷歌内部构建和管理先进AI的核心框架。
该路线图的核心逻辑是「纵深防御」:在沙箱隔离、端点安全、提示注入防护等传统安全措施的基础上,将模型对齐作为主要防线,同时增设系统级安全层。DeepMind将这一机制比作驾校教练的双控系统——教练信任学员,但始终准备好在出现失误时接管方向盘或踩下刹车。智能体的权限将依据其经过验证的行为逐步授予,通过受控的渐进式访问建立信任。
在威胁建模层面,路线图将内部智能体视为类似「流氓员工」的潜在内部威胁,并借鉴MITRE ATT&CK框架将攻击路径拆解为可追踪的战术单元。安全响应分为三个维度:检测层面,由受信任的AI系统持续审查工作智能体的推理过程与行动计划;预防与响应层面,一旦监督者发现有害行为即可介入阻断;性能衡量层面,则通过覆盖率、召回率和响应时间三项关键指标持续评估系统效能。
随着AI模型能力不断提升,安全防御也必须同步强化。路线图将安全协议与AI能力的可量化里程碑相挂钩,重点关注两个维度:一是模型规避检测的能力——当模型学会隐藏推理过程时,仅靠读取可见的思维链将不再足够,需要进一步分析行为模式乃至检查模型内部结构;二是潜在危害程度——低风险可逆操作可采用异步审查,而重大网络攻击等高风险场景则必须切换至实时同步阻断模式。
为支撑上述系统的构建,DeepMind团队开发了一套内部异步监控原型,已对逾百万条编程智能体任务轨迹进行分析,并将发现逐级上报供人工审核。值得注意的是,数据显示大多数被标记事件并非源于对抗性意图,而是智能体对用户目标的误解或过度执行。这一洞察已被应用于Gemini Spark智能体的实时监控,帮助团队及时响应意外数据删除等突发问题,并推动安全协议从简单关键词过滤升级为高信号行为模式识别。
DeepMind强调,智能体生态系统的安全防御是一项共同责任。除内部路线图外,团队同步发布了面向政策制定者的技术文件《智能体安全的三个层次》,从单体智能体安全、多智能体系统安全以及生态级韧性建设三个层面,系统阐述了行业协同的必要性。DeepMind表示,将持续完善上述框架,在安全部署当前先进AI的同时,为未来奠定更坚实的安全基础。
要点
- 谷歌DeepMind发布《AI控制路线图》,在模型对齐之上增设系统级安全层,将内部智能体视为潜在内部威胁加以管控,提供对齐不完善时的额外保障。
- 路线图借鉴MITRE ATT&CK框架构建AI专属威胁模型,并通过覆盖率、召回率、响应时间三项指标持续衡量安全系统效能。
- 团队已分析逾百万条编程智能体轨迹,发现大多数被标记事件源于智能体误解或过度执行,而非对抗性意图,这一发现正在推动安全协议的精细化迭代。
- 安全响应策略须与威胁严重程度挂钩:低风险场景采用异步审查,高风险场景须切换至实时同步阻断,并随模型能力提升动态升级防御等级。
- DeepMind同步发布政策配套文件,呼吁产业界、学术界与监管机构围绕最佳实践和标准协同构建生态级智能体安全体系。