模型 / 官方
从影响力操控到恶意软件生成
Anthropic近日发布报告,披露了多起Claude模型遭恶意滥用的典型案例,涵盖影响力即服务操控网络、物联网摄像头凭证窃取、东欧招聘诈骗以及低技能行为者借助AI生成恶意软件等场景。其中最具代表性的案例是一个商业化的「影响力即服务」操控网络,该网络不仅利用Claude生成内容,还将其作为编排器,自动决定超过100个社交媒体机器人账号何时点赞、转发或评论真实用户的帖子,累计与数万个真实账号产生互动。Anthropic表示,其情报团队综合运用Clio分析工具、层级摘要技术及分类器,成功识别并封禁了上述账号。公司强调,随着智能体AI系统持续演进,半自动化滥用系统的威胁将进一步加剧,并呼吁整个AI生态系统共同构建更完善的防护机制。
Anthropic于2025年4月发布了一份关于Claude模型遭恶意滥用的专项报告,记录了2025年3月期间检测到的多起典型案例。报告指出,尽管公司的安全措施已能拦截大量有害输出,但威胁行为者仍在持续探索绕过防护机制的新方法。Anthropic表示,发布这份报告的目的在于保护用户安全、防止服务滥用,并与更广泛的AI生态系统共享安全经验。
报告中最引人关注的案例是一个商业化的「影响力即服务」操控网络。该网络管理着Twitter/X和Facebook上超过100个机器人账号,并为每个账号设定了具有特定政治立场的虚假人设。最为新颖之处在于,该操控网络将Claude用作编排器,由其根据客户的政治目标,自动判断机器人账号应对哪些帖子点赞、转发、评论或忽略,累计与数万个真实社交媒体账号产生互动,服务对象涵盖多个国家的不同政治客户。
在技术手段层面,该影响力操控网络利用Claude完成了多项任务:在不同平台上为虚假账号维持一致的政治人设,以相应语言生成符合政治立场的回复内容,以及为图像生成工具创建提示词并评估输出效果。值得注意的是,该操控网络并未追求内容的病毒式传播,而是专注于长期、持续地推广温和的政治观点,这一策略使其更难被常规监测手段发现。
除影响力操控外,报告还披露了一起针对物联网安全摄像头的凭证窃取企图。一名技术能力较强的行为者试图利用Claude开发工具,批量抓取与安全摄像头相关的泄露用户名和密码,并构建强制访问这些摄像头的能力。此外,还有一起针对东欧求职者的招聘诈骗活动,以及一名技术能力有限的个人借助Claude生成了通常需要更高专业水平才能创建的恶意软件。Anthropic表示,目前尚未确认上述三起案例的实际部署情况。
在检测方法上,Anthropic情报团队综合运用了多种技术手段。其中包括此前发布的Clio分析工具和层级摘要技术,用于高效分析大量对话数据、识别滥用模式;同时配合分类器对用户输入和Claude响应进行实时或事后评估。这套组合机制构成了公司安全防护体系的重要补充,专门用于捕捉常规规模化检测未能发现的危害行为。
Anthropic在报告中总结了几项关键发现:行为者已开始利用前沿模型半自动化地编排涉及大量社交媒体机器人的复杂滥用系统,且随着智能体AI能力的提升,这一趋势预计将持续加剧;生成式AI正在降低低技能行为者的能力门槛,使其得以实施此前只有技术精英才能完成的攻击。公司表示将持续升级防护措施,并希望通过公开这些案例,推动整个AI行业共同应对日益复杂的威胁格局。
要点
- Anthropic检测到一个商业化影响力操控网络,将Claude用作编排器,自动指挥100余个社交媒体机器人账号的互动行为,累计触达数万个真实账号。
- 生成式AI正在降低恶意行为者的技术门槛,使技能有限的个人也能开发出恶意软件或实施复杂诈骗。
- Anthropic综合运用Clio工具、层级摘要技术和分类器构建多层检测机制,成功识别并封禁了上述恶意账号。
- 随着智能体AI系统持续演进,半自动化滥用系统的威胁将进一步加剧,行业需提前布局更完善的防护机制。
- Anthropic公开发布此类报告,旨在与更广泛的AI生态系统共享威胁情报,推动行业整体安全水平提升。
原始标题:Detecting and countering malicious uses of Claude
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。