AI资讯 / 研究

研究 / 官方

在保护隐私前提下洞察 AI 真实使用场景

Anthropic Research

Anthropic 发布了名为 Clio 的隐私保护分析系统,用于研究用户在现实场景中如何使用 Claude。该系统通过多阶段自动化流程,将海量对话提炼为匿名化的主题聚类,使分析人员能够在不接触个人信息的前提下,洞察模型的整体使用模式。Clio 对 100 万条 claude.ai 对话的分析显示,编程相关任务占比最高,超过 10% 的对话涉及网页与移动应用开发;教育类对话占比超过 7%;商业策略与运营类对话接近 6%。此外,该系统还发现了梦境解析、足球赛事分析、地下城与龙游戏辅助等数千个小众使用场景。Clio 同时为 Anthropic 的信任与安全团队提供支持,帮助识别潜在的政策违规行为,是传统安全评估方法的重要补充。该系统现已更名为 Anthropic Insights。

随着大型语言模型在全球范围内被广泛部署,如何系统性地了解用户的真实使用行为,成为 AI 安全领域的核心挑战之一。Anthropic 为此开发了 Clio(Claude Insights and Observations),一套专为隐私保护设计的自动化分析工具。与依赖预设场景的传统安全评估不同,Clio 采用自下而上的模式发现方式,通过对真实对话的聚类分析,揭示用户行为的全貌,而无需人工直接接触原始对话内容。

Clio 的工作流程分为四个核心步骤:首先从每条对话中提取话题、轮次数量、使用语言等多维度属性;随后通过语义聚类将相似对话自动归组;接着为每个聚类生成去除隐私信息的描述性标题与摘要;最后将聚类组织成多层级结构,供分析人员在交互界面中探索。整个流程完全由 Claude 自动完成,人工分析师只能看到经过处理的高层级聚类结果,无法接触个人对话数据。

在隐私保护机制上,Clio 采用了多层防御设计。Claude 在提取信息时被明确指示忽略私人细节;系统设有最低用户数量阈值,确保低频话题不会因过于具体而暴露个人身份;在向人工分析师展示结果前,Claude 还会对聚类摘要进行最终审查,确认其中不含可识别信息。这套机制经过了大量测试验证,力求在数据洞察与用户隐私之间取得平衡。

对 100 万条 claude.ai 对话的分析结果显示,编程类任务是用户最主要的使用场景,网页与移动应用开发单一类别就占据了超过 10% 的对话量,涵盖代码调试、Git 操作解释等具体需求。教育类对话以超过 7% 的占比位居第二,商业策略与运营类对话则接近 6%。值得注意的是,Clio 还识别出数千个小众聚类,包括梦境解析、足球赛事分析、灾难应急准备、填字游戏提示以及地下城与龙游戏辅助等,体现了用户需求的高度多样性。

Clio 在不同语言群体中也观察到显著的使用差异。通过计算各语言在整体对话中的基准出现频率,系统能够识别出某一语言群体中异常高频的话题,从而反映出不同文化背景下用户的差异化需求。这一功能为 Anthropic 理解全球用户行为提供了重要参考,也为针对特定语言社区的产品优化提供了数据依据。

在安全应用层面,Clio 为 Anthropic 的信任与安全团队提供了一种全新的违规检测路径。团队可以通过审查聚类标题,快速识别涉及生成误导性内容或煽动仇恨行为等违反使用政策的活动,进而对相关账户展开进一步调查。这种自下而上的审查方式与传统的预设规则检测形成互补,有助于发现此前未被预料到的滥用模式,持续强化平台的安全防护能力。

要点

  • Clio 通过全自动的匿名聚类流程,让 Anthropic 在不接触用户原始对话的前提下,系统性地了解 Claude 的真实使用规律。
  • 编程类任务是 claude.ai 最主要的使用场景,网页与移动应用开发单类占比超过 10%,教育和商业运营类紧随其后。
  • 系统在不同语言群体中发现了显著的使用差异,反映出各文化背景下用户需求的独特性。
  • Clio 为信任与安全团队提供了自下而上的违规检测能力,能够发现传统预设规则难以覆盖的新型滥用模式。
  • 该系统现已更名为 Anthropic Insights,标志着其从研究工具向常态化运营分析平台的转型。
查看原始来源

原始标题:Privacy-preserving insights into real-world AI use

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。