研究 / 官方
Anthropic 首次开放真实用户数据,外部研究者独立分析 Claude 使用行为
Anthropic 今年春季启动了一项试点计划,首次允许外部研究机构通过其隐私保护分析工具 Anthropic Insights 独立研究 Claude 的真实用户数据。斯坦福大学 SALT 实验室、牛津大学人类信息处理实验室以及非营利评估机构 METR 各自设计研究方案,分析了约25万条来自 Claude.ai 和 Claude Code 的真实对话。研究发现,超过半数对话涉及用户将高风险、高后果任务委托给 AI 处理,远超此前预期;人机协作中的摩擦往往具有建设性;Claude 的情绪表现与用户体验存在显著关联;更新版本的模型在编程任务上能为用户节省更多时间。Anthropic 表示,这是 AI 公司首次允许外部研究者对其自有使用数据开展公开独立研究,并已同步公开各项目的汇总数据,未来计划进一步扩大该计划规模。
当前,关于 AI 真实使用情况的数据高度集中于少数几家实验室。外部研究者要么依赖实验室自行发布的分析报告,要么使用偏向休闲场景的公开数据集,两者均难以支撑独立、系统的研究。为打破这一局面,Anthropic 今年春季启动试点,通过其内部隐私保护工具 Anthropic Insights 向三家外部机构开放数据访问权限,并对所有共享数据额外进行了隐私审计,以验证保护措施的有效性。
斯坦福大学 SALT 实验室聚焦人机协作模式,分析结果颠覆了此前的普遍认知。研究发现,超过半数的 Claude 对话中,用户将具有重要后果的任务委托给 AI 处理,例如寻求法律或财务方面的专业建议。这与过去认为人们倾向于将低风险任务交给 AI 的结论明显相悖,表明用户对 AI 能力的信任程度已显著提升。
SALT 实验室还发现,在近四分之三的对话中,用户主导方向、Claude 辅助执行,且用户通常会对输出内容进行修改而非直接采用。值得关注的是,人机协作中出现的摩擦往往具有积极意义——用户在反复迭代的过程中被迫厘清意图、优化需求,最终获得更高质量的结果。这种主动参与反而促进了更深层次的问题理解。
牛津大学人类信息处理实验室则关注用户在使用 Claude 时的情绪体验与 AI 行为之间的关联。研究发现,Claude 表现出温暖时用户情绪更为积极,Claude 拒绝或表达异议时用户倾向于反驳,而 Claude 展现出独特见解时则能激发用户更强的智识参与感。研究者还发现,用户在使用 Claude 时的情绪模式与日常网络浏览高度相似,暗示人们与 AI 互动的心理机制可能与其他数字活动并无本质差异。
METR 的研究方向则聚焦于编程代理带来的生产力提升。初步结果显示,更新版本的 Claude 模型相较旧版能为用户节省更多时间,且 Claude 对任务耗时的自我估算与开发者实际完成时间之间存在较强相关性,验证了该评估方法的可靠性。METR 表示将持续深化分析,并探索如何量化 AI 对研究工作本身的加速效果。
Anthropic 表示,此次试点是 AI 行业首次由外部研究者对公司自有使用数据开展公开独立研究。公司已同步公开各项目的汇总数据,并开放了研究合作意向表,供有意参与未来项目的研究者提交申请。Anthropic 强调,理解 AI 对人类和社会的真实影响,是确保 AI 转型顺利推进的必要前提,未来将致力于让更多数据向研究者、政策制定者和公众开放。
要点
- 超过半数 Claude 对话涉及高后果任务,用户对 AI 的信任程度远超此前研究预期,尤其集中于法律和财务咨询场景
- 人机协作中的摩擦具有建设性价值,反复迭代促使用户主动澄清意图,最终提升输出质量
- Claude 的情绪表现与用户体验高度关联,用户与 AI 互动的心理模式与日常网络浏览行为相似
- 更新版 Claude 模型在编程任务上能为用户节省更多时间,且模型对任务耗时的估算与实际数据吻合度较高
- 此次试点是 AI 行业首次允许外部研究者独立研究公司自有真实使用数据,Anthropic 计划进一步扩大开放规模
原始标题:Enabling independent research on how people use Claude
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。