模型 / 官方
Anthropic启动500万美元资助计划,推动AI用户福祉独立评估研究
Anthropic于2026年8月宣布启动一项总额500万美元的资助计划,专门资助针对AI对用户福祉影响的独立研究。该计划将向入选者提供直接资金、旗下模型访问权限及技术支持,所有研究成果须以开源形式发布,供任何开发者使用。随着AI系统日益成为人们工作、学习乃至情感支持的重要来源,如何评估模型在敏感对话中的行为表现变得愈发关键。然而,福祉评估本身极为复杂——用户的心理状态往往需要在多轮对话中才能显现,同一回应在不同情境下可能产生截然不同的效果。Anthropic希望通过引入临床医生、心理学家和方法论专家等多领域人才,共同推动这一新兴领域的标准化建设。申请截止日期为2026年9月21日。
Anthropic宣布设立一项500万美元的资助计划,旨在资助独立研究者开发评估AI对用户福祉影响的工具与基准。入选者将获得资金支持、Anthropic模型的访问权限以及技术协助,并须将研究成果以开源项目形式公开发布,确保整个AI行业均可从中受益。Anthropic强调,受资助者将完全独立开展研究,不受公司干预。
AI系统已深度融入人们的日常生活,不仅用于工作与学习,也逐渐成为情感陪伴和心理支持的来源。然而,行业内目前仍缺乏清晰的标准来规范模型在此类敏感对话中的行为——例如,当用户开始将AI视为情感寄托,或在心理危机时刻向AI求助,模型应如何回应,目前尚无统一规范。
福祉评估的难点在于其高度依赖上下文。与判断一个答案是否准确不同,评估用户福祉需要综合考量对话的完整过程。以自我伤害风险为例,用户可能不会在对话初期直接表露,风险信号往往随着对话深入才逐渐浮现。此外,同一回应在不同情境下可能产生截然不同的效果:对普通用户给出的饮食建议,对有饮食失调史的用户而言可能造成伤害。
Anthropic的安全团队为本次资助计划提供了评估设计指引,明确了高质量福祉评估应具备的核心要素:清晰界定评估指标与通过标准、引入临床及领域专家参与设计与验证、同时测试过度顺从与过度拒绝两类风险、构建能反映真实用户行为的多轮对话场景,以及通过真实专家对评分机制进行验证。
Anthropic表示,公司已持续投入资源开发相关保障机制,并公开发布用户与Claude对话模式的研究报告,以指导安全策略的迭代优化。但公司同时承认,这些问题涉及复杂的伦理与临床判断,随着模型能力和使用场景的演变,相应的评估标准也需要持续更新。此次资助计划正是希望汇聚更广泛的专业力量,共同应对这一挑战。
本次资助计划的申请截止日期为2026年9月21日,入围者将于10月5日前收到提交完整提案的通知。Anthropic鼓励临床医生、心理学家、评估方法论专家及相关领域研究者积极申请,共同推动AI用户福祉评估领域的标准化与科学化进程。
要点
- Anthropic设立500万美元资助计划,专项支持AI用户福祉影响的独立评估研究,所有成果须开源发布。
- 福祉评估的核心难点在于其强依赖对话上下文,单一回应的好坏往往需要结合用户历史与对话全程才能判断。
- Anthropic安全团队发布评估设计指引,要求同时测试模型过度顺从与过度拒绝两类风险,并引入领域专家验证。
- 计划面向临床医生、心理学家和方法论专家等多学科人才开放,申请截止日期为2026年9月21日。
- 此举反映出AI行业在情感支持与心理健康场景下的行为规范仍处于早期探索阶段,标准化建设亟待推进。
原始标题:Funding better evaluations of AI’s impact on wellbeing
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。