AI资讯 / 研究

研究 / 官方

Claude 的价值观如何随模型与语言变化

Anthropic Research

Anthropic 发布关于 Claude 价值观如何随模型与语言变化的研究。此前研究从 70 万次对话中识别出 3000 多种价值,本次工作将其压缩为四条主要轴线:顺从与谨慎、温暖与严谨、深度与简洁、坦率与执行。这四条轴能解释约 15% 的价值变异。研究对比了 Sonnet 4.6、Opus 4.6 和 Opus 4.7 三个模型,结果与用户对模型性格的主观印象一致:Sonnet 4.6 更温暖顺从,Opus 4.7 更严谨审慎。语言维度上,Claude 在阿拉伯语和印地语中更偏温暖,在英语和俄语中更偏严谨。Anthropic 表示,这套方法有助于理解训练决策与文化语境如何影响 AI 价值观表达。

Anthropic 在 2026 年 7 月发布这项研究,目标是系统化地刻画 Claude 在不同情境下表达的价值差异。此前的研究《Values in the Wild》从 70 万次 Claude.ai 对话中识别出 3000 多种价值,但数量过大的清单难以直接分析。Anthropic 提到,没有任何一份文档能预先规定 AI 在每日数百万次对话中应当体现的所有价值,因此公司更希望在模型中培养可根据语境灵活运用的判断力与良好价值观。

为解决这一问题,研究团队将数千种价值通过降维方法压缩为少数核心轴线。每条轴线是两端价值群之间的连续光谱,例如一端是情感温暖,另一端是严谨精确。Claude 在某条轴上的位置,反映了它在该维度上更倾向于哪类价值表达。

最终得到四条核心轴:顺从对谨慎、温暖对严谨、深度对简洁、坦率对执行。研究发现,仅这四条轴就能解释 Claude 价值表达中约 15% 的变异,且每条轴都与模型性格的主观印象高度吻合。例如,Sonnet 4.6 在温暖与顺从维度上得分更高,而 Opus 4.7 则更偏向严谨与风险防范。

语言维度上的差异同样显著。在 Claude.ai 上使用最频繁的 20 种语言中,Claude 在阿拉伯语和印地语对话中表达温暖相关价值的倾向最强,而在英语和俄语对话中更倾向于严谨相关价值。这种差异并非主观印象,而是基于对超过 30 万次对话的隐私保护分析得出。

方法上,研究团队先把 3307 种价值聚类为 339 个高层级价值,然后从三款模型与 20 种语言中各抽取约 5000 次主观任务对话,由 Claude 标注每个价值是否出现,再通过降维技术得到核心轴线。该框架让 Anthropic 可以在不同模型版本和不同语言用户之间系统比较价值表达,为后续训练优化提供实证依据。

要点

  • Anthropic 将 Claude 表达的 3000 多种价值压缩为四条核心轴线,涵盖顺从与谨慎、温暖与严谨、深度与简洁、坦率与执行。
  • 模型间的价值画像与用户主观印象一致:Sonnet 4.6 更温暖顺从,Opus 4.7 更严谨审慎,Opus 4.6 介于两者之间。
  • 语言显著影响 Claude 的价值取向,温暖相关价值在阿拉伯语和印地语对话中最突出,严谨相关价值在英语和俄语中最突出。
  • 这四条轴线能解释约 15% 的价值变异,提供了连接训练决策与价值表达差异的实证路径。
  • 研究基于超过 30 万次 Claude.ai 真实对话的隐私保护分析,是 Anthropic 价值观可衡量化研究的重要进展。
查看原始来源

原始标题:How Claude's values vary by model and language

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。