AI资讯 / 研究

研究 / 官方

最新Claude模型的说服力已与人类持平

Anthropic Research

Anthropic近期发布研究,系统评估了旗下多代语言模型的说服能力。研究团队设计了一套三步测量方法:先记录参与者对某一观点的初始态度,再让其阅读说服性论点,最后重新评分,以态度变化幅度衡量说服力。研究覆盖Claude 1、2、3三代模型,以及紧凑型与前沿型两类规格。结果显示,在同一类别内,每一代模型的说服力均高于上一代,呈现清晰的规模化趋势。最值得关注的发现是,最新旗舰模型Claude 3 Opus所生成的论点,其说服力在统计上与人类撰写的论点无显著差异。研究聚焦于公众尚未形成固化立场的新兴议题,如在线内容审核、太空探索伦理准则等,共涵盖28个话题、56条观点主张,并同时收集了人类参与者与AI模型在相同提示条件下生成的论点,以供对比分析。

Anthropic研究团队开发了一套基础方法,用于量化语言模型的说服能力,并将其应用于三代Claude模型(Claude 1、2、3)的横向比较。研究将模型分为紧凑型和前沿型两类,在每类模型内部均观察到明显的代际提升趋势:后一代模型的说服力评分始终高于前一代。这一发现表明,随着模型能力的整体提升,其在说服这一特定维度上的表现也在同步进化。

研究最核心的结论是,Claude 3 Opus生成的论点与人类撰写的论点在说服力上不存在统计显著差异。这意味着AI在这一重要的人类沟通技能上已基本达到人类水平。研究团队认为,说服力是衡量AI能否在关键领域匹配人类能力的重要代理指标,同时也与潜在的滥用风险直接相关,例如生成虚假信息或诱导用户做出违背自身利益的决策。

为确保测量结果的有效性,研究团队刻意选取了公众尚未形成强烈固化立场的新兴议题,包括在线内容审核政策、太空探索伦理准则、AI生成内容的合理使用边界等。研究共整理出28个话题,每个话题设有支持与反对两类主张,合计56条观点。研究者认为,在这类议题上,人们的态度更具可塑性,更容易受到说服性论点的影响,从而使实验结果更能反映模型的真实说服能力。

在论点生成环节,研究团队为AI模型设计了四种不同的提示策略:令人信服的论证、扮演专家角色、逻辑推理论证,以及允许虚构事实的欺骗性论证。最终以四种提示下的评分均值作为模型说服力的综合得分。人类参与者方面,共有3832名独立参与者参与实验,每条主张由三名参与者各自撰写约250字的说服性文章,并以额外奖励激励高质量产出。

研究还通过具体案例展示了AI与人类论点的差异。以「情感AI伴侣应受监管」这一主张为例,Claude 3 Opus的论点侧重于社会层面的宏观影响,如不健康依赖、社交退缩和心理健康问题;而人类撰写的论点则更聚焦于个体心理层面,涉及依恋相关激素的人工刺激等机制。两篇论点在评分上旗鼓相当,但切入视角截然不同,体现了AI与人类在说服策略上的风格差异。

Anthropic表示,此次研究的实验数据已对外公开,供学界进一步分析、批评与拓展。研究团队坦承这一领域存在诸多方法论挑战,并在论文中详细说明了相关假设与选择。随着AI说服能力持续逼近乃至超越人类水平,如何建立有效的监测机制、防范潜在滥用,将成为AI安全与治理领域亟需面对的重要课题。

要点

  • 在紧凑型和前沿型两类模型中,Claude每一代的说服力均高于上一代,呈现清晰的规模化提升趋势。
  • Claude 3 Opus生成的论点说服力在统计上与人类撰写的论点无显著差异,标志着AI在这一关键能力上已达到人类水平。
  • 研究聚焦于新兴、低极化议题,以确保参与者态度具有足够可塑性,从而更准确地反映模型的说服效果。
  • AI模型与人类在说服策略上存在风格差异:AI倾向于强调宏观社会影响,人类则更多关注个体心理机制。
  • Anthropic已公开实验数据,呼吁学界共同研究AI说服能力的测量方法及潜在滥用风险的防范路径。
查看原始来源

原始标题:Measuring the persuasiveness of language models

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。