研究 / 官方
迭代对话让用户能力提升超一倍
Anthropic教育研究团队于2026年2月发布《AI流利度指数》报告,依托与学者合作开发的4D AI流利度框架,对2026年1月间9830段Claude.ai多轮对话进行系统分析,量化用户在人机协作中的11项可观测行为。研究发现,85.7%的对话存在迭代与精炼行为,这类对话平均展现出2.67项流利度行为,约为非迭代对话的两倍。在涉及代码、文档等产出物的对话中,用户更善于明确目标和指定格式,但对AI输出的批判性审查显著减弱——质疑模型推理的概率下降3.1个百分点,识别缺失信息的概率下降5.2个百分点。该报告旨在建立基线数据,为长期追踪AI流利度演变提供参照。
Anthropic近期发布的《AI流利度指数》报告,是其教育系列研究的最新成果。此前该团队已分别研究了大学生和教育工作者使用Claude的方式,发现学生主要用其生成报告和分析实验数据,教育者则借助它制作教学材料和自动化日常事务。此次研究将视角转向更根本的问题:随着AI融入日常生活,用户是否真正在提升与AI协作的能力?
为回答这一问题,研究团队采用由Rick Dakan和Joseph Feller教授与Anthropic联合开发的4D AI流利度框架,将人机协作中的安全有效行为细化为24项具体指标。其中11项可在Claude.ai对话界面中直接观测,另外13项——如如实告知他人AI参与情况、评估AI生成内容的传播后果——发生在界面之外,难以追踪。研究团队使用隐私保护分析工具,在2026年1月的7天窗口内采集了9830段多轮对话作为分析样本。
研究最核心的发现是迭代与精炼行为和其他流利度指标之间的强关联。在样本中,85.7%的对话呈现出迭代特征,即用户在前一轮回复基础上持续深化,而非接受首次回答后立即转向新任务。这类对话平均拥有2.67项流利度行为,远高于非迭代对话的1.33项。尤为突出的是,迭代对话中用户质疑Claude推理的可能性是非迭代对话的5.6倍,识别缺失信息的可能性则高出4倍。
然而,当对话目标转向生成具体产出物时,用户行为模式出现了明显转变。在涉及代码、文档、交互工具等产出物的12.3%对话中,用户在描述需求和指导AI方面表现更为积极——明确目标的概率提升14.7个百分点,指定格式的概率提升14.5个百分点,提供示例的概率提升13.4个百分点。这说明用户在任务启动阶段投入了更多精力进行方向引导。
但这种前期主动性并未延伸至对输出结果的批判性审查。在产出物对话中,用户识别缺失信息的概率下降5.2个百分点,核查事实的概率下降3.7个百分点,要求模型解释推理过程的概率下降3.1个百分点。研究者认为,这可能源于AI生成的产出物外观完整、功能正常,令用户误以为工作已经完成,从而降低了进一步审视的意愿。这一发现与Anthropic此前在编程技能研究中观察到的规律相互印证。
Anthropic表示,本次报告旨在建立AI流利度的基线测量体系,为后续追踪用户能力随模型迭代而演变提供数据基础。研究团队计划在未来引入定性方法,评估那些发生在对话界面之外、目前难以量化的流利度维度,例如用户对AI生成内容的社会责任意识。报告的整体基调与Anthropic经济指数的结论一致:最有效的AI使用方式是将其视为思维伙伴,而非简单的任务外包工具。
要点
- 深度迭代是AI流利度的核心驱动力:进行迭代精炼的对话平均展现出约两倍于非迭代对话的流利度行为,且用户质疑AI推理的概率高出5.6倍。
- 生成产出物时用户批判性思维下降:在涉及代码、文档等输出的对话中,用户识别缺失信息和质疑推理的概率均明显降低,存在过度信任AI输出的风险。
- 最有效的协作模式是增强型而非委托型:研究再次确认,将AI视为思维伙伴而非任务外包对象,能带来更高质量的人机协作。
- 当前研究仅覆盖可观测行为:另外13项关键流利度指标发生在对话界面之外,Anthropic计划通过定性研究方法加以补充评估。
- 本报告为长期追踪提供基线:随着AI模型持续迭代,该指数将用于系统观察用户流利度行为的演变趋势。
原始标题:The AI Fluency Index · Claude Academy
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。