研究 / 官方
大语言模型的拟人行为如何影响用户体验与系统设计
苹果机器学习研究团队发布论文,系统考察大语言模型在真实对话中表现出的拟人行为,涵盖情感表达、关系建立与边界维护等多个维度。研究团队收集了来自GPT-4o、GPT-4.1-mini、Claude Sonnet 4.6和Gemini 2.5 Flash四款模型的21,000段多轮对话,结合LLM自动评估与人工评估方法,分析这些行为的出现频率、用户感知适切性及可控程度。结果显示,拟人行为在各模型中普遍存在,但因模型差异和用户因素(包括对话目标与用户画像)呈现出明显分化。人类评估者认为,模型的自我指涉和关系建立行为不如人类表现得自然,但对模型拒绝请求、维护边界的行为接受度反而高于人类。研究还发现,系统提示词可以有效调控这些行为,但需谨慎评估以防止产生意外副作用。
苹果机器学习研究团队于2026年8月发布了一项针对大语言模型拟人行为的系统性研究。该研究由Sunnie S. Y. Kim、Margit Bowler和Leon A. Gatys共同完成,旨在填补当前领域在方法论和实证数据方面的空白——研究者和从业者此前缺乏足够依据来判断模型在何种情境下、应展现哪类拟人行为。
研究团队构建了一个多维分析框架,从行为普遍性、潜在影响和可控性三个维度展开考察。数据来源涵盖GPT-4o、GPT-4.1-mini、Claude Sonnet 4.6和Gemini 2.5 Flash四款当前广泛使用的模型,共收集21,000段多轮对话。评估方法结合了LLM自动评判(LLM-as-a-judge)与人工评估,以确保结果的可靠性和多角度覆盖。
分析结果表明,拟人行为在所有被测模型中均大量存在,但不同模型之间存在显著差异。用户因素同样对行为分布产生影响:对话目标的不同(如任务导向型与情感支持型)以及用户画像的差异,都会导致模型拟人行为的类型和频率发生变化。这一发现提示,模型行为并非固定不变,而是对上下文高度敏感。
在用户感知层面,研究揭示了一个值得关注的不对称现象:人类评估者对模型的自我指涉表达(如「我认为」「我感到」)和主动建立关系的行为持较低接受度,认为这类行为由人类表现更为自然;但对于模型拒绝不当请求、设定交互边界的行为,评估者的接受度反而高于对人类同类行为的接受度。这表明用户对AI与人类在不同行为维度上存在差异化的期待。
研究还专门考察了系统提示词对拟人行为的调控能力。结果显示,通过精心设计的系统提示词,开发者可以有效引导或抑制特定类型的拟人行为,但这一过程需要严格的评估机制,以防止调控措施在目标行为之外引发意想不到的连锁效应。研究团队据此提出了一套面向负责任LLM设计与评估的实践建议,为产品团队在行为调优方面提供了可操作的参考路径。
要点
- 四款主流大模型在21,000段对话中均大量出现拟人行为,但模型间差异显著,用户对话目标和画像也会影响行为分布
- 用户对模型自我指涉和关系建立行为的接受度低于人类,但对模型维护边界、拒绝请求的行为接受度反而更高
- 系统提示词可有效调控拟人行为,但需配合严格评估以避免对其他行为产生意外影响
- 研究提供了LLM-as-a-judge与人工评估相结合的方法论框架,可供后续相关研究参考复用
- 研究结论对AI产品的行为设计、用户体验优化及负责任AI开发具有直接指导意义
原始标题:Examining Human-Like Behaviors in LLMs: A Multi-Dimensional Analysis of Model Behaviors, User Factors, and System Prompts
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。