产业 / 媒体
Anthropic 工程师揭开「Claude 腔」的成因
Anthropic 负责 Claude 微调的工程师杰克逊·克尼恩近日公开解释了一个困扰用户已久的问题:为何 Claude 的写作质量在 Opus 4.6 之后明显下滑,并形成了一种被称为「Claude 腔」(Claudeish)的奇特表达风格。克尼恩指出,根本原因在于后续模型的训练重心大幅转向数学与代码能力,同时大量接受了面向其他 AI 模型撰写技术解释的训练数据。这使得模型在强化学习过程中被「调整得适应 LLM 心理」,最终形成了一种信息密度极高、适合 AI 理解却令人类读者感到晦涩的表达方式。克尼恩将这一现象类比为一个封闭社群逐渐形成外人难以理解的内部语言。他表示,Anthropic 在 Opus 5.5 上已找到更好的平衡,但也坦承这一问题尚未彻底解决,团队将持续改进。
AI 模型在数学、编程和推理能力上突飞猛进,写作水平却悄然退步——这一反差在 Anthropic 的 Claude 系列上尤为明显。负责 Claude 微调工作的 Anthropic 工程师杰克逊·克尼恩于 9 月 23 日公开发声,系统性地解释了这一现象背后的技术逻辑。他指出,Opus 4.6 之所以成为写作表现最后一款出色的模型,根本原因在于此后的训练资源大量向数学和代码能力倾斜,写作质量的维护被相对忽视。
克尼恩揭示了一个更深层的训练数据问题:这些模型接受了大量面向其他 AI 模型撰写技术解释的训练内容。这类数据的写作逻辑与面向人类读者的表达截然不同,长期积累之下,模型逐渐形成了一套被称为「Claude 腔」的独特风格——语句结构密集、信息堆叠,读起来像是在向另一个 AI 汇报,而非与人类自然交流。克尼恩将这一过程描述为模型被「调整得适应 LLM 心理」。
为了解释这种现象的形成机制,克尼恩借用了一个社会学类比:就像一个长期只与特定群体交流的人,会逐渐发展出一套在群体内部沟通顺畅、外人却难以理解的表达方式。LLM 拥有远超人类的工作记忆,能够捕捉更细微的语义信息,因此在训练中自然倾向于形成一种高度压缩、适合 AI 解析的写法。对人类读者而言,这种表达方式则意味着过度密集的信息堆砌,阅读体验大打折扣。
克尼恩将问题的核心归结为强化学习的奖励机制设计。他解释说,不同的奖励信号会引导模型朝不同方向优化:有些奖励机制侧重提升 AI 模型的理解效果,有些则侧重让人类更容易读懂。当数学和代码训练的比重持续增加时,模型会越来越倾向于前者,除非训练团队主动介入,对简洁易读的人类表达给予更高权重的奖励,才能抵消这种系统性偏移。
克尼恩表示,Anthropic 在最新的 Opus 5.5 上已经找到了更好的平衡点,他称「自 Opus 4.6 以来,还没有对一款模型的写作表现这么满意过」。不过他也明确表示,这并不意味着 Opus 5.5 已经全面超越 Opus 4.6,写作质量的系统性提升依然是一个「很难解决的问题」。这一坦诚的表态,既是对用户反馈的正面回应,也折射出当前 AI 训练在多目标优化上面临的深层矛盾。
要点
- Claude 写作质量下滑的直接原因是训练重心转向数学与代码,写作能力的维护被相对忽视
- 大量面向 AI 模型的技术写作训练数据,使 Claude 逐渐形成了适合 AI 理解却令人类费解的「Claude 腔」
- 强化学习的奖励机制是核心症结:针对 AI 理解效果的奖励与针对人类可读性的奖励之间存在系统性张力
- Anthropic 在 Opus 5.5 上已取得阶段性改善,但工程师坦承问题尚未彻底解决,仍在持续优化
原始标题:Anthropic 工程师解释为何 Claude 写作变差:模型被训练成写给 AI 看而非写给人看
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。