AI资讯 / 产业

产业 / 媒体

Claude越来越聪明,写作却越来越差

The Decoder

Anthropic负责Claude微调工作的工程师Jackson Kernion近日公开解释了一个令用户困惑已久的现象:为何新版Claude在数学和代码能力上突飞猛进,写作质量却反而下滑。他指出,问题的根源在于训练目标的偏移——新模型不仅针对数学和代码进行了大量优化,还被训练成为其他AI模型生成技术解释,由此形成了一种被称为「Claudeish」的奇特文风。这种风格对AI模型而言信息密度恰到好处,但人类读者却感受到「过度堆砌的信息倾泻」。Kernion表示,Opus 4.6是Anthropic最后一个真正意义上的「写作模型」,而最新的Opus 5.5在写作与技术能力之间找到了更好的平衡,但仍未能超越Opus 4.6的写作水准。

Anthropic工程师Jackson Kernion近日在社交媒体上罕见地公开剖析了Claude写作风格退化的内在机制。他将Opus 4.6定性为Anthropic迄今最后一个纯粹意义上的「写作模型」,并坦承此后的版本在自然语言表达上出现了明显的风格异化。这一坦诚的自我批评在AI社区引发广泛关注,也让外界得以窥见大模型训练过程中鲜少被讨论的权衡取舍。

问题的核心在于训练数据与奖励机制的双重偏移。Kernion解释称,新版Claude不仅被大量喂养数学和代码任务,还被专门训练为其他AI模型生成技术性解释。这意味着模型逐渐「适应了LLM的心理」,学会了用AI模型能高效处理的方式组织语言,而非以人类读者习惯的叙事逻辑来表达。久而久之,一种对AI友好却对人类陌生的写作风格便悄然固化下来。

Kernion用一个颇具争议的类比来描述这一现象:就像长期只与同类交流的群体会发展出一套外人难以理解的内部语言,Claude也在训练中形成了一套「AI内部语言」。LLM拥有远超人类的工作记忆,能在极细粒度上捕捉信息,因此在训练过程中自然涌现出一种信息密度极高的表达风格——对AI而言高效,对人类而言却是令人窒息的「信息倾泻」。

从强化学习的奖励结构来看,这一问题有其内在逻辑。部分奖励信号针对AI模型的理解能力进行优化,另一部分则针对人类理解能力。当数学和代码训练的比重不断加大时,若不主动引入奖励人类可读性的机制加以对冲,模型的写作风格便会持续向AI友好的方向漂移。这是一场需要精心校准的拉锯战。

Kernion透露,Opus 5.5在这一平衡上取得了显著进步,他表示自Opus 4.6之后,这是他对一款模型写作能力最为满意的一次。然而他也明确指出,Opus 5.5并未在写作层面超越Opus 4.6,只是在技术能力大幅提升的同时,将写作质量的损耗控制在了更可接受的范围内。「这是一个难以彻底解决的问题,我们会持续改进,」Kernion写道。

要点

  • Claude新版本写作风格退化的根本原因,是模型被训练为服务于其他AI模型的技术解释需求,而非人类读者的阅读习惯
  • 强化学习的奖励机制存在内在张力:优化数学和代码能力会自动压缩对人类可读写作风格的奖励空间,需要主动干预才能维持平衡
  • Opus 4.6目前仍是Anthropic写作能力最强的模型,Opus 5.5虽有改善但尚未超越,说明技术能力与写作质量之间的权衡在现阶段仍难以完全消除
  • 这一现象揭示了大模型训练中一个普遍性挑战:随着模型能力边界不断扩展,维持特定维度的质量需要付出额外的、有针对性的努力
查看原始来源

原始标题:Anthropic engineer explains why Claude's writing got worse although the model got smarter

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。