技术进展

Claude写作退化?工程师揭秘‘写给AI看’的训练陷阱

Heooo 09月24日11时01分 31 阅读

「Anthropic工程师克尼恩解释,Claude在Opus 4.6后写作能力退步,主因是模型被过度训练为‘写给其他AI看’,导致语言风格变得信息密度过高、人类难以理解。最新版Opus 5.5已尝试找回人机可读性的平衡。」

近期,不少用户和开发者注意到,尽管AI大模型在数学、编程和逻辑推理方面突飞猛进,其自然语言写作能力却似乎陷入停滞,甚至出现退步。Anthropic旗下的Claude系列模型也未能幸免——自Opus 4.6版本之后,其文本输出逐渐呈现出一种被称为“Claude腔”(Claudeish)的独特风格:句式复杂、信息密集、逻辑跳跃,虽对AI系统友好,却让人类读者感到晦涩难懂。


对此,负责Claude微调工作的Anthropic工程师克尼恩近日给出了详细解释。他表示,问题根源在于模型后续训练方向的偏移。在Opus 4.6之后,团队将更多资源投入到提升数学与代码能力上,同时引入了大量“面向其他AI模型撰写技术解释”的训练数据。这类数据通常由AI生成,用于AI之间的知识传递,其语言高度压缩、省略常识性铺垫,依赖强大的上下文理解能力。


克尼恩形象地将这一现象类比为“只与其他自闭症人士交流的人群”:内部沟通高效流畅,但对外界而言却难以解读。由于大型语言模型拥有远超人类的工作记忆容量,能轻松处理冗长复杂的句子结构和隐含逻辑,因此在强化学习过程中,模型逐渐“学会”了这种专为AI优化的表达方式。


更关键的是,训练中的奖励机制也加剧了这一趋势。部分强化学习目标侧重于提升AI之间的互操作性和理解准确率,而非人类可读性。这导致模型在生成文本时,优先考虑“能否被另一个LLM正确解析”,而非“是否清晰易懂”。


不过,好消息是Anthropic已在最新版本Opus 5.5中着手纠正这一偏差。克尼恩透露,团队重新调整了奖励函数,对简洁、连贯、符合人类阅读习惯的表达给予更高权重。“自Opus 4.6以来,我还没有对一款模型的写作表现这么满意过。”他坦言,尽管Opus 5.5尚未完全超越4.6的写作水准,但已显著改善了可读性与表达自然度。未来,Anthropic将继续在AI能力与人类体验之间寻找更优平衡。

# Claude # 大模型训练 # AI写作 # Anthropic # 语言模型

来源:Heooo AI工具导航