Anthropic工程师揭示Claude写作退步原因
「Anthropic工程师克尼恩解释Claude写作能力下滑原因:后续模型优化重心转向数学与代码,并接受大量面向AI模型的技术解释训练,学会写给AI看而非写给人看,形成所谓Claude腔。他认为根源在强化学习奖励机制,并称Opus 5.5已找到更好平衡。」
AI模型在数学、编程与推理能力上进步神速,写作水平却似乎停滞甚至退步,Anthropic的Claude也未能幸免。为什么Opus 4.6会成为Anthropic最后一款写作表现出色的模型?负责Claude微调的Anthropic工程师杰克逊·克尼恩对此给出了解释:后续模型的优化重点更多放在了数学和代码能力上。
克尼恩指出,这些模型还接受了大量面向其他AI模型撰写技术解释的训练,而这正是Claude逐渐形成奇特表达方式,也就是所谓“Claude腔”(Claudeish)的主要原因。他表示,模型被“调整得适应LLM心理”,最终学会了写给AI模型看,而不是写给人看。
他把这种现象类比为只与其他自闭症人士交流的人。此类群体会逐渐形成一套在群体内部沟通顺畅、外人却难以理解的表达方式。LLM拥有远超人类的工作记忆,也能捕捉更细微的信息,因此在训练中会逐渐形成一种非常适合AI模型理解的写法,但在人类读者眼中,这种表达就成了过度密集的信息堆砌。
克尼恩认为,问题的根源在于强化学习的奖励机制。有些奖励机制着重提升AI模型的理解效果,有些则着重让人类更容易理解。数学和代码方面的训练越多,就越需要主动抵消这种倾向,对简洁、容易让人读懂的解释给予更多奖励。
他透露,Anthropic在Opus 5.5上找到了更好的平衡,“自Opus 4.6以来,我还没有对一款模型的写作表现这么满意过。”当然,这并不代表Opus 5.5已经超越Opus 4.6。克尼恩坦言:“这是一个很难解决的问题,我们会继续改进。”
这一解释也揭示了一个更普遍的技术命题:当模型被大量用于服务其他AI系统时,其输出风格会不可避免地向机器偏好漂移。对开发者而言,如何在同一套训练流程中兼顾机器可读性与人类可读性,并通过奖励机制精细调节,将成为模型写作能力能否回升的关键。
来源:Heooo AI工具导航