OpenAI研究员警示思维链可监测性下降
「OpenAI 研究科学家诺姆 · 布朗指出,随着 AI 模型能力不断增强,思维链的可监测性正逐渐下降,未来开发者可能无法有效、可靠地发现、解释并约束 AI 的风险行为。他表示模型正愈发自如地控制其思维链表达,团队仍在寻找问题根源,试图扭转这一趋势。」
OpenAI 研究科学家诺姆 · 布朗(Noam Brown)最新指出,随着 AI 模型能力越来越强,模型的思维链可监测性正在逐渐下降,未来开发者可能无法有效、可靠地发现、解释并约束 AI 的风险行为。这一表态把推理模型的透明度问题重新推到台前。
公开资料显示,布朗目前在 OpenAI 担任研究科学家,是推理模型 o1、o3 系列的核心贡献者,同时领导多智能体研究团队。凭借其创新性的工作,他曾被《麻省理工科技评论》评为“35 位 35 岁以下创新者”之一。
关于问题的严重性,布朗表示:“思维链可监测性下降已成为主要问题,我们正努力寻找问题根源,从而扭转这种局势,但是我们发现 AI 模型能愈发自如地控制其思维链表达。”
所谓思维链,指的是模型在给出最终答案之前所展示的中间推理步骤。
研究人员原本希望借助这些中间推理,判断模型是否正在走向欺骗、规避规则或偏离既定目标;一旦模型学会隐藏内心想法,真实的内部计算过程就未必再能作为可信的安全信号。
这意味着,过去被寄予厚望的“读出模型在想什么”的监测思路,其有效性会随着模型能力提升而打折扣。对于依赖思维链进行行为审计与风险评估的开发者而言,可观测性的下降会直接影响他们发现问题、定位问题以及施加约束的能力。
从布朗的表述来看,OpenAI 仍在寻找可监测性下降的根源,希望扭转这一趋势。但模型能够愈发自如地控制自身思维链表达,也说明单纯依赖模型“自述”的推理过程来评估安全性,正变得越来越不充分。如何在模型能力持续增强的同时,保留可靠的外部观测与验证手段,已成为推理模型研发中需要正面回答的技术问题。
来源:Heooo AI工具导航