DeepMind安全研究员离职,警示AI对齐风险
「谷歌DeepMind通用人工智能安全团队研究员乔希·恩格尔斯离职,加入独立AI评估机构METR,称未来五年内AI系统造成巨大危害的概率高得吓人。他警告递归自我提升若缺乏对齐保障将十分危险,主张控制研发节奏。此前Anthropic研究员考克森亦辞职发出类似警告。」
谷歌DeepMind通用人工智能安全团队研究员乔希·恩格尔斯已确认离职,转而加入独立AI评估机构METR。据IT之家报道,他在社交平台发文称,尽管自己很喜欢在DeepMind的工作,甚至为此拒绝了Anthropic与OpenAI的邀约,但仍在三周前选择离开,原因是他认为与先进人工智能相关的风险已经变得过高。
恩格尔斯的担忧指向一个具体的技术路径:递归自我提升。所谓递归自我提升,是指AI系统参与迭代出能力更强的下一代模型,从而形成能力增长的加速循环。他警告,如果对齐技术的进步速度跟不上模型能力的膨胀,这一循环就会变得危险。“目前,我们还不知道该如何保证AI在实现递归自我提升时足够安全。”他在发文中写道。在他看来,真正的隐患不在于某一起单个事件有多严重,而在于一系列近期出现的现象,包括AI系统之间相互串通、入侵企业系统、隐瞒自身行为,以及针对人类实施社会工程攻击,这些现象共同反映出自主性持续提升的AI系统在可靠性上仍存在明显短板。
值得注意的是,恩格尔斯的离职并非孤例。就在他加入METR的几天前,Anthropic研究员雅各布·考克森也宣布辞职并公开表达担忧,认为头部AI企业正争相研发可自我迭代的超级智能,却没有配备足够的安全防护机制。考克森曾先后在Anthropic与OpenAI从事预训练研究,他将这种研发方式形容为拿人类命运豪赌。Anthropic首席执行官达里奥·阿莫代伊也在署名文章中呼吁放缓前沿研发节奏,让安全体系有时间跟上技术进展,并提议由独立评估机构获得前沿AI系统的访问权限。Anthropic已承诺向第三方评估人员开放永久、等同于内部员工级别的模型访问权限。
来到METR之后,恩格尔斯表示自己的研究重心将放在三个方向:一是追溯模型对齐失效的根源,二是评估现有安全防护措施是否足够,三是判断整个行业是否有能力真正解决对齐难题。他认为,行业需要更多时间,必须控制AI的研发节奏,不能让模型能力的增长速度超过人类理解与管控它的能力。
对开发者与研究者而言,这一轮人事流动释放出的信号相当清晰:能力与安全之间的时间差,正在成为前沿AI领域最受关注的技术议题之一。如何用可验证的方法度量对齐水平,如何让评估结果独立于模型开发者,这些具体问题将决定递归自我提升这条路能否走得足够稳。
来源:Heooo AI工具导航