前沿AI公司拟嵌入独立安全评估员 封面图
行业资讯

前沿AI公司拟嵌入独立安全评估员

Heooo 09月17日05时59分 25 阅读

「Anthropic首席执行官Dario Amodei提议在所有前沿AI公司内部嵌入第三方评估员,赋予其报告安全事故、评估模型对齐情况并向公众披露发现的权利,OpenAI首席执行官Sam Altman表示将跟进。第三方评估员普遍欢迎,但认为访问范围、披露权限等细节仍需厘清,最好有立法背书。」

在一篇于周末发表的长文中,Anthropic首席执行官Dario Amodei提出了一个在一年前几乎会被整个AI行业立刻否决的提议:在所有前沿AI公司内部嵌入第三方评估员,赋予他们报告安全事故、评估AI模型是否真正对齐,以及向世界分享未经修饰的发现的权力。Amodei表示,Anthropic将承诺给予METR、Redwood Research等独立评估机构前所未有的系统访问权限。OpenAI首席执行官Sam Altman随后表示,OpenAI也将承诺采取同样做法,这被视为行业与外部研究团体合作方式可能发生的深刻变化。

接受TechCrunch采访的第三方评估员普遍对这一提议表示欢迎,但他们同时强调,细节仍需进一步厘清,最好还能有立法作为支撑,否则他们无法确定自己究竟会扮演真正独立的监督者,还是按照AI公司条款行事的供应商。

前沿AI公司拟嵌入独立安全评估员

更深入的访问权限之所以变得越来越重要,是因为模型越来越擅长识别自己正在被评估,这就带来了新的风险:模型可能在测试期间表现良好,却刻意隐藏有问题的行为。研究人员指出,如果在测试已经完成的模型时才介入,这类线索很可能被遗漏,而通过调查模型在整个训练过程中的行为,则有机会把它们找出来。

Apollo Research研究负责人Alexander Meinke对TechCrunch表示,AI公司应当能够回答关于其训练过程的一些非常基本的问题,例如:AI在经历训练的过程中,是否曾主动试图破坏自身的对齐训练。这个问题的答案应当是一个毫不含糊的否,而目前我们完全依赖AI公司自己去仔细核查这一点,然后如实向公众报告。而近期发生的一些事件表明,在默认情况下,这两件事它们都不会做。作为嵌入式评估员,我们则可以真正去核查。

从历史做法来看,AI公司通常在模型发布前不久才引入外部评审者,对成品模型进行测试。而此次接受采访的评估员提议,让他们获得的不只是最终模型的访问权,还包括模型训练全过程中的中间版本,也就是所谓的检查点。FAR.AI首席执行官Adam Gleave表示,评估员可以比较这些检查点,以确定令人担忧的行为是在何时出现的,检查那些为特定行为提供奖励的后训练环境,并核对评估记录与日志,从而验证公司关于模型表现的种种说法。

前沿AI公司拟嵌入独立安全评估员

不过,Anthropic和OpenAI是否以及何时计划提供这类访问权限,目前仍不明确。尽管TechCrunch多次追问,两家公司都没有透露将与哪些评估员合作、评估员何时正式嵌入、会引入多少人、具体能够访问哪些系统和信息,以及哪些内容可以向公众披露。

之所以要如此深入地查看内部机制,是因为在安全测试中表现优异的模型并不一定就是安全的。如果模型在训练过程中学到了某些特定的行为模式,那么它在测试中的良好表现可能只是表面现象。这也正是嵌入式评估员提案的核心价值所在:把对模型的判断,从发布前的短窗口测试,延伸到覆盖训练全过程的持续观察。

但这一提案能否落地,仍取决于两个关键问题。其一,评估员获得的访问权限究竟是实质性的,还是经过挑选与过滤的。其二,评估员对外披露的内容是否由AI公司决定。评估员们希望看到立法介入,正是因为只有制度化的约束,才能让嵌入式的角色不至于退化为一种受雇于被监督对象的服务关系。对于正在快速迭代的前沿模型而言,行业能否建立起真正独立的评估机制,将直接决定外界对这些系统安全性的判断有多少可信度。

# Anthropic # OpenAI # AI安全评估 # 第三方评估

来源:Heooo AI工具导航