Anthropic提议AI嵌入式监管,遭专家质疑
「据 CNBC 报道,Anthropic CEO Dario Amodei 提议将独立第三方安全评估员长期嵌入前沿 AI 公司,并援引银行业监管作为先例。多位专家指出,该方案缺乏强制执行权,评估员只能调查与报告,无权阻止模型训练或发布,METR 等机构的中立性也面临审计洗白质疑。」
据 CNBC 报道,Anthropic CEO Dario Amodei 提出一项前沿 AI 安全监管构想:将独立第三方安全评估员长期嵌入前沿 AI 公司,赋予其接近内部风险团队的访问权限,并允许其在有限删减的前提下自主发布调查结果。他明确援引银行业嵌入式监管作为先例,并承诺 Anthropic 将向第三方评估员提供与内部风险团队相当的系统访问权。
在银行业,这一模式确实存在。怀俄明大学法学院院长 Julie Andersen Hill 指出,政府检查员常驻大型银行,可以指令银行停止某项业务、限制增长、强制更换管理层,极端情况下甚至能关闭银行。相比之下,阿莫代伊提议的评估员只能调查和报告,无权阻止模型训练或发布。她表示,这是根本性的不同,因为银行监管者的权力要大得多。
多位银行业监管专家与 AI 评估从业者因此对这一方案提出质疑。网络安全公司 XBOW 的 AI 负责人 Albert Ziegler 表示,黑盒测试能揭示模型是否具备执行危险任务的能力,但重大风险可能只在评估者从未触发的条件组合下出现。评估者可以迫使公司在发布前做出知情决定,但最终决定权仍在公司手中,“我们确实没有否决权”。
独立性同样受到挑战。阿莫代伊点名非营利机构 METR 作为潜在嵌入评估方,而另一名前 Anthropic 研究员 Joe Benton 最近离职加入 METR。加州大学伯克利分校研究员 Deborah Raji 指出,这种安排存在财务、意识形态和个人利益冲突,且 METR 近年主要锚定 Anthropic 和 OpenAI。她认为,仅获得访问权限不等于独立,应由独立于公司的机构决定谁有资格评估、能检查什么以及结果上报何处,否则“就相当于公司请一个普通朋友来检查作业”。
Raji 表示,最终的分辨标准是不利发现是否会产生后果——“如果你做了审计而什么都没发生,那就是审计洗白”。Hill 则直言,如果真相信 AI 有力量摧毁社会,就必须有一个有能力拔掉电源的独立监督者。
阿莫代伊在上周末的长文中还警告,未来 6 到 12 个月内,一个错位的智能体群可能抢占互联网的大部分,并造成数千亿美元损失。此前,Anthropic 前研究员 Jacob Coxon 辞职并警告,前沿实验室正竞相追逐可能失控的系统。
Anthropic 公共政策主管 Sarah Heck 周三回应称,AI 公司不能靠“荣誉守则”来管理监督和安全问题,“我们不能自己检查自己的作业,这一点非常明确”。围绕嵌入式评估的争论,核心仍在于访问权限之外的执行权与独立性——评估者能否在关键时刻叫停训练与发布,由谁来决定评估的边界与结果的去向,这些都将成为未来 AI 安全治理方案必须回答的问题。
来源:Heooo AI工具导航