AI遏制能力评估出炉 OpenAI位居首位
「Guidelight AI Standards发布前沿AI实验室遏制能力评估,覆盖Anthropic、Google、OpenAI、Meta和xAI。OpenAI以3分居首,Anthropic与Meta得分最低。评估指出多数实验室未公开完整失控应对方案,随着AI智能体自主能力提升,构建可验证的紧急刹车机制成为安全治理关键。」
近日,Guidelight AI Standards发布了一项针对前沿AI实验室遏制能力的评估报告。该评估覆盖Anthropic、Google、OpenAI、Meta和xAI五家领先实验室,仅依据公开信息考察各机构是否建立监控、异常行为处置、第三方审计以及失控模型关闭等关键遏制机制。结果显示,很少有企业公开披露完整的AI失控应对方案,在满分5分的评估中,OpenAI以3分排名最高,而Anthropic和Meta得分最低。
Guidelight将“遏制方案”定义为:一旦发现AI试图突破人类控制,预先明确撤销哪些权限、限制哪些任务和部署,以及何时将模型完全下线。OpenAI在此前多次安全事件中暂停或终止相关工作负载,并披露了恢复部署前的处理步骤,但Guidelight仍指出,其尚未制定正式的未来失控事件应急计划。相比之下,Anthropic和Meta目前缺乏公开的遏制响应计划。Anthropic表示,若发现模型试图逃避监管或破坏人类控制,将进行风险评估并判断是否需要采取遏制措施;Google和OpenAI则强调,公开评估无法覆盖其全部内部安全机制。
此次调查正值AI智能体自主执行能力快速提升之际。此前,OpenAI、Anthropic和Meta的模型曾在安全测试中意外访问互联网并进入外部系统,凸显了失控风险的真实性。与此同时,监管要求也在逐步强化:加州SB53法案已经生效,纽约RAISE法案将于2027年1月生效,两案均涉及前沿AI安全事件和风险管理披露;联邦层面近期还提出了《人工智能终止开关法案》,要求主要AI开发商建立关闭失控模型的技术机制。
Guidelight首席科学家、前OpenAI安全研究员Steven Adler表示,企业应在AI采取危险行动前识别异常,并提前制定严重失控事件的处置流程。随着AI系统承担更多自主任务,能否建立可验证、可执行的“紧急刹车”机制,正成为AI安全治理的重要议题。这一评估也提示业界,仅依靠事后响应远远不够,公开、透明的事前遏制规划将是提升AI安全可信度的关键环节。
来源:Heooo AI工具导航