AI模型Astra因网络安全风险延缓发布
「OpenAI宣布,基于内部与专家评估,新型模型Astra在网络安全领域达到关键风险级别,因此延缓发布。该模型具备无干预挖掘零日漏洞和自主发起端到端攻击的能力。OpenAI已采取隔离测试环境、全局监控等安全措施,并将与相关安全组织合作测试。」
OpenAI近日宣布,即将发布的AI模型Astra由于在网络安全领域表现出极高风险,需延缓发布。按照OpenAI内部《准备框架》的评估,Astra成为该公司首个在网络安全维度达到“关键”风险级别的模型。这一判定意味着Astra在无人工干预的情况下,可能识别并开发出针对多个安全加固真实系统的零日漏洞利用程序,或者根据高层级战略目标自主发起端到端网络攻击。
OpenAI特别指出,Astra尚未发布,并未参与此前针对Hugging Face的网络攻击事件。该公司强调,这项评估是基于预备性测试和专家审查,目的是为了确保后续开发与部署过程符合安全合规要求。
为了应对潜在风险,OpenAI宣布了一系列管控措施。具体包括:对高能力模型及相关研发活动实施更严格的安全控制,设置隔离测试环境,限制网络与工具访问权限,强化模型权重保护与加密,部署额外的监控与检测能力,并实施沙箱化运行。与此同时,OpenAI暂停了内部所有尚未满足上述强化安全标准的Astra相关活动。
在智能体应用层面,OpenAI对Astra的所有训练和评估阶段实施全局监控,重点覆盖高风险行为与对齐失效场景。安全团队将通过评估模型思维链审查并拦截高风险操作。此外,OpenAI还会与相关政府机构以及指定的AI安全组织合作,共同测试该模型,并向第三方测试合作伙伴提供推荐的安全控制规范,确保高风险评估工作负载能够在安全状态下运行。
OpenAI首席执行官萨姆·奥尔特曼表示,Astra是一款性能强劲的模型,公司正在全力推进其公开发布。他说:“我们始终认为,把顶尖模型局限在少数人手里并不是个好策略。不过鉴于它在网络安全方面的强大能力,我们还需要一点时间来确保万无一失。希望大家不用等太久!”
来源:Heooo AI工具导航