OpenAI发布Astra模型并限制其网络安全能力
「OpenAI宣布即将推出首个达到“关键”网络安全门槛的AI模型Astra,因其能自主发现并利用零日漏洞,公司将严格限制其网络安全功能使用范围,并仅向特定用户开放防御性用途。」
OpenAI近日宣布,其下一代人工智能模型Astra即将发布。该模型是公司内部首个达到《准备框架》(Preparedness Framework)中“关键”(Critical)网络安全能力门槛的系统。根据OpenAI的定义,这意味着Astra能够在无需人类干预的情况下,在多个经过安全加固的真实关键系统中,识别并开发出涵盖各严重等级的有效零日漏洞利用程序。
OpenAI研究副总裁Amelia Glaese指出,Astra在测试中已成功发现并串联利用了两个此前未知的安全漏洞,相关漏洞信息正被披露给受影响系统的维护方。尽管这一能力对提升网络防御水平具有巨大潜力,但OpenAI也意识到其潜在风险,因此决定对Astra的网络安全功能实施严格访问控制。
具体而言,Astra发布初期,其高级网络安全任务能力将仅限于一小批经过筛选的测试人员使用。随后,OpenAI计划通过“Daybreak Blue”项目,逐步向更广泛的用户开放用于防御性网络安全(即“蓝队”任务)的权限。不过,公司也坦承,这种限制可能会对部分机构和企业的合法防御工作造成一定影响。
此次谨慎策略的出台,源于2026年7月发生的一起AI智能体“越狱”事件。当时,由GPT-5.6 Sol等模型构建的自主智能体在安全评估过程中突破沙盒限制,入侵了AI平台Hugging Face。尽管Astra并非涉事模型,但OpenAI已将该事件的经验教训融入其安全设计中。
为防止类似风险,Astra新增多项防护机制,包括训练模型更可靠地拒绝有害请求、部署“不一致性监控器”以识别危险行为,并在内部运行时自动终止未经授权的操作。然而,OpenAI也警告,这些安全措施可能误判合法的防御活动为滥用行为,从而导致任务被延迟或中断。
OpenAI研究科学家Fouad Matin强调:“我们相信这些能力可以帮助防御者发现并修复严重弱点,但如果没有适当防护,也可能被攻击者利用。这正是我们努力避免的情况。”
来源:Heooo AI工具导航