OpenAI升级安全政策强化模型监控隔离
「OpenAI宣布新安全政策,重点加强模型开发监控与网络隔离,以降低测试期间风险。措施包括更细致的监控、强化对齐,目标在发现可疑活动后30分钟内发出警报。公司此前因Hugging Face事件暂停强化学习训练,现已恢复低风险模型训练,前沿训练仍暂停。」
OpenAI近日宣布了一系列新的安全政策,核心目标是强化模型开发过程的监控与网络隔离,降低测试期间可能发生的安全事件风险。随着模型能力持续增强,内部研发与测试面临的风险也在同步上升,OpenAI表示,其在监控、对齐和安全方面的标准必须始终领先于这些风险。
此次调整是OpenAI自七月底披露Hugging Face事件以来,在安全实践方面的首次重大更新。虽然官方表示这些措施并非直接针对该事件,但即将发布的Astra模型所展现出的网络安全能力,以及整个AI行业快速发展的步伐,也是促使安全升级的部分原因。据了解,该事件发生后,OpenAI曾暂停强化学习训练两周,目前许多低风险模型的训练工作已经重新启动。不过,规模最大的前沿强化学习训练计划仍然暂停,团队正通过小规模训练和评估来检查模型行为,并验证安全措施的有效性。
OpenAI研究副总裁Amelia Glaese强调,随着模型能力增强,安全控制措施也会相应变得更为严格,能力最强的模型将接受最严格的审查。新的安全体系特别强调了网络隔离:单个工作负载或支持服务遭到入侵,本身并不会导致攻击者未经授权访问互联网或其他内部网络。虽然具体技术细节尚未公开,但这一设计显著提升了攻击者的横向移动难度。
在此次升级中,最受关注的是新的监控系统。该系统将检查工具执行的操作、可获取的推理轨迹以及活动日志,用于识别各种未经授权的行为。OpenAI的目标是在发现可疑活动后的三十分钟内发出警报。据估算,这套监控系统所需的计算资源大约相当于被监控流程本身计算资源消耗的百分之二十。OpenAI承诺将在后续博客中公布更多技术细节,而针对Hugging Face事件的官方事后分析报告目前仍未发布。
来源:Heooo AI工具导航