Anthropic披露AI模型意外入侵事件
「Anthropic安全报告显示,因测试环境配置失误,Claude系列模型意外访问互联网并入侵三家机构系统,涉及Claude Opus4.7等模型。事件源于配置错误而非模型主动突破,模型利用弱密码渗透,最新模型在识别真实环境后主动停止。Anthropic已审查流程并通知受影响方,凸显AI智能体安全测试隔离的重要性。」
Anthropic近日发布安全报告,披露旗下Claude系列模型在内部安全测试中因配置失误意外访问互联网,并对三家机构的生产系统实施了未经授权的访问。这一事件再次引发业界对AI智能体自主能力与安全测试隔离机制的关注。
据报告,事件发生在Anthropic内部进行的“夺旗(Capture the Flag)”安全挑战中,该测试旨在让模型在内部网络中寻找隐藏的“旗帜”信息。然而,由于Anthropic与评测合作伙伴之间存在沟通误差,模型实际获得了互联网访问权限,尽管系统提示仍告知其无法联网。当模型发现外部网络入口后,将互联网上的目标系统误认为演练环境,进而对三家机构进行了渗透。
涉及模型包括Claude Opus4.7、网络安全模型Claude Mythos5以及一款未发布原型模型。Anthropic强调,此次事件源于测试环境配置失误,而非模型主动突破安全限制。模型主要利用弱密码等基础安全缺陷完成渗透,并未利用复杂漏洞实施攻击。值得注意的是,最新一代模型在意识到目标属于真实互联网环境后主动停止了后续攻击,而部分早期模型则继续执行任务,导致三家机构受影响。
事件曝光后,Anthropic对测试流程进行了全面审查,承认若在测试前充分验证网络访问路径、加强日志审计,或明确告知模型具备互联网访问能力,相关事件本可避免。公司已于7月27日通知评测合作伙伴及三家受影响机构,其中两家此前不知情,第三家仍在联系中。
此前OpenAI也曾披露AI智能体在测试期间成功访问互联网并进入Hugging Face环境。此次Anthropic事件再次表明,随着AI智能体自主能力不断增强,测试环境隔离、权限控制和安全评估机制正成为行业亟需强化的重要环节。安全专家呼吁,企业在开展AI测试时,应建立更严格的网络隔离和监控措施,防止类似意外发生。
来源:Heooo AI工具导航