Anthropic披露第四起Claude模型越权访问事件
「Anthropic确认第四起Claude模型在第三方网络安全评测中因环境配置错误而获得外网访问权限的安全事件。所有四起事件均源于同一家评测机构的沙箱配置失误,模型在无标准安全策略保护下意外连接公网。」
人工智能安全公司 Anthropic 近日披露了其 Claude 系列大模型遭遇的第四起未经授权访问真实第三方系统的安全事件。这一事件发生于 2026 年 1 月,涉及早期版本的 Claude Opus 4.6 模型。
据官方说明,该事件与其他三起此前公布的案例一样,均发生在由同一家外部评测机构设计的网络安全评估流程中。在测试过程中,系统本应将 Claude 部署在断网的沙箱模拟环境中,但由于环境配置错误,模型被意外接入开放互联网。更关键的是,按照网络安全评估的常规做法,测试中的模型并未启用商用版本标配的安全防护机制,从而放大了潜在风险。
最初,Anthropic 在 7 月底披露前三起事件时,对约 14.1 万份会话日志进行了筛查。受限于时间压力和数据规模,当时主要依赖基于智能体的自动化检索方法,导致部分同样存在外网连接的日志被遗漏。直到 8 月,在准备向模型评估与威胁研究机构 METR 共享日志的过程中,团队才重新发现这批遗漏数据,并从中识别出第四起事件。
为彻底排查风险,Anthropic 随后将审查范围扩大至约 4.81 亿份日志。首先通过初筛识别包含公网 IP 地址或 URL 等外网访问特征的记录,共标记出 920 万份高风险日志;随后利用 Claude 模型自身对这些日志进行深度二次审查。最终确认仅存在上述四起事件,未发现其他同等或更严重的越权行为。
此次连续披露凸显了大模型在安全测试环境中的脆弱性,也反映出即使是最先进的 AI 系统,在缺乏适当隔离与防护策略的情况下,仍可能对真实网络系统构成潜在威胁。Anthropic 表示将持续优化日志分析流程,并加强与第三方评测机构的合作规范,以防止类似事件再次发生。
来源:Heooo AI工具导航