行业资讯

Anthropic安全分类器失效近一年

Heooo 08月16日21时02分 27 阅读

「Anthropic安全报告披露,用于拦截化学、生物武器相关危险请求的部分分类器在近一年内失效,涉及约1.33亿次承包商对话。公司表示未发现实际滥用证据,已加强外部承包商管理,并持续调整高风险防护标准。」

Anthropic于近日发布最新安全报告,自曝其安全防护体系中存在一项重大隐患:用于拦截化学、生物武器相关危险请求的部分安全分类器曾长期失效。该问题持续近一年,期间外部承包商产生的大量模型对话未经过滤,涉及约1.33亿次交互。

根据Anthropic公开的安全机制说明,其实时提示词和输出分类器会分析用户输入以及模型生成内容,并在识别到相关风险时阻止模型提供可能用于实施危险行为的信息。这一机制属于Anthropic针对化学、生物、放射性及核武器(CBRN)风险所设置的多层安全措施之一。然而,此次暴露的问题恰恰出现在这一关键环节上。

报告显示,约5万名承包商在2025年5月至2026年4月期间,与模型产生了约1.33亿次对话,而这些流量在近一年时间里没有经过相关生物安全分类器的拦截。Anthropic称,这些承包商主要由外部供应商负责审核,其筛查流程存在不足。公司随后展开内部调查,并表示没有发现这些请求被用于实际滥用的证据。

Anthropic此前已将生物安全防护纳入其AI安全体系。2025年5月,公司在Claude Opus 4发布时启用了AI安全等级3(ASL-3)防护措施,其中包括针对化学、生物、放射性及核武器开发或获取风险的部署限制。按照Anthropic现行的负责任扩展政策,实时提示词和输出分类器会持续监测模型输入与输出,并根据不断发现的有害模式、越狱方法和混淆技术进行更新。公司还将红队测试、漏洞赏金计划以及离线监测等机制作为补充安全措施。

2026年7月,Anthropic在公布Claude Fable 5相关安全措施时再次强调了生物和化学领域的风险。公司表示,Fable 5的底层能力达到一定水平后,可能为恶意行为者提供额外帮助,因此需要使用分类器限制相关请求。同时,Anthropic也承认,过于严格的安全分类器可能误伤正常科研活动。对于Fable 5,目前涉及生物和化学领域的大量请求会被转交给Claude Opus 4.8处理,公司计划随着安全机制改进逐步缩小限制范围。

目前,Anthropic表示已经根据调查结果加强外部承包商的筛查和管理要求。公司公开的负责任扩展政策也显示,其正在持续调整针对化学、生物武器等高风险领域的安全防护标准。此次事件暴露出供应链环节中安全审查的漏洞,也为整个AI安全体系敲响了警钟。

# Anthropic # AI安全 # 分类器

来源:Heooo AI工具导航