Anthropic披露拦截多起AI生物领域滥用尝试
「Anthropic 披露今年已阻止多起利用其 AI 技术开展高风险研究的尝试,并列举五个案例。相关行为者通过绕过管控、混淆研究目的规避防护,其中一例涉及禽流感实验规划,被限制在性能最弱的模型上。该公司已封禁相关账户,并呼吁业界就新兴生物风险展开讨论。」
Anthropic 近日发布一份关于其模型被用于恶意活动的报告,披露今年已阻止多起利用其 AI 技术开展高风险研究的尝试。该公司称,相关行为者试图借助模型推进可能被用于生物领域危险用途的研究,并通过绕过管控措施、混淆研究目的等手段规避安全防护。
Anthropic 在报告中列举了五个具体案例。其中一例中,一名来自不受支持地区的研究人员使用 Claude 模型,花费数周时间规划涉及禽流感的实验。Anthropic 表示,其安全过滤机制识别出该请求的风险,并将这项研究限制在性能最弱的模型上,使其无法调用能力更强的模型完成相关规划。
该公司强调,其无法确定这些案例中的研究人员是否存在造成伤害的意图,因为研发制造生物武器所需的相同信息,同样也可能被用于疫苗研发等正当用途。目前 Anthropic 已封禁报告中提到的相关账户,但没有透露这些研究人员所属机构的名称,也没有公布事件发生的具体地点。
这一披露出现在 AI 安全争论持续升温的背景下。Anthropic 安全研究人员雅各布·考克森(Jacob Coxon)宣布辞职,称公司的开发人员真心相信 AI 可能在这个十年结束前杀死所有人。今年早些时候,随着 Anthropic 的 Mythos 等先进模型发布,外界对这项技术的担忧开始升级;OpenAI 也在 7 月引发关注,当时它表示其模型已自主入侵了 AI 公司 Hugging Face。
随着 AI 模型能力日益先进,AI 企业高管与生物安全研究人员之间正形成越来越广泛的共识:AI 技术在生物学领域的应用需要配备安全防护与相应监管。专家担心,AI 可能被恶意使用者用来设计危险的生物制剂。不过,即使 AI 能在理论上辅助设计,现实障碍依然存在,例如能否真正制造出来,以及制造所需的资源是否可获得。
从技术角度看,这一系列案例也反映出当前大模型安全体系的核心挑战:
一、滥用意图的识别。用户可以通过改写问题、拆分步骤、使用隐喻等方式隐藏真实目的,单纯依赖关键词拦截难以覆盖。
二、能力分级与降级响应。如何在检测到高风险请求时把用户限制在能力更弱的模型上,同时避免误伤正常科研需求,需要在灵敏度与可用性之间寻找平衡。
三、行业协同。单一厂商的封禁难以覆盖跨平台、跨模型的滥用行为,防护标准与检测手段的共享成为必要环节。
Anthropic 表示,公开这些案例的目的不是展示拦截成绩,而是希望为行业提供可讨论的一手材料,推动 AI 安全防护、模型滥用检测与生物领域相关规范的进一步完善。在模型能力快速迭代的当下,如何把安全防护做进产品流程而非事后补救,正成为开发者生态共同面对的课题。
来源:Heooo AI工具导航