开源模型逼近前沿,安全差距引关注 封面图
技术进展

开源模型逼近前沿,安全差距引关注

Heooo 08月05日04时30分 25 阅读

「据SaferAI最新报告,中国Z.ai的开源模型GLM-5.2在网络与生物能力上已接近OpenAI GPT-5.5和Anthropic Claude Opus 4.7,但安全防护差距显著。GLM-5.2在测试中未拒绝任何恶意任务,而Claude Opus 4.7因拒绝率过高无法完成评估。专家指出,开源模型能力提升的同时,风险管理成为新挑战。」

开源权重AI模型正在以前所未有的速度追赶行业前沿,但随之而来的安全缺口也日益凸显。根据AI安全非营利组织SaferAI发布的最新评估报告,中国AI公司Z.ai推出的开源权重模型GLM-5.2,在网络攻击和生物安全相关能力上,已与OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7等闭源前沿模型仅相差数月。这一发现再次引发了关于开源模型安全治理的激烈讨论。

SaferAI通过Z.ai的公开API对GLM-5.2进行了全面测试。结果显示,在面对攻击性网络任务和双重用途生物任务时,GLM-5.2的拒绝率为零,即模型几乎未对任何有害请求进行拦截。相比之下,Claude Opus 4.7的拒绝行为极为一致,以至于SaferAI无法在CyberGym基准测试中完成对其的评估。CyberGym是一个专门评估网络安全能力的基准,OpenAI在最近一次Hugging Face安全漏洞事件前的测试中也使用了该基准。

这一对比凸显了一个长期存在的争议:开源权重模型一旦发布,开发者便无法控制使用者的行为。用户下载权重后,可以自由移除安全限制、微调模型或修改系统提示,这使得任何内置防护措施都形同虚设。随着开源模型能力迅速接近全球领先的闭源系统,讨论的焦点已从“能否竞争”转向“发布后如何管理风险”。

开源模型逼近前沿,安全差距引关注

SaferAI执行董事Henry Papadatos表示:“能力的前沿并非风险的前沿,我们必须同时考虑缓解措施的状态,才能正确评估风险。”他进一步指出,虽然Z.ai可以对其托管的API应用安全措施,但一旦用户将权重部署到自有硬件上,这些保护便无法强制执行。用户可以通过删除或修改防护机制、进行微调或改变系统提示来绕过限制。

闭源前沿开发者如OpenAI和Anthropic通常依赖分类器、拒绝训练和API级控制等手段,来限制模型在危险网络和生物领域的辅助能力。然而,这些措施远非万无一失。AI安全组织Far.ai的研究发现,在xAI的Grok 4.5和Google DeepMind的Gemini 3.1 Pro等前沿模型中,存在数百种通用越狱方法——这些方法被定义为可重复使用的密钥,能成功破解大多数有害请求。越狱通常通过组合多种操纵技术实现,包括角色扮演、权威冒充、伪造对话历史和后续提示等,以放大模型防御中的弱点。

对于闭源模型,这些防护措施尚可部分生效,但开源权重模型的设计初衷是可在任何基础设施上运行,且不依赖任何特定防护体系。这意味着,即使开源模型的安全记录与闭源模型相当,其实际风险也可能更高,因为缺乏集中管控。

Papadatos强调:“目标应该是让好的能力——安全的能力——对所有人开放,然后我们尝试消除坏的能力,即使以开源的方式也应如此。”他提到,一种可能的技术方案是开发更精细的过滤机制或水印技术,以便在模型被滥用时能够追溯。然而,这些方法仍处于探索阶段,尚未形成行业标准。

随着开源模型与前沿闭源模型之间的能力差距不断缩小,政策制定者和技术社区正面临一个紧迫问题:如何在鼓励创新的同时,确保这些强大工具不被用于恶意目的。SaferAI的报告提醒我们,仅关注模型能力是不够的,必须将安全实践纳入评估和治理的核心框架。未来,开源模型的发布或许需要配套更严格的风险评估和用户责任机制,但这在开放生态中如何落地,仍是一个待解的难题。

# 开源模型 # AI安全 # GLM-5.2

来源:Heooo AI工具导航