开源项目

蚂蚁开源SingProbe内生式安全护栏

Heooo 09月15日10时34分 49 阅读

「蚂蚁集团 AI 安全实验室正式开源大模型内生式安全护栏技术 SingProbe。该方案复用基座模型推理隐藏状态,以不足 0.5% 的额外计算开销实现 token 级实时风险评估,可同步完成意图分类、安全检测与幻觉识别,并在内容输出前毫秒级阻断。目前适配 29 个主流大模型,代码与预训练模型已同步开放。」

蚂蚁集团 AI 安全实验室近日正式开源大模型内生式安全护栏技术 SingProbe。与此前业界普遍采用的外挂式安全审核思路不同,SingProbe 走的是一条内生式路线,其开源代码与预训练模型已同步发布,开发者可以直接获取并接入自有模型。

所谓内生式,核心在于复用基座模型推理过程中已经产生的隐藏状态。传统方案往往需要在模型之外再挂载一套审核模型或规则引擎,每一次生成都要额外走一遍判断流程,算力与延迟成本随之上升。SingProbe 直接读取基座推理链路里的中间表征,让安全判断与内容生成在同一次前向计算中完成,因而把额外计算开销压到了不足 0.5% 的水平。

在这套机制之上,SingProbe 实现了 token 级实时风险评估。所谓 token 级,意味着判断粒度不是等到整段回答生成完毕再做事后审查,而是随着每一个 token 的产生同步给出风险打分,因而可以在内容真正输出给用户之前就完成干预。官方信息显示,该技术能够同步承担意图分类、安全检测和幻觉识别三项任务,并在输出环节实现毫秒级阻断。

毫秒级的前置阻断能力,让它在高风险场景中的价值尤为突出。素材特别提到医疗等场景,这类应用对错误信息和不当输出的容忍度极低,一旦生成内容已经抵达用户,补救成本会非常高。能够在输出之前就把风险拦下来,而不是在事后追加过滤,是内生式护栏最直接的工程优势。

适配范围方面,SingProbe 目前已覆盖 29 个主流大模型,这意味着它并非只服务于单一模型体系,而是具备跨模型迁移的通用性。对于需要同时维护多个基座模型的团队来说,这一特性可以显著降低安全能力的重复建设成本。

值得注意的是,SingProbe 被描述为首个由大型科技企业开源的完整内生式安全技术解决方案。此前行业内关于大模型安全护栏的讨论不少,但多以论文、评测或闭源服务的形式出现,完整开源代码加预训练权重的组合并不常见。对开发者生态而言,这提供了一条可直接复现、可二次开发的技术基线,也让内生式安全从概念验证走向可落地的工程组件。

从技术趋势看,把安全能力做进模型内部而非贴在外面,正在成为一条被认真对待的路径。外挂式方案的问题在于它天然与生成过程脱节,判断总是慢半拍;而当安全判断复用模型自身的隐藏状态时,成本与延迟都变得可以接受,防护密度也就能够提升到每一个 token。SingProbe 的开源,为这条路线补上了一块关键的公开实践样本。

# AI安全 # 开源 # 大模型 # 风险拦截

来源:Heooo AI工具导航