CALM:无需训练的文生图安全防护新范式
「arXiv一篇论文对文生图领域流行的全局不安全假设展开几何分析,发现紧凑不安全子空间难以覆盖异构的不安全语义,而更宽泛的聚合又会扭曲安全相关的良性提示,形成覆盖与选择性的权衡。作者据此提出无需训练的防护方法CALM,以提示局部反事实修正替代全局统一移除,在显著抑制不安全内容的同时保持了良性生成效用。」
在文生图模型的安全防护研究中,一种被广泛采用的思路是寻找一个可复用的安全信号,例如某个固定的不安全方向,或者一个全局的有毒子空间,然后对所有提示统一施加这一信号进行拦截或修正。这类方法的最大优势在于无需重新训练模型,部署成本低、通用性强。然而,arXiv上新近收录的一篇论文对上述全局不安全假设进行了受控的几何分析,揭示了这一思路内在的结构性局限。
论文指出,全局防护方案存在一种稳定的覆盖与选择性之间的权衡。一方面,为了抑制多种多样的不安全语义,防护信号需要足够紧凑,但紧凑的不安全子空间无法覆盖语义高度异构的各类不安全情形,容易出现漏网之鱼。另一方面,如果为了提升覆盖范围而不断聚合更多方向、扩大子空间,防护信号就会逐渐侵入安全相邻的良性提示区域,导致原本正常的生成请求被错误地改写或削弱,也就是选择性的下降。换句话说,防护做得越宽,良性效用被扭曲得越明显,二者很难同时兼顾。
基于这一发现,作者提出了CALM,全称为反事实自适应局部调制,这是一种无需训练的防护方法,其核心思想是用提示局部的反事实修正来取代统一的全局移除。CALM不再假设存在一个可以全局通用的不安全信号,而是认为每个提示所触发的不安全因素各不相同,因此防护应当针对具体提示进行定制化的局部干预。
在具体实现上,CALM借助配对的不安全锚点与良性锚点来刻画语义空间中的安全边界。对于每一个输入提示,方法首先将其路由到当前处于活跃状态的不安全类别上,判断该提示究竟触及了哪一类风险语义。随后,CALM只对真正违规的Token表示进行最小幅度的编辑,将其向安全一侧推移,而不是对整个提示表示做全局性的削减。此外,方法还进一步抑制那些与不安全方向正对齐的残差分量,从表示层面清除残留的风险信号。
这种局部化设计的价值在于其选择性。由于编辑范围被严格限制在违规Token附近,CALM对提示中与安全无关的其余部分几乎不产生干扰,良性语义得以完整保留。论文中的广泛评估显示,CALM在显著提升不安全内容抑制效果的同时,很好地维持了模型的良性生成效用,说明局部反事实修正相比全局不安全信号移除是一种更具选择性的替代方案。
这项工作为文生图安全防护提供了一个新的技术视角:安全信号未必需要全局统一,也未必需要以牺牲生成质量作为代价。通过将防护粒度从全局层面下沉到提示与Token层面,CALM在覆盖范围与选择性之间找到了更优的平衡点。对于依赖无需训练手段快速上线安全能力的开发者而言,这种局部反事实校正的思路具备直接的参考意义,也为后续研究如何刻画安全边界、如何构造锚点对提供了可延展的方向。
来源:Heooo AI工具导航