Mistral发布Shieldstral小模型,单卡跑多模态审核 封面图
技术进展

Mistral发布Shieldstral小模型,单卡跑多模态审核

Heooo 08月05日23时01分 33 阅读

「Mistral AI推出Shieldstral内容审核模型,仅3B参数,可在单张16GB GPU运行,支持12种语言,性能媲美大7倍模型,并在多模态审核领域达到SOTA。其创新机制将审核政策写入输入,实现灵活可定制审核,已开源上线Hugging Face。」

Mistral AI近日发布了一款名为Shieldstral的内容审核模型,总参数仅3B(30亿),采用开放权重并依照Apache 2.0许可证发布,已上线Hugging Face平台。这款模型最引人注目的特点是能够在单张16GB显存的GPU上流畅运行,同时其内容安全性能据称可以媲美规模大7倍的开放模型,并在多模态内容审核领域达到了当前最先进水平(SOTA)。

Shieldstral的设计思路与多数防护模型不同。传统防护模型往往将伤害类别体系直接固化在权重中,当产品更换使用场景时,开发者通常需要重新训练模型以适应新需求。Shieldstral则另辟蹊径,将审核政策直接写入输入文本中。操作者可以自行编写一个“是或否”的问题,并附上评估场景和严格程度说明,模型随后仅从单个输出词元中提取一个经过校准的安全分数。

Mistral发布Shieldstral小模型,单卡跑多模态审核

具体机制上,Shieldstral将每一项审核任务拆解为二元问答。输入由三个带标签的字段组成:字段说明评估场景与严格程度,字段提出一个“是或否”的问题(例如“这段内容是否宣传身体暴力?”),字段提供待审核的内容——可以是提示词、回答、两者的组合,也可以是附带可选文本的图像。推理时,模型只读取“是”和“否”两个词元的逻辑值,经softmax归一化为连续分数,再以0.5作为阈值给出二元判断。这种设计使得模型能够同时覆盖提示词分类、回答审核、拒答检测和毒性检测,将多模态审核能力压缩进一张消费级显卡的容量中。

Shieldstral支持12种语言,极大地拓宽了其应用范围。对于开发者而言,这意味着无需针对不同语言或场景训练多个模型,只需调整输入中的审核政策即可灵活适配。这种“政策可编程”的审核方式,有望降低内容安全部署的复杂度和成本,尤其适合资源受限的中小团队或实时审核需求。

Mistral发布Shieldstral小模型,单卡跑多模态审核

Mistral AI此次发布的Shieldstral,不仅展示了小模型在特定任务上的巨大潜力,也为内容审核领域带来了新的思路。通过将审核政策外置,模型可以更灵活地适应不同产品和社区规范,减少重复训练成本。随着开源社区的进一步探索,Shieldstral有望成为多模态内容安全工具链中的重要一环。

# Mistral # Shieldstral # 内容审核 # 多模态 # 开源模型

来源:Heooo AI工具导航