技术进展

Mistral开源Shieldstral多模态审核模型

Heooo 08月05日16时02分 27 阅读

「Mistral AI发布开源内容审核模型Shieldstral,总参数量30亿,采用Apache 2.0许可证,支持12种语言,可在16GB GPU上运行。该模型在内容安全性能上媲美7倍规模开放模型,并在多模态审核领域达到SOTA。其创新设计将审核政策放入输入,通过二元问答机制生成安全分数,覆盖提示词分类、回答审核等任务。」

近日,Mistral AI正式发布了一款名为Shieldstral的内容审核AI模型,该模型以开放权重形式推出,依据Apache 2.0许可证发布,已在Hugging Face平台上线。Shieldstral总参数量为30亿(3B),支持12种语言,并能在单张16GB显存的GPU上高效运行,这为中小型开发团队提供了便捷的本地部署可能。

Mistral AI在公告中强调,Shieldstral在内容安全方面的性能可与7倍规模的开放模型相媲美,并且在多模态内容审核领域实现了SOTA(state-of-the-art)水平。所谓SOTA,指的是在特定AI任务或基准测试中表现最优秀、最先进的模型或算法集合,这一成绩意味着Shieldstral在当前内容审核技术中处于领先地位。

Shieldstral的设计理念颇具创新性。传统防护模型通常将伤害类别体系固化在模型权重中,当产品更换使用场景后,开发者往往需要重新训练模型以适应新的审核需求。而Shieldstral则另辟蹊径,将审核政策直接放入输入内容中。操作者可以写入一个“是或否”问题,并提供评估场景和严格程度的说明,模型随后会从单个输出词元中生成经过校准的安全分数。

具体而言,Shieldstral将每项审核任务转化为二元问答形式,输入包含三个带标签的字段:<Instruct>字段用于说明评估场景和严格程度;<Query>字段提出单个“是或否”问题,例如“这段内容是否宣传身体暴力?”;<Document>字段则提供待审核内容,可以是提示词、回答、提示词与回答的组合,也可以是附带可选文本的图像。这种灵活的输入结构使模型能够适应多种审核场景。

在推理阶段,Shieldstral仅读取“是”和“否”两个词元的逻辑值,并通过softmax归一化将其转换为连续分数,以0.5为阈值输出最终的二元判断。这一机制有效覆盖了提示词分类、回答审核、拒答检测和毒性检测等常见内容安全任务。Mistral AI表示,这种设计不仅提高了审核效率,还增强了模型在不同场景下的可迁移性,开发者无需重新训练即可调整审核策略。

Shieldstral的发布为开源社区带来了一个强大的内容审核工具,其轻量级特性和高性能表现,有望推动更多应用在本地部署安全审核功能,同时为多模态内容安全领域树立了新的技术标杆。

# Mistral AI # Shieldstral # 内容审核 # 开源模型 # 多模态

来源:Heooo AI工具导航