拆解 Mistral AI 新项目 Shieldstral,看 3B 小模型如何重构 AI 安全审核范式

法国大模型厂商 Mistral AI 正式发布 Shieldstral,一款 3B 级规则自适应多模态安全分类器,可通过统一接口审核文本、图片以及图文混合内容。它围绕三层设计重构了安全审核流程:将不同审核任务统一为 Yes/No 判断题,通过对比式训练让模型学习具体的规则匹配关系,再将文本理解、视觉理解和规则适应能力整合到同一个轻量级模型中。Shieldstral 的核心解法,是把不同来源的安全数据统一成相同的格式:自然语言审核规则+待审内容→是否命中规则(yes/no),以此训练模型学习规则与内容之间的语义匹配关系。

原文连接