Mistral发布Shieldstral,一款三十亿参数的开放权重多模态安全分类器。与固定类别的传统审核模型不同,它把审核问题写成自然语言:给出使用场景、一个是否违规的问题,以及要审核的文本或图片,模型返回可用于阈值判断的分数。官方称模型可在单张十六GB显存的NVIDIA GPU上运行,并以Apache 2.0许可开放权重。它适合构建可调整政策的审核流水线,但分数不能替代责任判断。
一、先明确审核对象
一条用户提问、一段模型回答、一组问答对和一张图片,审核标准可能不同。用户提问要判断是否涉及禁止请求;模型回答要检查是否真的输出有害内容;图片还需考虑视觉上下文。不要把这些对象混成同一个模糊“安全分”,否则误报和漏报都难定位。
二、把政策写成具体问题
例如儿童内容平台可以问“这张图是否包含不适合未成年人观看的暴力画面”,企业知识库可以问“回答是否泄露未授权客户信息”。问题要能回答是或否,明确场景、对象和边界。避免写“这是否安全”这样过宽的问题。政策变更时先改测试集并评估,再调整上线提示。
三、分数如何设置阈值
模型输出连续分数,可用于自动放行、人工复核和直接阻断三个区间。阈值不能照搬公开基准,应从自己的用户内容中抽样标注,测量误报与漏报。高风险领域宁愿提高人工复核比例,也不要让低置信结果自动通过。对不同风险类别可设置不同阈值,而不是全站统一数值。
四、图片审核有什么难点
图片中的小字、局部裁剪和文化语境会影响判断。模糊照片可能需要人工复核,不能强迫模型给确定结论。文本加图片的内容要一起审查,例如图片本身无害,但配文可能改变含义。上传前检查格式与大小,模型读不懂的文件要明确报错。
五、本地部署不等于完全安全
开放权重可帮助企业在受控环境运行,减少外部传输,但服务器日志、缓存和人工复核台仍可能泄露用户数据。应对审核记录设保存期限、访问权限和脱敏规则。模型服务本身需要限制网络和文件权限,并维护版本与权重校验,防止部署源被替换。
六、与大模型组成双层防线
Shieldstral可以在请求进入主模型前初筛,也可以在输出展示前复核。对高风险动作还应有确定性规则,例如禁止外发密钥、限制工具调用域名。分类器不是唯一的防线;若主模型能执行写操作,程序层必须实施授权与确认。
七、上线前怎样评估
准备本地语言、行业术语、真实误判和对抗样本,分开计算各类别效果。邀请业务、法务和安全人员共同审查政策文本。观察模型更新后同一批样本的分数漂移,并建立快速回滚。只有在真实场景中证明减少了人工工作量且没有增加漏报,部署才算成功。
八、适合的落地起点
从一类明确场景开始,例如电商评论中的人身攻击,先仅做辅助标记,由审核员决定处理。积累足够样本后,再开放高置信度自动处理。自然语言政策让调整更灵活,同时也要求团队把政策写得可理解、可测量、可审计。
参考资料:官方文档或公告。本文依据公开资料独立整理,并补充适用场景与操作建议。