结合Anthropic与行业伙伴提出的越狱严重度框架,讲清企业如何设计红队测试、分级问题并推动修复。
最新进展与核心变化
Anthropic在恢复Fable 5与Mythos 5服务的说明中,进一步介绍网络安全防护,并提出与Amazon、Microsoft、Google等伙伴共同建立越狱严重度评分框架。行业需要统一尺度,因为“模型被绕过一次”并不能说明真实风险:输出无害边缘内容与提供可直接造成严重损害的步骤,处置优先级完全不同。
普通用户应该怎样理解
企业红队首先要定义资产和威胁。模型能访问哪些数据、工具和外部系统,攻击者可能是普通用户、内部员工还是被污染的网页内容。只测试聊天回复会漏掉Agent风险,必须覆盖提示词注入、工具越权、数据外泄、身份混淆和长任务中的规则漂移。每个样本都应记录输入、模型版本、参数、工具状态和结果。
可操作的落地步骤
严重度可以从能力、可执行性、影响范围和复现难度四个维度判断。模型偶尔生成模糊描述,风险通常低于稳定输出完整步骤;只能在沙箱中失败的行为,低于能调用真实系统的操作;需要专家反复尝试的漏洞,也不同于普通用户一句话即可触发。评分必须结合部署环境,不能照搬公开模型的结论。
安全、权限与数据边界
发现问题后不要只加一句系统提示词。优先缩小工具权限、增加参数校验和审批,再补模型拒绝策略与监控。高风险写操作要使用允许列表,敏感数据在进入模型前脱敏,外部网页内容与系统指令隔离。修复完成后用原样本和变体回归,确认没有把正常业务一并阻断。
评估方法与常见问题
建立流程时,可按月维护红队样本库,重大模型升级前做完整测试,日常版本做核心回归。安全、业务和法务共同确认严重度,避免技术团队只看攻击是否成功,业务团队只看功能是否可用。对外部报告应提供复现所需的最少信息,避免在修复前公开可利用细节。
未来趋势与行动建议
统一越狱严重度将推动大模型安全从口号走向工程管理。企业不必等待行业标准完全成熟,可以先建立自己的四级响应:低风险记录,中风险限期修复,高风险暂停相关工具,严重风险立即隔离并启动事件响应。关键不是追求零漏洞,而是确保漏洞被发现后有一致、可审计的处理路径。
参考来源
本文依据官方公开资料整理并进行中文原创分析:https://www.anthropic.com/news。产品能力与开放范围可能继续变化,实际使用请以官方最新说明为准。