导读:Anthropic在Fable 5安全说明中提出网络越狱严重度CJS草案,从CJS-0信息级到CJS-4关键级,并强调等级应呈指数而非线性增长。评估关注越狱为攻击者新增的真实能力、覆盖范围、可复现性和发现难度。企业可以借鉴框架统一漏洞报告与响应。
越狱成功不等于同样严重
让模型输出轻微不当内容与解锁可用于现实攻击的新漏洞能力,后果完全不同。严重度首先看攻击者是否获得现有公开工具之外的能力,以及该能力能否影响广泛系统。
窄、偶发且需要专家条件的越狱风险低于公开、稳定、容易复现的通用方法。不能只用一张成功截图评为最高级。
四类核心判断
检查能力提升幅度、行为覆盖、复现可靠性和可发现性。已经公开或正在被利用的方法发现性更高;需要长期专业研究且秘密报告的得分较低。
初始分数形成等级下限,若涉及难发现的关键漏洞、缺少短期缓解或与其他发现组合产生更大风险,可以上调,不能随意下调。
企业内部如何采用
建立统一报告模板,保存模型版本、提示、环境、工具、完整轨迹、成功次数和现实影响。安全团队复现,业务团队判断资产暴露,法务决定披露与通知。
CJS-0/1可进入常规修复,CJS-2加速处理并限制功能,CJS-3暂停相关能力和扩大排查,CJS-4启动最高事件响应。具体时限按企业风险调整。
负责任披露与复测
报告中避免公开可直接滥用的完整步骤,先通过厂商漏洞计划提交。修复后使用变体而非原提示复测,防止只封一个字符串。
严重度框架仍是草案,应结合自己的模型、工具权限和行业后果。定期校准案例,让不同评审者得到接近结果。
执行清单
- 记录完整轨迹、版本、工具和复现次数。
- 评估新增能力、覆盖、可靠性和发现性。
- 按等级定义限制、暂停和通知时限。
- 通过负责任渠道披露高风险细节。
- 用变体复测并定期校准评分。
结语
CJS框架的价值是把“越狱了”转化为可比较的现实风险。统一证据与响应等级后,团队才能优先处理真正危险的问题,而不是被演示效果牵着走。