Anthropic在2026年9月提出与企业客户共同开发前沿安全护栏。原因很现实:供应商了解模型能力和通用风险,客户更了解自己的数据、流程、监管和错误后果。双方任何一方单独制定规则都可能遗漏关键场景。企业应把护栏视为模型、平台和业务共同承担的控制体系,而不是购买产品后勾选几个安全开关。
共同定义风险场景
供应商提供模型能力、限制和通用攻击样本;客户列出数据等级、工具权限、关键决策和行业要求。双方把场景转换为可运行测试与明确阻断条件。
同一功能在不同业务风险不同。摘要工具与自动批准合同不能使用同一权限和验收门槛,风险分类必须落实到具体流程。
分层护栏设计
模型层负责识别有害请求,平台层执行身份、速率、数据和工具限制,业务层校验金额、对象和状态,人工层负责高风险审批与申诉。
任何一层都可能失败,关键流程至少有两种独立控制。禁止只靠提示词约束;确定性规则应在执行器内强制实施。
评测、监控与共享信息
上线前使用真实和对抗样本,记录正常完成率、攻击成功率、误报与成本。上线后监控轨迹、权限异常、数据外传和模型版本变化。
供应商与客户约定事件分级、通知时限和所需日志。分享故障信息时脱敏,并保留足够证据定位根因。
演练暂停与恢复
定期模拟模型异常、供应商中断、密钥泄露和大规模错误输出。验证能否按业务或模型快速停用,而不是关闭整个系统。
恢复前完成影响评估、修复、回归和小流量观察。事故结论转成测试与文档,避免同类问题再次发生。
进一步实施建议
企业可建立季度联合评审:业务负责人提交新增用途,安全团队评估权限和数据,供应商说明模型变化,法务检查合同与法规。会议输出的是可执行变更清单,包括谁修改什么、何时验证、如何回滚,而不是只有风险讨论。没有负责人和截止日期的护栏建议视为未落实。
落地检查清单
- 供应商与客户共同维护风险场景。
- 模型、平台、业务和人工四层控制。
- 约定事件日志、通知时限和责任。
- 定期演练模型级暂停与灰度恢复。