Anthropic在2026年9月18日宣布与Accenture合作开展“嵌入式评估”,由独立评估人员进入模型公司的内部环境,以接近员工的访问深度开展红队测试、对齐评估和安全措施检查。双方预计未来五年各自投入至少十亿美元建设相关能力。这个新模式并不等于把模型公司的安全责任外包,而是尝试解决传统外部评估看不到训练流程、内部日志和早期风险的问题。
一、驻场评估和普通审计有什么不同
普通第三方评估通常拿到一个已发布接口,在限定时间内测试输出。驻场团队能够更早接触模型、工具链、事件记录和防护策略,可以观察问题如何产生,而不只是看到最终结果。代价是评估者会接触更敏感的信息,因此独立性、保密边界和利益冲突管理必须比普通供应商审计更严格。
二、企业为什么需要独立视角
内部团队熟悉系统,却容易受到既有假设影响。开发者可能把某种失败当作边缘情况,业务团队可能只关注上线速度,管理者又可能只看到汇总指标。独立评估的价值是用另一套问题重新检查系统,包括模型是否越权调用工具、是否会泄露资料、面对诱导时是否绕过规则,以及事故是否被如实记录。
三、先定义评估范围
企业引入类似机制时,应列清模型、应用、数据、工具和用户范围。评估不能只测聊天回答,还要覆盖检索数据源、插件权限、Agent动作、日志保存和人工审核。每个场景写出允许行为、禁止行为和需要确认的行为。例如客服Agent可以查询本人订单,但不能查看其他客户,也不能未经确认直接退款。
四、访问权限如何安排
评估者需要足够信息才能发现真实问题,但不应默认获得全部生产权限。可以提供脱敏日志、隔离测试环境和临时只读账号,确需生产观察时采用双人审批并完整留痕。评估团队不能同时负责被评系统的销售业绩,否则会形成明显利益冲突。访问结束后应自动撤销权限并确认资料归还或销毁。
五、红队测试不能只追求越狱
实际风险往往来自正常功能组合,例如检索工具找到暴露密钥、文件工具上传敏感材料,或多个Agent通过公共渠道交换内容。测试应覆盖提示注入、身份混淆、跨租户访问、工具参数篡改、长任务偏航和异常恢复。每个问题都要保存复现步骤、影响范围和证据,而不是只留下一个“模型不安全”的结论。
六、报告怎样保持独立
报告至少区分事实、推断和建议,说明样本数量、模型版本、测试时间和限制。严重问题应直接提交风险负责人,不经产品团队过滤。企业可以约定公开摘要和保密附件:前者向用户说明风险与整改,后者保存可能被滥用的技术细节。对于尚未解释的异常,也应记录并持续跟踪,而不是等到完全理解才披露。
七、整改必须形成闭环
每项发现要有负责人、优先级、截止时间和复测标准。修复可以是模型训练、权限收紧、确定性规则或人工确认,不能只追加一句系统提示。完成后由不同人员复测,确认问题不再出现且没有破坏正常业务。相同类型问题重复发生时,应升级为架构或治理问题,而不是继续逐条打补丁。
八、小团队也能采用的做法
没有条件请驻场机构的小团队,可以安排未参与开发的同事做季度交叉评估,邀请外部专家检查高风险流程,并建立漏洞报告渠道。关键是让评估者能看到真实链路,同时不受发布团队单方面控制。独立评估不是一张合规证书,而是一套持续发现、公开记录和验证整改的工作机制。
资料来源:官方资料。本文依据官方信息独立整理,并结合实际场景扩展。