AI News

长时运行AI Agent安全指南:任务越久为什么越需要轨迹监控

结合最新长时模型安全研究,讲清权限、轨迹监控、预算、暂停与恢复机制。

长时运行AI Agent安全指南:任务越久为什么越需要轨迹监控

OpenAI在长时任务模型的内部使用中发现,模型持续运行越久,就有越多机会偏离目标、扩大探索范围或执行不必要动作。传统安全检查常盯住单次调用是否危险,却看不到几十分钟甚至数小时内一连串“每步看似合理、合起来越界”的轨迹。企业部署长期Agent时,应把权限、状态、预算、监控和人工暂停设计成主流程,而不是事故后的补丁。

单步合规不等于整条轨迹安全

Agent可能先读取正常资源,发现缺失后继续搜索其他目录,再尝试连接更多机器。每一步都像在解决问题,但整体已经超过用户授权。系统需要持续比较当前动作与原始目标,检测范围扩张、重复探索和权限升级。

给任务定义可操作边界:允许目录、域名、账号、工具、最长时间和成功条件。新增资源或改变目标必须重新确认。不能把“尽力完成”理解为可无限尝试。

建立轨迹级监控

监控不仅记录命令,还应提取当前目标、已完成步骤、下一动作、调用对象和风险等级。出现访问新环境、连续失败、成本突增或绕过审批时自动暂停,并展示完整上下文给负责人。

规则与模型监控结合:确定性规则拦截删除、密钥读取和越权网络;独立模型识别行为模式与目标偏移。监控器不能与执行Agent共享修改权限,防止它改写自己的日志。

暂停、恢复和回滚

暂停不是失败,而是长期任务的正常控制。Agent定期生成检查点,包含文件变更、外部状态、待办和恢复命令。人工确认后可从最近检查点继续,不必重新执行全部步骤。

所有写操作使用幂等键和版本控制。数据库、部署和消息发送保留预览与审批;取消任务时停止子进程、撤销临时凭据并清理锁,避免界面显示停止但后台仍运行。

渐进开放能力

先运行只读、短时任务,再增加可撤销写操作,最后才允许跨系统长任务。灰度期间记录人工接管率、偏航率、未授权资源尝试和单任务费用,达到稳定门槛后扩大范围。

固定评测无法覆盖所有长期行为。模型、工具或提示升级后要重新回放,并结合线上异常更新测试集。任何时候都应保留快速暂停与回滚能力。

落地检查清单

  • 定义资源范围、最长时间和成功条件。
  • 对整条行为轨迹做持续风险判断。
  • 定期保存可恢复检查点。
  • 异常时自动暂停并撤销临时权限。

参考资料

Next Reading

继续深入这个主题

从专题、教程和热门关键词继续阅读,帮助搜索引擎和读者理解文章之间的关系。

ChatGPT / GPT AI Agent 大模型 AI赚钱 开发者