OpenAI在9月11日发布Cognition使用GPT‑6 Astra改进Devin的案例。核心变化不是让Agent写更多代码,而是让它测试自己的工作并展示证据。例如修复iPhone游戏后,Devin返回模拟器运行录像,同时给出通过项与尚未测试范围;处理客户截图中的缺陷时,修复后再提交新的截图。对工程团队而言,这提供了一条比“模型说已完成”更可靠的验收路径。
把完成定义改成有证据
任务描述应提前规定验收方式:自动化测试、截图、录像、接口响应、性能对比或日志。Agent只有同时提交改动和证据才算完成。对于无法自动验证的视觉或业务规则,明确要求人工确认,不能用一条成功消息替代。
测试报告必须写未覆盖内容
只展示通过项容易制造虚假安全感。报告要列出运行环境、测试数据、失败项、跳过项和无法覆盖的路径。录像能证明某次交互发生过,但不能证明所有设备和边界条件正常,因此需要与单元、集成和回归测试组合。
截图修复要核对真实问题
客户截图可能只显示症状,没有设备、权限或网络上下文。Agent先复现并记录原因,再修改代码。修复截图应使用相同窗口尺寸和数据条件,并检查是否只是隐藏错误提示。涉及后端状态时,还要核对接口与日志,而非只看画面。
减少人工审查不等于取消审查
高质量证据可以让工程师把时间集中在架构、安全和业务风险上,但生成代码仍需审查依赖、权限、数据迁移和异常路径。风险较低的样式修复可简化流程,认证、支付、删除和基础设施变更必须保持严格审批。
让证据成为持续集成产物
Agent提交的测试命令、录像脚本和截图基线纳入仓库与CI,使后续改动可重复运行。临时手工操作无法复现时,应转化为脚本或清晰步骤。证据文件要有保留期限,避免大量视频长期占用存储并泄露测试数据。
进一步实施建议
团队可以挑选五类真实缺陷建立Agent验收模板:界面错位、接口错误、权限异常、性能下降和跨端兼容。每类指定最低证据与人工审核人。运行一个月后统计首次修复通过率、回退次数、人工审查时间和漏测原因。若Agent经常生成“证明成功”的窄测试,应改进任务和独立测试,而不是进一步相信自我评价。
落地检查清单
- 完成状态必须附可复现证据。
- 报告同时列出通过、失败和未覆盖项。
- 关键权限与数据变更保持人工审查。
- 测试脚本和环境进入持续集成。