OpenAI在9月6日披露内部研究团队使用编码Agent的早期数据:并发会话增加,代码和实验速度提高,Agent开始承担更长、更复杂的任务,但高难任务仍需要明显人工干预。对普通研发团队而言,最重要的启示不是复制昂贵的调用规模,而是把决定、设计、构建、运行、分析和沟通分开,找出真正受实施劳动限制的环节。
并行不是同时开更多窗口
每个Agent需要独立目标、数据、分支和验收。适合并行的是不同假设、评测实现、数据检查和性能实验;共享同一环境或依赖前序结论的任务应排队。主研究者维护依赖图和资源预算,避免多个Agent重复实验或争抢算力。
实验必须可追溯
每次运行记录代码提交、配置、数据版本、随机种子、硬件、模型与假设。Agent自动生成实验卡片和结果表,但原始日志不可由Agent覆盖。结果异常时可以复现,而不是凭聊天记录猜测发生了什么。
人工干预是重要指标
复杂任务成功往往包含研究者纠偏。应记录何时介入、介入原因和耗时,区分Agent独立完成与人机协作完成。如果成功率提高但专家时间不降,说明自动化可能只是改变了工作形式。
防止实验数量掩盖质量
运行更多实验不等于获得更多知识。要求每个实验对应明确假设、判断标准和后续动作。重复、缺少基线或无法解释的结果不计入有效产出。研究评审关注被验证或否定的假设,而非任务数。
控制算力与模型费用
按项目设置日预算、并发和最长运行时间。低成本模型处理代码整理与日志摘要,高能力模型用于复杂分析。连续失败时停止并转人工,避免Agent在错误假设上耗费大量令牌和计算。
进一步实施建议
团队可每周复盘“有效实验率”:有多少实验改变了结论或下一步,有多少只是重复确认。把常见人工纠偏写成检查器、模板或技能,再观察下一轮是否减少介入。高层规划和研究方向仍由人负责,Agent更适合加速可定义、可验证的研究劳动。
落地检查清单
- 并行任务具备独立环境和验收。
- 实验记录代码、数据、参数和随机种子。
- 统计人工介入而非只看最终成功。
- 预算、并发和失败停止条件明确。