OpenAI披露,在ARC-AGI-3评测中启用推理保留与上下文压缩后,成绩和效率出现明显变化。这说明Agent效果并不只由模型名称决定,运行框架如何保存已完成工作、何时压缩历史、怎样把工具结果送回模型,同样会决定长任务能否完成。企业在比较模型时,如果忽略这些设置,很容易把框架差异误判为模型能力差异。
推理保留解决重复思考
长任务中模型会多次规划、观察和修正。如果每轮都丢弃关键状态,模型可能重新分析同一问题、重复调用工具或忘记已经排除的路径。可保留目标、约束、已验证事实、失败尝试和下一步计划,而不是保存不可控的全部原始对话。
状态应使用结构化字段,并区分事实与推测。工具返回的成功结果写入已完成清单,失败结果记录错误码和是否允许重试。下一轮先读取状态,再决定行动,能减少重复令牌和无意义尝试。
压缩不是简单摘要
上下文接近上限时直接截断最旧消息,可能删除任务约束或证据。更可靠的压缩分为稳定信息、当前工作集和可丢弃日志三层:稳定信息长期保留,当前工作集保持细节,过期工具输出只留结论与引用位置。
压缩后要做一致性检查,例如目标是否完整、禁止动作是否保留、文件和对象ID是否正确、未完成事项是否遗漏。压缩摘要必须带版本号和来源指针,需要时可以回读原始记录,而不是让摘要成为唯一真相。
设计公平的Agent评测
比较不同配置时固定模型版本、工具、提示词、预算和超时,至少运行多次以降低随机性。指标除最终成功率,还应包含工具调用数、重复步骤、压缩次数、人工接管率、总令牌和墙钟时间。
评测任务要覆盖短任务、长任务、错误恢复和信息冲突。只选择模型擅长的公开题容易产生虚高成绩。生产团队更应建立来自真实业务的私有评测集,并防止测试答案进入提示或知识库。
应用到真实产品
客服Agent可保留用户目标、已核验身份和未解决问题;编程Agent可保留测试状态、已改文件和失败命令;研究Agent可保留证据表和待确认假设。每种业务的状态结构不同,不能用一个通用摘要替代。
上线后监控重复调用率和压缩后失败率。如果压缩后任务经常偏航,应缩短单次任务或增加确定性工作流。能力更强的模型也不能弥补错误状态,先修上下文管理通常比盲目升级模型更省钱。
落地检查清单
- 结构化保存目标、事实、失败与下一步。
- 压缩后自动检查约束和对象ID。
- 评测固定模型、工具、预算与超时。
- 监控重复调用和压缩后的任务偏航。