AI News

ARC-AGI评测提分启示:保留推理与上下文压缩如何改变Agent表现

通过ARC-AGI案例讲清推理状态保留、上下文压缩、长任务评测和成本控制的实际方法。

ARC-AGI评测提分启示:保留推理与上下文压缩如何改变Agent表现

OpenAI披露,在ARC-AGI-3评测中启用推理保留与上下文压缩后,成绩和效率出现明显变化。这说明Agent效果并不只由模型名称决定,运行框架如何保存已完成工作、何时压缩历史、怎样把工具结果送回模型,同样会决定长任务能否完成。企业在比较模型时,如果忽略这些设置,很容易把框架差异误判为模型能力差异。

推理保留解决重复思考

长任务中模型会多次规划、观察和修正。如果每轮都丢弃关键状态,模型可能重新分析同一问题、重复调用工具或忘记已经排除的路径。可保留目标、约束、已验证事实、失败尝试和下一步计划,而不是保存不可控的全部原始对话。

状态应使用结构化字段,并区分事实与推测。工具返回的成功结果写入已完成清单,失败结果记录错误码和是否允许重试。下一轮先读取状态,再决定行动,能减少重复令牌和无意义尝试。

压缩不是简单摘要

上下文接近上限时直接截断最旧消息,可能删除任务约束或证据。更可靠的压缩分为稳定信息、当前工作集和可丢弃日志三层:稳定信息长期保留,当前工作集保持细节,过期工具输出只留结论与引用位置。

压缩后要做一致性检查,例如目标是否完整、禁止动作是否保留、文件和对象ID是否正确、未完成事项是否遗漏。压缩摘要必须带版本号和来源指针,需要时可以回读原始记录,而不是让摘要成为唯一真相。

设计公平的Agent评测

比较不同配置时固定模型版本、工具、提示词、预算和超时,至少运行多次以降低随机性。指标除最终成功率,还应包含工具调用数、重复步骤、压缩次数、人工接管率、总令牌和墙钟时间。

评测任务要覆盖短任务、长任务、错误恢复和信息冲突。只选择模型擅长的公开题容易产生虚高成绩。生产团队更应建立来自真实业务的私有评测集,并防止测试答案进入提示或知识库。

应用到真实产品

客服Agent可保留用户目标、已核验身份和未解决问题;编程Agent可保留测试状态、已改文件和失败命令;研究Agent可保留证据表和待确认假设。每种业务的状态结构不同,不能用一个通用摘要替代。

上线后监控重复调用率和压缩后失败率。如果压缩后任务经常偏航,应缩短单次任务或增加确定性工作流。能力更强的模型也不能弥补错误状态,先修上下文管理通常比盲目升级模型更省钱。

落地检查清单

  • 结构化保存目标、事实、失败与下一步。
  • 压缩后自动检查约束和对象ID。
  • 评测固定模型、工具、预算与超时。
  • 监控重复调用和压缩后的任务偏航。

参考资料

Next Reading

继续深入这个主题

从专题、教程和热门关键词继续阅读,帮助搜索引擎和读者理解文章之间的关系。

ChatGPT / GPT AI Agent 大模型 AI赚钱 开发者