Anthropic在2026年6月发布的新一期经济指数“Cadences”,为了适应Claude Code与Cowork带来的长时间Agent任务,提高了数据采样频率,并增加结果分类。报告提示一个重要变化:AI价值越来越难用“对话次数”衡量,因为一次长任务可能跨越研究、分析和交付多个环节。企业如果只计算减少了多少工时,容易忽略质量提升、能力扩展和员工学习,也可能鼓励错误的全面自动化。
从岗位转向任务衡量
同一个岗位包含资料收集、判断、沟通、执行和担责等不同任务。AI通常先改变其中一部分,而不是完整替代岗位。企业应把流程拆成任务,分别记录AI独立完成、AI辅助、人独立完成和必须人工批准的比例。这样能看清技术真正影响了哪里,也能避免把少数高频任务误认为整个岗位已可自动化。
衡量周期也要调整。代码Agent运行半小时完成一组改动,与员工和AI来回对话二十次不是同一个指标。更合理的是按完整任务统计:从需求进入到可验收交付用了多久、经过几次人工接管、产生多少错误以及最终创造什么业务结果。
五类核心指标
第一是效率,包括完成时间、处理量和单位任务成本;第二是质量,包括错误率、返工率和客户满意度;第三是能力扩展,例如员工是否完成过去不会做的数据分析或编程任务;第四是风险,包括越权、敏感数据和错误外发;第五是学习,观察团队是否把成功经验沉淀成模板、技能和评测。
指标之间必须平衡。处理量上升但返工翻倍不是增效;模型成本下降但员工花更多时间核对也不划算。每个试点至少同时选择一个效率指标、一个质量指标和一个风险指标,避免只展示漂亮的节省数字。
如何做对照实验
选取难度相近的真实任务,一组使用原流程,一组使用AI辅助,记录完整投入和结果。实验时间要覆盖新鲜感与学习期,不能只看第一天。参与员工需要知道评估目的是优化流程而不是简单裁员,否则他们可能隐瞒问题或故意不用工具,数据失去意义。
对长任务还要记录“无人看管时间”和“有效完成率”。Agent运行很久不等于节省很多时间,如果最后全部重做,实际收益为负。通过任务日志识别最常见接管点,再决定优化提示、工具还是流程边界。
组织层面的趋势
AI会先重组任务组合和协作边界。未来重要能力包括定义目标、提供上下文、验证证据、处理异常和承担责任。企业应把节省出的时间投入客户沟通、产品改进和员工学习,而不是只追求更少的人完成同样工作。能持续记录任务级数据的组织,会比只统计账号活跃度的组织更早找到真正高价值场景。
实操步骤
- 选择一个部门流程,将岗位工作拆成可观察、可验收的任务。
- 建立原流程基线,记录耗时、质量、返工、成本和风险事件。
- 设置AI辅助组与对照组,至少运行两到四周并记录人工接管。
- 同时评估效率、质量、能力扩展、风险和学习沉淀,不只算工时。
- 把结果用于调整流程和培训,再决定是否扩大自动化范围。
结语
AI工具更新很快,本文采用的是截至2026年8月可查的官方信息。实际部署前应重新核对模型名称、价格、地区可用性和接口限制,并用自己的真实数据完成小范围验证。先建立边界、评测和回退,再扩大自动化,通常比追求一次性全自动更稳妥。