企业采购AI时容易比较每百万Token价格,却忽略重试、等待、人工复核和返工。OpenAI提出用“每美元有用智能”观察价值,核心是统计真正完成并达到质量标准的工作。更便宜的模型如果需要多次生成和大量人工修改,最终任务成本可能高于单价较高但一次成功的模型。
先定义什么叫任务成功
客服场景可以定义为问题解决且没有再次来电,研发场景可以定义为代码通过测试并合并,合同场景可以定义为关键条款正确提取并由法务确认。只统计生成次数或活跃用户无法说明业务价值。
每个流程设定质量门槛、最大处理时间和允许人工介入范围。任务定义不清时,模型表现和财务结果都无法比较。
计算完整成本
完整成本包括模型调用、检索和工具服务、基础设施、员工等待、人工审核、失败重试、错误修复和治理成本。将总成本除以达到标准的成功任务数量,得到更接近真实的单位结果成本。
同时记录不同难度,避免简单任务拉低平均值掩盖复杂任务失败。对高风险工作还要估算错误可能造成的损失。
可靠性与价值同样重要
模型偶尔给出惊艳结果但波动很大,生产价值有限。应统计一次成功率、稳定格式率、事实错误率、升级人工率和重复运行差异。
更强模型可处理复杂任务,轻量模型适合批量简单工作。建立路由规则,把低置信度或高风险请求升级,通常比所有请求使用同一模型更划算。
从试点到规模化
先选一个能在业务系统中直接计数的流程,运行四到八周,比较AI前后的时间、成本、质量和员工体验。确认收益后再扩展相邻流程。
规模扩大时关注边际成本和管理负担。如果每增加一个部门都需要重新手工维护大量提示词,平台化和知识治理应优先解决。
可直接执行的操作清单
- 选择一个可明确判断完成与否的业务流程。
- 记录模型、工具、人工复核、重试和返工成本。
- 按任务难度统计成功率和单位成功成本。
- 建立轻量与强模型的分级路由。
- 连续评估规模扩大后的边际价值和治理负担。
总结
企业AI的核心指标不是用了多少Token,而是以可接受成本完成多少可靠工作。围绕成功任务建立统一计分卡,才能让模型选择和预算决策回到真实业务价值。
参考资料:官方发布与研究资料。本文依据公开信息重新整理,并加入实际应用、验证方法和风险边界。