判断 AI 应用是否真提效,需要在同一任务口径下比较上线前后:完成时间、一次通过率、人工修订量、错误损失、使用覆盖率和单次有效任务成本。只展示生成速度、单个成功样本或模型准确率,不能证明业务价值。
适用于
- 准备验收 AI 试点的业务和财务负责人
- 需要比较不同方案综合成本的项目组
- 已有稳定任务量并能采集基线的部门
不适用于
- 用单次演示推断全年收益
- 把所有节省时间直接折算为可减少的人力成本
- 忽略错误、复核、集成和维护成本
方法与证据口径
采用任务级基线、过程指标、结果指标和风险成本四层评估。先定义有效任务,再计算效率和成本,避免把模型能力指标直接当作经营指标。
决策表
| 证据层 | 建议指标 | 不能单独证明什么 |
|---|---|---|
| 模型 | 评测集正确率、引用完整率 | 不能证明用户会采用 |
| 任务 | 用时、一次通过率、修订量 | 不能直接证明经营增长 |
| 流程 | 覆盖率、等待时间、异常率 | 不能忽略迁移和维护成本 |
| 经营 | 收入、毛利、现金周期或风险损失 | 需要排除同期其他因素 |
- 建议指标
- 评测集正确率、引用完整率
- 不能单独证明什么
- 不能证明用户会采用
- 建议指标
- 用时、一次通过率、修订量
- 不能单独证明什么
- 不能直接证明经营增长
- 建议指标
- 覆盖率、等待时间、异常率
- 不能单独证明什么
- 不能忽略迁移和维护成本
- 建议指标
- 收入、毛利、现金周期或风险损失
- 不能单独证明什么
- 需要排除同期其他因素
01
先定义什么叫一次有效任务
如果分母是登录次数,项目很容易看起来热闹;如果分母是符合质量要求并进入下一流程节点的任务,数据才有决策价值。
有效任务定义应包含输入条件、完成标准、允许的人工修订和超时规则。
- 同一任务类型和复杂度
- 同一质量验收标准
- 记录人工检查和修订时间
- 失败和放弃任务也计入分母
02
综合成本不能只看模型调用费
AI 项目成本至少包括模型与基础设施、开发集成、数据与知识维护、人工复核、错误处置和运营改进。调用费较低不代表总拥有成本较低。
- 一次性建设成本与持续运行成本分开
- 将人工复核计入每次任务成本
- 对高影响错误使用风险加权
- 记录模型或供应商切换成本
03
四周完成一次可信评估
评估周期应覆盖正常业务波动,并保留原流程对照。
- 固定任务口径并采集上线前基线
- 建立包含正常、边界和失败样本的评测集
- 小范围上线并记录每次人工干预
- 按周比较效率、质量、采用和风险
- 由业务与财务共同确认可兑现收益
- 根据继续、调整或停止阈值作出决定
方法限制
- 效率提升只有在释放时间被重新配置后才可能转化为财务收益
- 小样本或短周期容易受到任务难度和人员熟练度影响
- 经营结果的因果归因通常需要更长时间和对照设计
本次更新
方法、适用边界与官方来源于 2026.08.14 完成复核。
下一次证据复核不晚于官方来源与核验日期
- 01AI RMF Playbook · NIST核验 2026.08.14
- 02Artificial Intelligence Risk Management Framework: Generative AI Profile · NIST核验 2026.08.14
