FDE Hub
学习路径/10
校准
7 分钟

Eval 体系与指标设计:证明 AI 真的有用

90% 的 AI 项目死在没指标。Calibration 维度的工程实践 + 业务桥梁。

90% 的 AI 项目死在没指标。Calibration 的本质不是「调模型」,而是「用指标证明 AI 真有用」。

为什么没指标 = 烂尾

没指标的项目 6 个月后必然面临 3 个问题:

  • 没法证明价值,客户不续约
  • 没法定位问题,出了问题不知道哪坏了
  • 没法迭代优化,改进靠感觉

指标三层架构

  • 业务结果层:转化率提升、效率改善、错误率下降(最关键)
  • 采用率层:日活/月活、调用次数、用户留存
  • 模型效果层:准确率、召回率、幻觉率(技术指标)

4 种 Eval 模式

  1. 离线 Eval:用历史数据测试,适合开发阶段
  2. 影子模式:AI 静默运行,真实场景对比,适合高风险行业
  3. A/B 测试:新旧方案对比,适合互联网产品
  4. 在线人工评估:专家打分,适合医疗/金融/法律
Calibration 的最小可行实践:每个项目上线前定义 1 个业务指标 + 1 个采用率指标, 用 4 周追踪,有数据再优化。

常见问题

模型准确率 95% 还需要 Eval 吗?

越需要。95% 准确率在不同业务下价值完全不同:推荐系统 95% 可能没用,质检 95% 可能就够了。 Eval 不是看模型,而是看「在业务里有没有用」。

本章常见问题

AI 项目一定要有 Eval 体系吗?

一定。Calibration 的本质是「用指标证明价值」。没有指标的 AI 项目 = 没有衡量标准 = 一定会烂尾。建议每个项目至少定义 1 个业务结果指标 + 1 个采用率指标。

影子模式(shadow mode)怎么用?

AI 静默运行,不直接影响业务,但记录所有决策建议,与真实结果对比。2-4 周后用对比数据决定是否切到生产。是高风险场景(医疗/金融/能源)上线 AI 的标准前置步骤。