AINotes 101
菜单
Learn / 03 构建 AI / Evals

Evals

评估

用固定任务集和明确标准衡量 AI 系统表现的方法。没有它,所有改进都只是感觉。

BUILD #core#engineering#quality

一句话定义

Evals(评估)是一套可重复运行的测试:给定一组固定任务和明确的判定标准,测量 AI 系统的表现,从而让改动带来的效果可比较

在传统软件里,测试回答「有没有坏」;在 AI 系统里,评估还要回答「好了多少」。

为什么重要

AI 系统是概率性的。同一段输入,换个模型、改一句提示、调整一次温度,结果分布就会变化。

没有评估,你会陷入三种典型困境:

  1. 无法判断改动是否有效:改了提示词感觉好像好了一点——但这可能是随机波动。
  2. 无法发现回归:模型供应商更新了版本,你的系统悄悄变差了。
  3. 无法设定目标:不知道当前是 60% 还是 90%,也就不知道值不值得继续投入。

评估是 AI 工程里唯一能对抗「感觉」的工具。

三个层次

层次 做法 成本 适用于
断言式 检查格式、字段、关键词 结构化输出、格式约束
指标式 准确率、召回率、通过率 分类、检索、抽取
模型评判 用强模型按标准打分 中高 开放性生成
人工评审 人来判断 定标准、校准模型评判

务实的顺序是:先用断言,再上指标,模型评判只用在必要处,人工评审用来校准。

怎么开始

  1. 从失败案例收集任务。不要凭空构造测试集,从真实出错的地方开始。二十条就够启动。
  2. 写出判定标准。标准写不出来的任务,说明你自己也还没想清楚。
  3. 先跑基线。记录当前表现,之后所有对比都以它为准。
  4. 固定测试集。可以扩充,但不要为了通过而修改已有用例。
  5. 把它接进开发流程。每次改动都跑一遍。

容易被忽略的点

  • 评估检索,不要只评估最终回答。RAG 系统的错误常出在召回环节,只看最终输出会掩盖问题。
  • 评估成本也要纳入。准确率提升 2% 但成本翻倍,通常不划算。
  • 记录失败样本。失败案例比总体分数更有价值。
  • 定期重新校准。模型换代后,旧的判定标准可能已经失效。

常见误解

  • 「评估就是跑 benchmark」:公开基准测的是模型,评估测的是你的系统。两者目标不同。
  • 「用模型打分就够了」:模型评判有系统性偏好(偏爱长回答、偏爱自己风格的输出),必须用人工样本校准。
  • 「系统还早,先不做评估」:越早开始越便宜。等到系统复杂了再补,成本会高得多。

延伸阅读

继续阅读

与 Evals 同属一个层级,或在本条目中被显式引用。