一句话定义
Evals(评估)是一套可重复运行的测试:给定一组固定任务和明确的判定标准,测量 AI 系统的表现,从而让改动带来的效果可比较。
在传统软件里,测试回答「有没有坏」;在 AI 系统里,评估还要回答「好了多少」。
为什么重要
AI 系统是概率性的。同一段输入,换个模型、改一句提示、调整一次温度,结果分布就会变化。
没有评估,你会陷入三种典型困境:
- 无法判断改动是否有效:改了提示词感觉好像好了一点——但这可能是随机波动。
- 无法发现回归:模型供应商更新了版本,你的系统悄悄变差了。
- 无法设定目标:不知道当前是 60% 还是 90%,也就不知道值不值得继续投入。
评估是 AI 工程里唯一能对抗「感觉」的工具。
三个层次
| 层次 | 做法 | 成本 | 适用于 |
|---|---|---|---|
| 断言式 | 检查格式、字段、关键词 | 低 | 结构化输出、格式约束 |
| 指标式 | 准确率、召回率、通过率 | 中 | 分类、检索、抽取 |
| 模型评判 | 用强模型按标准打分 | 中高 | 开放性生成 |
| 人工评审 | 人来判断 | 高 | 定标准、校准模型评判 |
务实的顺序是:先用断言,再上指标,模型评判只用在必要处,人工评审用来校准。
怎么开始
- 从失败案例收集任务。不要凭空构造测试集,从真实出错的地方开始。二十条就够启动。
- 写出判定标准。标准写不出来的任务,说明你自己也还没想清楚。
- 先跑基线。记录当前表现,之后所有对比都以它为准。
- 固定测试集。可以扩充,但不要为了通过而修改已有用例。
- 把它接进开发流程。每次改动都跑一遍。
容易被忽略的点
- 评估检索,不要只评估最终回答。RAG 系统的错误常出在召回环节,只看最终输出会掩盖问题。
- 评估成本也要纳入。准确率提升 2% 但成本翻倍,通常不划算。
- 记录失败样本。失败案例比总体分数更有价值。
- 定期重新校准。模型换代后,旧的判定标准可能已经失效。
常见误解
- 「评估就是跑 benchmark」:公开基准测的是模型,评估测的是你的系统。两者目标不同。
- 「用模型打分就够了」:模型评判有系统性偏好(偏爱长回答、偏爱自己风格的输出),必须用人工样本校准。
- 「系统还早,先不做评估」:越早开始越便宜。等到系统复杂了再补,成本会高得多。
延伸阅读
- Agent Harness:评估的接入点
- AI Workflows:评估能改进的对象