# 评测详解：怎样判断 AI 真的做对了

> 从任务定义到样本、评分和实验，解释回答质量、执行结果与业务收益为什么需要分别观察。

适合阅读：参与 AI 效果判断的所有方向  
更新：2026-09-05

## 先定义“对”是什么意思

评测是把任务与判断标准固定下来，再观察系统在这些条件下的表现。知识问答可能关注事实是否有依据、适用条件是否完整；工单 Agent 还需要检查操作对象和实际结果；写作助手则可能关注要求遵循与编辑成本。任务不同，“正确”的含义也不同。

不要只记录一个笼统的满意度。把判断拆成具体维度后，才能知道改进方向。例如知识客服可以分别记录回答事实是否正确、引用是否支持结论、无依据时是否说明，以及用户是否完成后续办理。答案层面的成功不能替代业务层面的成功。

## 一条评测样本应包含哪些信息

样本不仅是一句提问，还应保留回答所需条件与判定依据。涉及制度版本时，要给定可使用的资料；涉及工具时，要说明初始状态和期望的最终状态。否则同一道题在不同环境中可能有不同答案，评分就会失去意义。

样本可以来自具有代表性的真实任务、已经出现的失败问题和人为设计的边界情况。真实任务要适当去除个人信息。边界样本用于检查重要行为，不应全部混入总体均值后冒充真实用户分布。

| 字段 | 知识客服教学示例 |
| --- | --- |
| 输入与条件 | 员工询问异地交通费；明确地区和日期 |
| 允许使用的资料 | 当前有效的交通费制度与地区补充条款 |
| 应覆盖的内容 | 金额、适用条件、出处与办理入口 |
| 不应出现的行为 | 套用另一地区标准或生成不存在的条款 |
| 评分方式 | 事实与条件人工核对；引用链接用程序检查 |
| 问题类别 | 跨地区、多文档条件组合 |

## 程序、人工与模型评分各有所长

程序适合判断明确规则，例如字段是否存在、链接是否可解析、最终工单负责人是否符合预期。人工适合处理需要业务理解或较细腻质量判断的样本。模型评分可以辅助比较大量文本，但也会受指令、样本表达和评分偏好影响，需要与人工判断对照。

同一个任务可以组合多种评分方式。工单摘要格式正确，可以由程序检查；是否遗漏最重要的问题，需要内容判断；转派是否成功，则应查询实际业务状态。只让另一个模型给出一个总分，会把这些不同层次混在一起。

## 怎样比较两个版本

比较模型、提示或检索配置时，应尽量使用相同样本、相同资料条件和清楚的评分规则。记录改动了什么，再看哪些问题改善、哪些问题退步。生成系统可能在重复运行中表现不同，因此关键任务不能仅凭一次漂亮回答下结论。

日常用来调提示的样本与最后评价的样本应区分。把测试题反复用于修改方案，会高估对陌生问题的适应能力。除总体结果外，还应按业务类型、资料长度或错误类别查看表现，否则一个常见类别的改善可能掩盖重要小类的退步。

## 离线质量与线上收益怎么连接

离线评测帮助比较固定任务的表现，线上观察帮助理解真实使用过程。要判断一个功能改动是否造成指标变化，需要考虑用户构成、时间、活动和流量来源等因素；上线前后两个数的差异，不自动等于改动带来的效果。

A/B 实验通常通过随机分配可比对象来比较方案，并提前定义主要指标、观察窗口和停止规则。实验期间频繁改变条件，会影响解释。分流比例明显偏离计划时，应先检查实验实施。即使某个业务指标改善，也需要同时关注错误回答、等待时间等相关结果，避免局部优化损害整体体验。

## 参考资料与出处

- [Demystifying evals for AI agents](https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents)（Anthropic）

- [Your AI Product Needs Evals](https://hamel.dev/blog/posts/evals/)（Hamel Husain）

- [LangSmith Evaluation](https://docs.langchain.com/langsmith/evaluation)（LangChain）

- [Cross-validation: evaluating estimator performance](https://scikit-learn.org/stable/modules/cross_validation.html)（scikit-learn）

- [Keys to successful experimentation](https://learn.microsoft.com/en-us/xbox/playfab/live-service-management/game-configuration/experiments/experimentation-keys)（Microsoft / PlayFab）

## 对应经验原帖

- [字节跳动数据运营日常实习面试](https://ac.nowcoder.com/discuss/433123)｜Camouflaged｜2020-05-28（编辑日期）｜数据运营 · 数据质量与标注标准

- [面试官视角聊聊，怎么准备AI大模型产品面试？](https://ac.nowcoder.com/discuss/1607778?type=0)｜武枫楠｜页面显示 01-28，未显示年份｜AI 产品 · 项目与业务讨论

- [百度文心一言AI产品面经](https://www.nowcoder.com/discuss/796074462360641536)｜Fauna_Blanc｜2025-09-12｜AI 产品 · 业务一面

- [字节面经-字节运营岗面经-01](https://api-cdn.nowcoder.com/discuss/924099496047280128?sourceSSR=enterprise)｜林小白zii｜页面显示 09-01；条目含 2026 年面试日期｜AI 数据、模型与服务运营 · 汇编

## 关联阅读

- [AI 运营：知识、标注与质量反馈怎样运转](https://cv.shujinxing777.com/career/handbook/operations-quality)

- [RAG 详解：从一份资料到一个有依据的回答](https://cv.shujinxing777.com/career/handbook/rag-design)

- [Agent 详解：模型怎样调用工具完成任务](https://cv.shujinxing777.com/career/handbook/agent-design)

- [数据与指标：从回答质量到业务结果](https://cv.shujinxing777.com/career/handbook/metrics)
