# 评测：让“效果好”有明确含义

> 区分模型评测、系统评测、离线评价和线上效果，理解样本、判定标准与错误分析。

适合阅读：五类岗位都需要的共同基础  
更新：2026-09-05

## 先确定评价对象

评测一个模型的回答能力，与评测一套客服系统能否解决用户问题，是不同任务。后者还受到知识库、工具、流程、界面和人工交接影响。评测对象不清楚，分数就很难被解释。

可以把一句“回答更好了”拆成事实是否正确、需求是否完整覆盖、引用是否支持结论、工具是否执行成功，以及用户问题是否真正解决。并非每个场景都需要同一组维度。

## 评测集与评分规则

评测集应包含常见场景，也要包含与产品相关的困难场景：信息不全、资料冲突、工具失败等。只使用容易回答的问题，会高估效果。来自真实使用的数据需在获得适当使用权限并处理个人信息后再使用。

判定规则应说明什么算正确、部分正确和失败，并提供例子。客观字段可以用确定性规则比较；复杂回答可以由人工或模型辅助判定，但模型评分也需要用人工样本核对，不能把评分器的输出当成天然标准。

## 把失败归到能处理的地方

教学示例：知识客服的十个失败回答，可以继续区分知识缺失、检索遗漏、证据误读、格式错误和工具故障。这里的数字只说明分类方法，不是实验结果。

| 失败类型 | 需要补看的材料 | 可能涉及的角色 |
| --- | --- | --- |
| 知识缺失 / 过期 | 资料版本、覆盖范围 | 运营、产品 |
| 检索未找到 | 查询和候选片段 | 算法、开发 |
| 有证据却答错 | 上下文与生成结果 | 算法、产品、评测 |
| 动作未完成 | 工具调用及返回 | 开发、产品 |
| 评分争议 | 评分说明与标注样例 | 运营、评测负责人 |

## 离线好，不一定线上好

离线评测使用固定样本，便于比较版本；线上使用会出现新的用户、输入和环境。离线准确率提高，仍可能伴随回答变慢、费用增加或操作步骤变多。线上业务指标则会受流量、渠道、季节等影响，不能简单归因于模型变化。

因此报告应同时说明评价对象、样本范围、判定规则、版本和限制。真实招聘中的“搭建评测体系”往往比做一张评分表更广，可能覆盖数据组织、标准、执行与问题回流。

## 参考资料与出处

- [Your AI Product Needs Evals](https://hamel.dev/blog/posts/evals/)（Hamel Husain）

- [Agent 评测漫谈](https://tech.meituan.com/2026/08/07/Agent-Evaluation.html)（美团技术团队）

- [LangSmith Evaluation](https://docs.langchain.com/langsmith/evaluation)（LangChain）

- [Cross-validation: evaluating estimator performance](https://scikit-learn.org/stable/modules/cross_validation.html)（scikit-learn）

- [Machine Learning Crash Course](https://developers.google.com/machine-learning/crash-course)（Google）

- [Experimentation Platform](https://www.microsoft.com/en-us/research/group/experimentation-platform-exp/)（Microsoft Research）

## 对应经验原帖

- [百度文心一言AI产品面经](https://www.nowcoder.com/discuss/796074462360641536)｜Fauna_Blanc｜2025-09-12｜AI 产品 · 业务一面

- [蚂蚁ai产品实习一面分享](https://www.nowcoder.com/feed/main/detail/50694c1390a54107bf36d180e4df2975)｜Ori12｜页面显示 05-01，未显示年份｜AI 产品 · 场景与评测

- [美团大模型产品转正实习面经（已offer）](https://www.nowcoder.com/feed/main/detail/2550761776d8461ab8aea206ff2db36f)｜美团专业内推官｜2025-03-25｜大模型产品 · 转正实习

- [字节面经-字节运营岗面经-01](https://api-cdn.nowcoder.com/discuss/924099496047280128?sourceSSR=enterprise)｜林小白zii｜页面显示 09-01；条目含 2026 年面试日期｜AI 数据、模型与服务运营 · 汇编

## 关联阅读

- [数据与指标：从回答质量到业务结果](https://cv.shujinxing777.com/career/handbook/metrics)

- [AI 运营：用户、数据与质量](https://cv.shujinxing777.com/career/handbook/operations)

- [RAG：从资料到有依据的回答](https://cv.shujinxing777.com/career/handbook/rag)

- [Agent、工作流与工具调用](https://cv.shujinxing777.com/career/handbook/agents)
