第 10 讲 · 串联知识
评测:让“效果好”有明确含义
区分模型评测、系统评测、离线评价和线上效果,理解样本、判定标准与错误分析。
五类岗位都需要的共同基础更新 2026-09-05
与本章一起读的原文
方法 / 教程Your AI Product Needs Evals个人面经AI 产品 · 业务一面 · Fauna_Blanc个人面经AI 产品 · 场景与评测 · Ori12讲义为教学整理;个人经验反映作者当时的情境。查看完整导读与资料目录 →
01先确定评价对象
评测一个模型的回答能力,与评测一套客服系统能否解决用户问题,是不同任务。后者还受到知识库、工具、流程、界面和人工交接影响。评测对象不清楚,分数就很难被解释。
可以把一句“回答更好了”拆成事实是否正确、需求是否完整覆盖、引用是否支持结论、工具是否执行成功,以及用户问题是否真正解决。并非每个场景都需要同一组维度。
02评测集与评分规则
评测集应包含常见场景,也要包含与产品相关的困难场景:信息不全、资料冲突、工具失败等。只使用容易回答的问题,会高估效果。来自真实使用的数据需在获得适当使用权限并处理个人信息后再使用。
判定规则应说明什么算正确、部分正确和失败,并提供例子。客观字段可以用确定性规则比较;复杂回答可以由人工或模型辅助判定,但模型评分也需要用人工样本核对,不能把评分器的输出当成天然标准。
03把失败归到能处理的地方
教学示例:知识客服的十个失败回答,可以继续区分知识缺失、检索遗漏、证据误读、格式错误和工具故障。这里的数字只说明分类方法,不是实验结果。
| 失败类型 | 需要补看的材料 | 可能涉及的角色 |
|---|---|---|
| 知识缺失 / 过期 | 资料版本、覆盖范围 | 运营、产品 |
| 检索未找到 | 查询和候选片段 | 算法、开发 |
| 有证据却答错 | 上下文与生成结果 | 算法、产品、评测 |
| 动作未完成 | 工具调用及返回 | 开发、产品 |
| 评分争议 | 评分说明与标注样例 | 运营、评测负责人 |
04离线好,不一定线上好
离线评测使用固定样本,便于比较版本;线上使用会出现新的用户、输入和环境。离线准确率提高,仍可能伴随回答变慢、费用增加或操作步骤变多。线上业务指标则会受流量、渠道、季节等影响,不能简单归因于模型变化。
因此报告应同时说明评价对象、样本范围、判定规则、版本和限制。真实招聘中的“搭建评测体系”往往比做一张评分表更广,可能覆盖数据组织、标准、执行与问题回流。
来源与延伸阅读
正文为教学整理与分析。下列公开资料用于核对概念、产品能力和招聘入口;具体岗位条件以原公告为准。