求职/免费讲义/串联知识
10 讲 · 串联知识

评测:让“效果好”有明确含义

区分模型评测、系统评测、离线评价和线上效果,理解样本、判定标准与错误分析。

下载本章 Markdown

与本章一起读的原文

方法 / 教程Your AI Product Needs Evals个人面经AI 产品 · 业务一面 · Fauna_Blanc个人面经AI 产品 · 场景与评测 · Ori12

讲义为教学整理;个人经验反映作者当时的情境。查看完整导读与资料目录 →

01先确定评价对象

评测一个模型的回答能力,与评测一套客服系统能否解决用户问题,是不同任务。后者还受到知识库、工具、流程、界面和人工交接影响。评测对象不清楚,分数就很难被解释。

可以把一句“回答更好了”拆成事实是否正确、需求是否完整覆盖、引用是否支持结论、工具是否执行成功,以及用户问题是否真正解决。并非每个场景都需要同一组维度。

02评测集与评分规则

评测集应包含常见场景,也要包含与产品相关的困难场景:信息不全、资料冲突、工具失败等。只使用容易回答的问题,会高估效果。来自真实使用的数据需在获得适当使用权限并处理个人信息后再使用。

判定规则应说明什么算正确、部分正确和失败,并提供例子。客观字段可以用确定性规则比较;复杂回答可以由人工或模型辅助判定,但模型评分也需要用人工样本核对,不能把评分器的输出当成天然标准。

03把失败归到能处理的地方

教学示例:知识客服的十个失败回答,可以继续区分知识缺失、检索遗漏、证据误读、格式错误和工具故障。这里的数字只说明分类方法,不是实验结果。

失败类型需要补看的材料可能涉及的角色
知识缺失 / 过期资料版本、覆盖范围运营、产品
检索未找到查询和候选片段算法、开发
有证据却答错上下文与生成结果算法、产品、评测
动作未完成工具调用及返回开发、产品
评分争议评分说明与标注样例运营、评测负责人

04离线好,不一定线上好

离线评测使用固定样本,便于比较版本;线上使用会出现新的用户、输入和环境。离线准确率提高,仍可能伴随回答变慢、费用增加或操作步骤变多。线上业务指标则会受流量、渠道、季节等影响,不能简单归因于模型变化。

因此报告应同时说明评价对象、样本范围、判定规则、版本和限制。真实招聘中的“搭建评测体系”往往比做一张评分表更广,可能覆盖数据组织、标准、执行与问题回流。

来源与延伸阅读

正文为教学整理与分析。下列公开资料用于核对概念、产品能力和招聘入口;具体岗位条件以原公告为准。

Your AI Product Needs EvalsHamel Husain · 英文

看房产助手 Lucy 如何把具体错误变成检查项,再区分程序检查、人工与模型评价、线上实验各自解决的问题。

Agent 评测漫谈美团技术团队 · 中文

理解系统级评测与过程观察,认识产品、研发、测试、运营为什么需要共同定义质量。

LangSmith EvaluationLangChain · 英文

看数据集、评分器、实验与线上评价的连接;区分人工、代码规则和模型评分。

Cross-validation: evaluating estimator performancescikit-learn · 英文

看训练集、验证集、测试集的分工,以及分组和时间相关数据的切分。

Machine Learning Crash CourseGoogle · 英文

选读分类指标、过拟合、数据与生产系统;产品同学可先看概念,技术同学再看练习。

Experimentation PlatformMicrosoft Research · 英文

了解在线对照实验的工作对象,认识产品改动与因果判断的区别。