求职/免费讲义/专题详解
22 讲 · 专题详解

评测详解:怎样判断 AI 真的做对了

从任务定义到样本、评分和实验,解释回答质量、执行结果与业务收益为什么需要分别观察。

下载本章 Markdown

01先定义“对”是什么意思

评测是把任务与判断标准固定下来,再观察系统在这些条件下的表现。知识问答可能关注事实是否有依据、适用条件是否完整;工单 Agent 还需要检查操作对象和实际结果;写作助手则可能关注要求遵循与编辑成本。任务不同,“正确”的含义也不同。

不要只记录一个笼统的满意度。把判断拆成具体维度后,才能知道改进方向。例如知识客服可以分别记录回答事实是否正确、引用是否支持结论、无依据时是否说明,以及用户是否完成后续办理。答案层面的成功不能替代业务层面的成功。

02一条评测样本应包含哪些信息

样本不仅是一句提问,还应保留回答所需条件与判定依据。涉及制度版本时,要给定可使用的资料;涉及工具时,要说明初始状态和期望的最终状态。否则同一道题在不同环境中可能有不同答案,评分就会失去意义。

样本可以来自具有代表性的真实任务、已经出现的失败问题和人为设计的边界情况。真实任务要适当去除个人信息。边界样本用于检查重要行为,不应全部混入总体均值后冒充真实用户分布。

字段知识客服教学示例
输入与条件员工询问异地交通费;明确地区和日期
允许使用的资料当前有效的交通费制度与地区补充条款
应覆盖的内容金额、适用条件、出处与办理入口
不应出现的行为套用另一地区标准或生成不存在的条款
评分方式事实与条件人工核对;引用链接用程序检查
问题类别跨地区、多文档条件组合

03程序、人工与模型评分各有所长

程序适合判断明确规则,例如字段是否存在、链接是否可解析、最终工单负责人是否符合预期。人工适合处理需要业务理解或较细腻质量判断的样本。模型评分可以辅助比较大量文本,但也会受指令、样本表达和评分偏好影响,需要与人工判断对照。

同一个任务可以组合多种评分方式。工单摘要格式正确,可以由程序检查;是否遗漏最重要的问题,需要内容判断;转派是否成功,则应查询实际业务状态。只让另一个模型给出一个总分,会把这些不同层次混在一起。

04怎样比较两个版本

比较模型、提示或检索配置时,应尽量使用相同样本、相同资料条件和清楚的评分规则。记录改动了什么,再看哪些问题改善、哪些问题退步。生成系统可能在重复运行中表现不同,因此关键任务不能仅凭一次漂亮回答下结论。

日常用来调提示的样本与最后评价的样本应区分。把测试题反复用于修改方案,会高估对陌生问题的适应能力。除总体结果外,还应按业务类型、资料长度或错误类别查看表现,否则一个常见类别的改善可能掩盖重要小类的退步。

05离线质量与线上收益怎么连接

离线评测帮助比较固定任务的表现,线上观察帮助理解真实使用过程。要判断一个功能改动是否造成指标变化,需要考虑用户构成、时间、活动和流量来源等因素;上线前后两个数的差异,不自动等于改动带来的效果。

A/B 实验通常通过随机分配可比对象来比较方案,并提前定义主要指标、观察窗口和停止规则。实验期间频繁改变条件,会影响解释。分流比例明显偏离计划时,应先检查实验实施。即使某个业务指标改善,也需要同时关注错误回答、等待时间等相关结果,避免局部优化损害整体体验。

参考资料与出处
Your AI Product Needs EvalsHamel Husain · 英文
LangSmith EvaluationLangChain · 英文
Keys to successful experimentationMicrosoft / PlayFab · 英文

经验材料

字节跳动数据运营日常实习面试Camouflaged · 2020-05-28(编辑日期) · 个人面经
面试官视角聊聊,怎么准备AI大模型产品面试?武枫楠 · 页面显示 01-28,未显示年份 · 求职复盘
百度文心一言AI产品面经Fauna_Blanc · 2025-09-12 · 个人面经
字节面经-字节运营岗面经-01林小白zii · 页面显示 09-01;条目含 2026 年面试日期 · 社区汇编