第 11 讲 · 串联知识
数据与指标:从回答质量到业务结果
读懂准确率、召回率、任务成功率、留存和延迟,避免把不同分母的数字直接比较。
需要阅读数据分析和效果报告的读者更新 2026-09-05
与本章一起读的原文
个人面经AI 产品 · 业务一面 · Fauna_Blanc个人面经语音助手 · 策略产品 · Fauna_Blanc讲义为教学整理;个人经验反映作者当时的情境。查看完整导读与资料目录 →
01每个指标都有分母和适用对象
“准确率 90%”需要补充:在什么数据上,评价什么对象,一条样本怎样判定。分类任务的准确率与生成答案的人工通过率不是同一概念。样本难度、比例和规则改变,也会让数值变化。
产品报告里还要区分用户、会话和任务。一个用户可能发起多次会话,一次会话可能包含多个任务。不同分母的解决率和留存率不能直接比较。
02把常见指标放回对象
选指标取决于具体目标;下面列出的是理解口径的起点。
| 指标 | 在回答什么 | 需要一起说明 |
|---|---|---|
| 精确率 / 召回率 | 选出的结果有多准 / 应找到的找到了多少 | 正类定义、阈值、样本分布 |
| 任务成功率 | 任务是否达到事先定义的完成条件 | 任务单位、部分成功规则、人工介入 |
| 激活 / 留存 | 用户是否完成关键使用、是否再次回来 | 人群、时间窗口、关键行为 |
| 延迟 / 吞吐 | 一次响应有多慢 / 单位时间处理多少 | 负载、输入输出长度、测量方式 |
| 成本 | 完成一次请求或任务消耗多少资源 | 失败调用、重试与工具费用是否计入 |
03一个数字如何产生误解
教学示例:版本 A 在 100 个简单问题上通过 90 个,版本 B 在 100 个包含复杂工具任务的问题上通过 80 个。不能直接得出 A 更好,因为样本不同。若两版在同一固定样本、同一规则下比较,才更容易解释版本差异。
再如平均延迟下降,但最慢的一部分请求仍让用户等待很久。只看平均数会遗漏长尾体验。要根据产品场景同时检查分布和关键类别,而不是一律增加指标。
04SQL、埋点和 A/B 实验分别做什么
埋点记录发生了什么,SQL 把记录汇总为口径一致的数据,实验设计帮助判断变化是否由某项改动引起。它们并不互相替代。记录缺失时,再复杂的查询也无法恢复没有收集的信息。
A/B 实验通常将可比用户分配到不同方案再观察差异;结果解释还涉及样本量、随机分配和业务环境。一个“上线前后”对比通常只是观察到变化,不足以单独说明因果。
来源与延伸阅读
正文为教学整理与分析。下列公开资料用于核对概念、产品能力和招聘入口;具体岗位条件以原公告为准。