求职/免费讲义/串联知识
11 讲 · 串联知识

数据与指标:从回答质量到业务结果

读懂准确率、召回率、任务成功率、留存和延迟,避免把不同分母的数字直接比较。

下载本章 Markdown

与本章一起读的原文

个人面经AI 产品 · 业务一面 · Fauna_Blanc个人面经语音助手 · 策略产品 · Fauna_Blanc

讲义为教学整理;个人经验反映作者当时的情境。查看完整导读与资料目录 →

01每个指标都有分母和适用对象

“准确率 90%”需要补充:在什么数据上,评价什么对象,一条样本怎样判定。分类任务的准确率与生成答案的人工通过率不是同一概念。样本难度、比例和规则改变,也会让数值变化。

产品报告里还要区分用户、会话和任务。一个用户可能发起多次会话,一次会话可能包含多个任务。不同分母的解决率和留存率不能直接比较。

02把常见指标放回对象

选指标取决于具体目标;下面列出的是理解口径的起点。

指标在回答什么需要一起说明
精确率 / 召回率选出的结果有多准 / 应找到的找到了多少正类定义、阈值、样本分布
任务成功率任务是否达到事先定义的完成条件任务单位、部分成功规则、人工介入
激活 / 留存用户是否完成关键使用、是否再次回来人群、时间窗口、关键行为
延迟 / 吞吐一次响应有多慢 / 单位时间处理多少负载、输入输出长度、测量方式
成本完成一次请求或任务消耗多少资源失败调用、重试与工具费用是否计入

03一个数字如何产生误解

教学示例:版本 A 在 100 个简单问题上通过 90 个,版本 B 在 100 个包含复杂工具任务的问题上通过 80 个。不能直接得出 A 更好,因为样本不同。若两版在同一固定样本、同一规则下比较,才更容易解释版本差异。

再如平均延迟下降,但最慢的一部分请求仍让用户等待很久。只看平均数会遗漏长尾体验。要根据产品场景同时检查分布和关键类别,而不是一律增加指标。

04SQL、埋点和 A/B 实验分别做什么

埋点记录发生了什么,SQL 把记录汇总为口径一致的数据,实验设计帮助判断变化是否由某项改动引起。它们并不互相替代。记录缺失时,再复杂的查询也无法恢复没有收集的信息。

A/B 实验通常将可比用户分配到不同方案再观察差异;结果解释还涉及样本量、随机分配和业务环境。一个“上线前后”对比通常只是观察到变化,不足以单独说明因果。

来源与延伸阅读

正文为教学整理与分析。下列公开资料用于核对概念、产品能力和招聘入口;具体岗位条件以原公告为准。

Machine Learning Crash CourseGoogle · 英文

选读分类指标、过拟合、数据与生产系统;产品同学可先看概念,技术同学再看练习。

The SQL LanguagePostgreSQL · 英文

查询、连接、聚合是读懂用户行为和业务指标的基础;从小表理解口径。

Experimentation PlatformMicrosoft Research · 英文

了解在线对照实验的工作对象,认识产品改动与因果判断的区别。