# AI 实习求职专题讲义

---

更新：2026-09-05

---

从岗位分工、产品需求和运营质量，到 RAG、Agent、评测、研究实验与实习申请。

---

# 岗位分工：一个 AI 应用由谁完成

> 用知识客服串起产品、运营、Research、算法与开发，区分工作对象、交付物和岗位之间的联系。

适合阅读：第一次接触 AI 岗位的研究生  
更新：2026-09-05

## 两条线，分别对什么负责

AI 团队可以先按工作重心分成两条线：非技术线主要是产品与运营，技术线主要是 Research、算法与开发。这里的“非技术”指主要交付物不是模型训练或软件代码，并不意味着不需要理解技术。产品需要判断模型能力能否支持用户任务，运营需要理解数据、质量和反馈怎样影响系统。

一个面向员工的知识客服可以同时涉及五类工作：产品定义员工遇到什么问题、怎样获得答案；运营整理业务知识、维护评价规则；开发连接登录、检索和模型接口；算法改善召回和答案质量；Research 则可能研究新的检索或推理方法。具体团队不一定设置全部岗位，同一人也可能承担相邻工作。

![非技术线产品与运营、技术线 Research 算法与开发，共同完成知识客服的岗位协作图](https://cv.shujinxing777.com/career/handbook/images/ai-team-collaboration.png)

知识客服教学示例。图中界面、分数和监控数值用于说明工作对象，并非真实企业业绩。

## 产品与运营的分界，看改变了什么

产品工作的重心是决定系统应该提供什么能力，以及用户怎样使用。以“查报销规则”为例，需要明确适用员工、查询范围、资料出处、答案格式，以及问题涉及多个制度版本时的处理方式。需求文档、用户流程和交互原型服务于这些决定。

运营工作的重心是让业务内容、用户使用和质量过程持续运转。制度更新后哪些旧文档需要下线，员工反馈应该分到哪类，哪些问题需要交给业务专家复核，都可能属于运营工作。增长运营、内容运营与模型数据运营处理的对象不同，不能仅凭“运营”二字判断工作内容。

| 方向 | 主要对象 | 可见的工作结果 |
| --- | --- | --- |
| AI 应用产品 | 用户任务与功能规则 | 需求说明、流程、验收条件 |
| 平台产品 | 开发者或企业配置流程 | 接口与权限规则、管理台方案 |
| 策略产品 | 搜索、推荐或自动化决策 | 策略定义、实验与效果分析 |
| 产品 / 用户运营 | 使用流程与用户反馈 | 引导内容、行为分析、改进反馈 |
| 数据 / 模型运营 | 知识、标注、评价样本 | 分类规则、数据质量与复核记录 |

## Research、算法、开发各自回答的问题

Research 关心一个方法上的问题是否成立：例如，补充文档上下文能否改善某类检索错误，效果在什么条件下出现。它通常需要文献理解、方法实现和有解释力的实验。算法更接近给定任务的效果优化，例如选择表示模型、调整排序方式、训练分类器或分析误差。两者可能高度重叠，区别要结合招聘描述中的研究目标和交付要求判断。

开发关心能力怎样成为可以使用的系统。知识库怎样更新，用户怎样认证，多个请求怎样处理，工具返回错误时界面显示什么，都是实际工作。AI 应用开发仍可能考查数据库、网络、数据结构和代码质量；接通模型接口只是系统中的一环。AI Infra 则更靠近训练、推理资源与服务基础设施。

## 岗位名称相同，场景也可能完全不同

“AI 产品实习生”可能服务个人用户，也可能面向企业客户或公司内部员工。个人助手关注任务完成与使用体验；企业知识平台还涉及权限、数据接入和组织管理；内部提效工具需要理解员工原本的业务流程。C 端、B 端、内部应用是服务对象的划分，产品、算法、开发则是职责划分，这两组维度可以交叉。

读招聘说明时，可以用一句话还原岗位：“为谁，在什么场景，处理什么对象，产出什么结果。”例如“为企业员工设计知识问答流程，并组织问答质量验证”，与“训练检索模型提升专业文档召回”，虽然都涉及知识问答，工作的中心并不相同。

## 五类岗位怎样共享一条反馈

假设员工反馈：“系统给出的报销上限不对。”产品确认用户所在地区、问题含义与正确的交互规则；运营检查制度版本和适用范围；开发查看实际传入的查询条件与调用过程；算法检查检索候选和排序；如果现有方法长期无法处理某类条件约束，研究工作才进一步讨论方法改进。

因此，岗位之间并非完全不互通。理解共同链路可以帮助协作，但承担哪部分工作仍需要对应的经验。了解 RAG 概念可以帮助产品与开发沟通，并不自动等于具备检索模型训练经验。

## 参考资料与出处

- [User Needs + Defining Success](https://pair.withgoogle.com/chapter/user-needs/)（Google PAIR）

- [Framing an ML problem](https://developers.google.com/machine-learning/problem-framing/ml-framing)（Google for Developers）

- [Rules of Machine Learning](https://developers.google.com/machine-learning/guides/rules-of-ml)（Martin Zinkevich / Google）

- [Technical interviews](https://careers.microsoft.com/v2/global/en/hiring-tips/technical-interviewing.html)（Microsoft Careers）

- [CS336: Language Modeling from Scratch](https://cs336.stanford.edu/)（Stanford）

## 对应经验原帖

- [25实习历程](https://www.nowcoder.com/feed/main/detail/cc44a0e2afb64ee988d390f9a2be165f)｜zxxxxxr｜2024-06-19（编辑日期）｜产品与运营 · 多家公司投递记录

- [富途AI产品经理日常实习二面](https://www.nowcoder.com/feed/main/detail/34d7ed816cac425da58f4dd35210d913)｜刘下苍茫｜2025-05-22｜内部 AI 应用 · 日常实习

## 关联阅读

- [产品方案：从用户问题到可验收的功能](https://cv.shujinxing777.com/career/handbook/product-discovery)

- [AI 运营：知识、标注与质量反馈怎样运转](https://cv.shujinxing777.com/career/handbook/operations-quality)

- [研究与算法：把论文、训练和实验结果接起来](https://cv.shujinxing777.com/career/handbook/research-practice)

- [读懂 JD：条件、职责与技术词](https://cv.shujinxing777.com/career/handbook/read-jd)

---

# 产品方案：从用户问题到可验收的功能

> 把用户研究、AI 适用性、需求文档与产品指标接起来，完整拆解一个知识查询功能。

适合阅读：AI 产品、策略产品与产品运营方向  
更新：2026-09-05

## 先还原任务，而不是先选择模型

以员工查询报销制度为教学案例。表面的需求是“做一个能回答问题的机器人”，实际任务可能是“在提交申请前，确认这笔费用能否报销，以及需要什么材料”。两种表述决定了不同的功能范围：前者容易停在聊天界面，后者需要处理适用地区、费用类型、制度版本和后续办理入口。

理解需求时，先了解用户最近一次怎样完成任务：在哪里找资料，遇到了哪一步障碍，最终如何解决。访谈可以获得用户的理解、动机和经历，但不能仅凭“我会使用”推断真实使用行为。让用户操作现有流程或原型，可以进一步观察找不到入口、误解提示或不信任答案的具体位置。

## 需求记录需要保留条件

“资料不好找”还不够具体。更可用的描述是：“异地出差员工不知道应查总部制度还是当地补充规定，搜索结果没有展示适用地区，因此需要询问财务。”这段描述同时包含用户、场景、现有行为与障碍，才能推导出地区提示、资料标签或条件确认等方案。

访谈问题应尽量避免预设答案。比起问“你是不是需要一个 AI 助手”，询问“上次遇到这个问题时，你先做了什么”更容易得到具体经历。整理时把观察到的事实、用户自己的解释、产品团队的推测分别记录。少量访谈可以发现问题类型，但不能据此计算全部员工的需求比例。

## 什么时候需要 AI，什么时候需要规则

自然语言表达多样、需要理解长文或组合资料时，语言模型可能有帮助。明确的身份校验、金额计算、制度适用条件，则通常需要可靠的数据和业务规则。产品设计可以把两者组合：模型帮助理解问题和组织说明，业务系统提供实际可报销金额与申请状态。

下图把模型输出与最终决策分成两层。A、B、C 表示不同模型输出，X、Y、Z 表示应用采取的决策。对知识客服而言，模型识别出“报销咨询”后，应用仍需判断是否缺少地区信息、是否允许展示资料、是否需要进一步询问。

![Google 原图：模型输出 A B C 经过应用逻辑映射为决策 X Y Z](https://cv.shujinxing777.com/career/handbook/images/google-model-product.png)

模型输出与产品决策是不同层次。原图未修改；中文解释见正文。

[Google for Developers · Framing an ML problem，图 2](https://developers.google.com/machine-learning/problem-framing/ml-framing) · [CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)

## 把功能写到可以讨论与验收

一份需求说明至少应让协作者知道输入、处理规则、结果和异常情况。只有“接入大模型，提高问答准确率”，开发无法确定要实现什么，测试也无法判断是否完成。可以先针对一个明确场景写出规则，再讨论它是否适用于其他问题。

| 环节 | 知识客服示例 |
| --- | --- |
| 输入 | 员工问题、可用身份信息、地区与查询时间 |
| 信息不足 | 问题缺少适用地区时，先询问或明确答案的适用范围 |
| 回答 | 给出结论、条件、制度出处和下一步办理入口 |
| 资料冲突 | 展示差异并提交业务复核，不自行拼出一个新规则 |
| 权限 | 仅检索并展示该员工有权查看的资料 |
| 验收 | 用有依据、无依据、资料冲突等样本分别检查结果 |

## 产品结果与模型分数怎样连接

模型答对一道测试题，是系统质量的一部分；员工能否完成任务，是另一层结果。如果答案正确但入口难找、等待太久，产品仍可能不好用。可以分别观察任务解决情况、引用正确性、等待时间以及人工接入是否顺畅，不必强行把所有目标合成一个分数。

回答“为什么这样设计”时，可以按具体问题、观察依据、备选方案、取舍和验证方式展开。例如选用检索问答，是因为制度经常更新且需要展示出处；是否真正改善办事体验，还需通过实际任务测试和上线后的行为观察判断。这里的方案是教学案例，并不是某家公司已经取得的业务结果。

## 参考资料与出处

- [User Interviews 101](https://www.nngroup.com/articles/user-interviews/)（Maria Rosala、Kara Pernice / NN/g）

- [Usability Testing 101](https://www.nngroup.com/articles/usability-testing-101/)（Kate Moran / NN/g）

- [User Needs + Defining Success](https://pair.withgoogle.com/chapter/user-needs/)（Google PAIR）

- [Framing an ML problem](https://developers.google.com/machine-learning/problem-framing/ml-framing)（Google for Developers）

- [Human-AI eXperience Toolkit](https://www.microsoft.com/en-us/haxtoolkit/)（Microsoft）

## 对应经验原帖

- [面试官视角聊聊，怎么准备AI大模型产品面试？](https://ac.nowcoder.com/discuss/1607778?type=0)｜武枫楠｜页面显示 01-28，未显示年份｜AI 产品 · 项目与业务讨论

- [百度文心一言AI产品面经](https://www.nowcoder.com/discuss/796074462360641536)｜Fauna_Blanc｜2025-09-12｜AI 产品 · 业务一面

- [小米AI策略产品面经](https://www.nowcoder.com/feed/main/detail/60becb16810e411796bc6ccda6815b35)｜Fauna_Blanc｜2025-10-24｜语音助手 · 策略产品

## 关联阅读

- [岗位分工：一个 AI 应用由谁完成](https://cv.shujinxing777.com/career/handbook/ai-team-map)

- [RAG 详解：从一份资料到一个有依据的回答](https://cv.shujinxing777.com/career/handbook/rag-design)

- [数据与指标：从回答质量到业务结果](https://cv.shujinxing777.com/career/handbook/metrics)

- [评测详解：怎样判断 AI 真的做对了](https://cv.shujinxing777.com/career/handbook/evaluation-design)

---

# AI 运营：知识、标注与质量反馈怎样运转

> 区分用户运营、内容运营和模型数据运营，讲清资料维护、标注规则、分歧复核与问题定位。

适合阅读：AI 运营、数据运营与产品运营方向  
更新：2026-09-05

## 先看运营对象

运营并不是一个固定工作集合。用户运营关注谁在使用、为什么使用和在哪里流失；内容运营关注内容供给、分类与分发；数据运营可能负责样本组织、标注过程和数据质量；模型运营可能参与提示配置、输出评价和异常反馈。招聘说明中的业务对象，比岗位名是否包含“AI”更能说明日常工作。

以知识客服为例，发布使用说明属于用户引导，整理制度目录属于知识维护，给回答判定“有依据、部分有依据、无依据”属于质量评价。三者可以由同一团队承担，但涉及的规则和结果不同。运营需要把零散反馈变成可处理的信息，而不仅是汇总一个“用户不满意”的数量。

## 知识资料需要经历什么过程

一条资料从收集到被回答引用，至少要明确来源、适用对象、版本与当前有效性。原文中标题、表格脚注或地区限定如果丢失，系统可能检索到相关句子，却回答错适用条件。资料更新时还需要处理旧版，避免新旧规则同时被当作有效依据。

维护记录可以很朴素：资料名称、负责部门、适用地区、生效时间、访问权限、替代关系。分类要围绕业务问题，例如按费用类型和适用地区组织报销制度，而不是仅按 PDF、Word 等文件格式分类。发现重复内容时，应识别它是同一制度的副本，还是条件不同的补充规定。

## 一条可执行的标注规则长什么样

标签名需要配合判定条件。对于“回答有依据”，可以定义为：结论中的关键事实能在允许使用的材料中找到支持，且没有遗漏改变结论的前提。这样，“北京员工的上限是 500 元”就不能仅因为材料出现过“500 元”而被判为正确，还要核对地区、时间和费用类型。

标注说明通常包含标签定义、正例、反例和边界情况。先用少量具有代表性的样本试标，可以发现规则歧义。分歧可能来自规则不清、资料不足、专业判断不同或操作失误，处理方式也不同。仅要求标注人员“更认真”不能解决规则本身的问题。

| 样本情况 | 教学判定 | 复核重点 |
| --- | --- | --- |
| 结论与全部适用条件都有出处 | 有依据 | 引用是否确实支持结论 |
| 主要结论有依据，但遗漏地区限定 | 部分有依据 | 遗漏是否会误导用户 |
| 结论来自材料中不存在的制度 | 无依据 | 资料缺失还是模型自行补充 |
| 两个有效文件互相冲突 | 待业务复核 | 谁有权确定最终规则 |

## 一致率为什么不等于正确率

多人对同一批样本独立标注，可以帮助发现分歧。一致率较低时，要定位具体标签和样本；一致率较高，也可能是大家共享了同一种误解。因此，需要把一致性检查与业务专家复核、明确参考答案结合起来。多数人同意并不能自动证明某个制度解释正确。

复核结果应回到规则中：补充边界例子、修改标签定义、重新处理受影响样本。为评价系统准备的测试样本还需要与日常调试样本区分；如果不断根据测试题修改提示，最后的测试结果就不再能客观反映陌生问题表现。

## 把用户反馈变成可以处理的问题

收到“回答不好”时，先保留问题、实际答案、相关资料版本和问题类型，再判断发生在哪一环：没有正确资料、没有检索到、检索到了但解释错、答案正确但操作不便。前两类可能需要运营和检索开发共同处理，第三类需要检查生成过程，第四类通常还涉及产品交互。

运营汇总的价值在于解释问题结构。例如“近期未解决反馈主要集中在跨地区报销，现有知识缺少地区标签”，比一个总体满意度下降更容易指导改进。分类后仍应回看具体样本，避免同一个标签包住原因完全不同的问题。

## 参考资料与出处

- [How to measure inter-annotator agreement and build human consensus](https://labelstud.io/tutorials/how_to_measure_inter_annotator_agreement_and_build_human_consensus.html)（Label Studio / @hakan458）

- [Knowledge](https://docs.dify.ai/en/cloud/use-dify/knowledge/readme)（Dify）

- [Introducing Contextual Retrieval](https://www.anthropic.com/engineering/contextual-retrieval)（Anthropic）

- [Your AI Product Needs Evals](https://hamel.dev/blog/posts/evals/)（Hamel Husain）

- [LangSmith Evaluation](https://docs.langchain.com/langsmith/evaluation)（LangChain）

## 对应经验原帖

- [字节跳动数据运营日常实习面试](https://ac.nowcoder.com/discuss/433123)｜Camouflaged｜2020-05-28（编辑日期）｜数据运营 · 数据质量与标注标准

- [字节数据运营面经](https://www.nowcoder.com/discuss/796319639306248192?sourceSSR=dynamic)｜ButtercupGlimmer｜2025-09-13｜数据运营 · 业务分析

- [字节面经-字节运营岗面经-01](https://api-cdn.nowcoder.com/discuss/924099496047280128?sourceSSR=enterprise)｜林小白zii｜页面显示 09-01；条目含 2026 年面试日期｜AI 数据、模型与服务运营 · 汇编

## 关联阅读

- [岗位分工：一个 AI 应用由谁完成](https://cv.shujinxing777.com/career/handbook/ai-team-map)

- [RAG 详解：从一份资料到一个有依据的回答](https://cv.shujinxing777.com/career/handbook/rag-design)

- [评测详解：怎样判断 AI 真的做对了](https://cv.shujinxing777.com/career/handbook/evaluation-design)

- [数据与指标：从回答质量到业务结果](https://cv.shujinxing777.com/career/handbook/metrics)

---

# RAG 详解：从一份资料到一个有依据的回答

> 连接文档解析、切分、召回、重排、生成与引用，理解为什么“上传了资料”仍然可能答错。

适合阅读：产品、运营和 AI 应用开发方向  
更新：2026-09-05

## 一次问答背后有两条流程

RAG 是检索增强生成：在回答问题前，从外部资料中找出相关内容，再让模型结合这些内容组织答案。可以把它分成资料准备与在线问答两条流程。前者负责把资料变成可检索的对象，后者负责针对当前问题取出合适依据。

以知识客服为例，员工提问时不会重新解析所有制度文件。系统通常先保存已经处理好的片段与索引；收到问题后，再查找候选、挑选上下文并生成答案。资料是否有效、用户是否有访问权限，需要贯穿这一过程。

![RAG 知识客服流程：资料与权限、解析切分、保留标题版本、建立索引；用户提问、检索、重排、生成、引用反馈](https://cv.shujinxing777.com/career/handbook/images/rag-service-chain.png)

知识客服教学链路。下方三类问题分别对应资料检索、答案生成和使用体验。

## 解析与切分决定检索对象

解析是把 PDF、网页或表格中的内容转成可处理的结构；切分是把内容组织成检索单元。它们不是简单删除格式。表格的行列关系、段落所属标题、注释和适用条件，都可能改变句子的含义。

片段过短，可能只剩“上限为 500 元”却丢了地区和时间；片段过长，则可能包含大量无关内容。切分长度没有通用最优值，需要结合文档结构和实际问题检查。对制度类材料，保留标题、版本、地区和章节信息，往往比单纯增加片段数量更有意义。

## 召回与重排解决不同问题

关键词检索擅长找到具体术语、编号和原文用词；向量检索通过表示相近程度寻找语义相关内容。当员工使用口语表达，而制度采用正式术语时，向量检索可能有帮助；当查询包含精确条款编号时，关键词匹配仍然重要。两者可以组合，但组合方式也要通过具体问题检验。

召回先取出一批候选；重排再更细致地比较“这个问题与这个片段是否相关”，确定优先给模型哪些内容。联合处理查询和候选的重排模型通常比独立向量比较更耗计算，因此常用于较小候选集合。重排无法恢复根本没有进入候选集合的正确资料。

## 有引用不等于回答有依据

检索到片段后，应用仍要组织上下文、提出回答要求并处理资料不足。模型可能遗漏条件，也可能把多个文件中互不适用的句子拼在一起。引用应支持结论中的具体事实，而不是在答案末尾随便附一个相关链接。

如果问“今年异地出差可以报多少”，资料只说明本地交通费标准，就不能据此推断全部出差费用。合理的结果可能是明确适用范围、询问缺失条件，或说明现有资料不足。检索增强提高了使用外部依据的可能性，但不提供答案必然正确的保证。

| 观察到的问题 | 先检查 | 可能的改进 |
| --- | --- | --- |
| 没有检索到应有制度 | 资料是否存在、解析是否完整、候选是否命中 | 补资料、保留结构、改查询或召回方式 |
| 候选有答案，最终上下文没有 | 排序与截断位置 | 调整重排或上下文组织 |
| 上下文有正确依据，回答仍错 | 遗漏条件、冲突材料、生成要求 | 明确适用条件并加入对应评测 |
| 答案正确但用户没有办成事 | 解释、入口、等待与后续步骤 | 优化交互和办理衔接 |

## RAG 与微调怎样选择

RAG 主要改变一次回答可使用的外部上下文；微调通过训练改变模型参数。经常更新、需要展示出处的业务知识，通常首先需要可靠的资料与检索链路。固定输出格式、特定任务行为或领域能力适配，则可能涉及微调。二者可以结合，不是必须二选一。

遇到效果问题时，应先定位问题所在。如果源文件已经过期，训练更多轮并不能补出正确的最新制度；如果候选排序持续出错，则应研究检索与排序，而不是只改聊天提示。能够沿资料、候选、上下文、答案逐段解释错误，是理解 RAG 的核心。

## 参考资料与出处

- [Introducing Contextual Retrieval](https://www.anthropic.com/engineering/contextual-retrieval)（Anthropic）

- [Retrieve & Re-Rank](https://sbert.net/examples/sentence_transformer/applications/retrieve_rerank/)（Sentence Transformers）

- [Semantic Search](https://www.sbert.net/examples/sentence_transformer/applications/semantic-search/README.html)（Sentence Transformers）

- [动手学大模型应用开发](https://github.com/datawhalechina/llm-universe)（Datawhale）

- [LLM Course](https://huggingface.co/learn/llm-course/chapter1/1)（Hugging Face）

## 对应经验原帖

- [面试官视角聊聊，怎么准备AI大模型产品面试？](https://ac.nowcoder.com/discuss/1607778?type=0)｜武枫楠｜页面显示 01-28，未显示年份｜AI 产品 · 项目与业务讨论

- [富途AI产品经理日常实习二面](https://www.nowcoder.com/feed/main/detail/34d7ed816cac425da58f4dd35210d913)｜刘下苍茫｜2025-05-22｜内部 AI 应用 · 日常实习

- [美团大模型产品转正实习面经（已offer）](https://www.nowcoder.com/feed/main/detail/2550761776d8461ab8aea206ff2db36f)｜美团专业内推官｜2025-03-25｜大模型产品 · 转正实习

## 关联阅读

- [AI 运营：知识、标注与质量反馈怎样运转](https://cv.shujinxing777.com/career/handbook/operations-quality)

- [Agent 详解：模型怎样调用工具完成任务](https://cv.shujinxing777.com/career/handbook/agent-design)

- [评测详解：怎样判断 AI 真的做对了](https://cv.shujinxing777.com/career/handbook/evaluation-design)

- [产品方案：从用户问题到可验收的功能](https://cv.shujinxing777.com/career/handbook/product-discovery)

---

# Agent 详解：模型怎样调用工具完成任务

> 用查询工单的案例区分普通问答、固定工作流和 Agent，解释工具、状态、权限与任务结束条件。

适合阅读：AI 产品、开发与算法方向  
更新：2026-09-05

## 从回答问题到改变系统状态

“请解释工单优先级”可以通过资料问答完成；“找到我负责的紧急工单并整理摘要”需要查询业务系统；“把其中一条转给同事”还会改变系统状态。三种任务的要求不同，不能只因为界面都是聊天框，就认为它们是同一种能力。

工作流预先组织步骤和分支，例如识别工单编号、查询详情、生成摘要。Agent 则可以根据当前任务与执行反馈选择下一步行动。是否需要动态选择，取决于任务：输入输出清楚、流程稳定时，固定工作流通常更容易理解与控制。

## 工具调用究竟发生了什么

工具是应用提供给模型使用的外部能力，例如查询工单、读取日历或创建草稿。模型通常提出工具名称和参数，由应用代码检查并执行，随后把结果交回模型。模型说“已经修改”并不表示业务接口真的成功，最终结果应以系统返回和实际状态为准。

一个“查询工单”工具需要说明可查询字段、参数格式、权限范围以及找不到记录时的返回方式。工具描述越贴近真实业务对象，越容易让系统选择合适动作。工具返回的数据也要区分正文、状态与错误，不能把一段失败提示当成查到的业务事实。

| 阶段 | 教学案例中的实际内容 |
| --- | --- |
| 用户任务 | 整理我负责的未关闭紧急工单 |
| 工具请求 | 按当前用户、紧急程度和状态筛选工单 |
| 应用执行 | 检查登录身份，调用工单查询接口 |
| 工具结果 | 返回允许访问的工单记录与查询状态 |
| 模型整理 | 归纳工单主题、负责人和待办事项 |
| 用户确认 | 若继续请求转派，展示具体对象和操作后再执行 |

## 上下文、状态和记忆不是同一件事

上下文是模型这次调用实际看到的信息；状态是任务当前已完成哪些步骤、获得哪些结果；记忆通常指跨轮次或跨会话保留的信息。把全部聊天记录永久拼进提示，并不能自动得到可靠记忆，还可能保留已经过期的条件。

例如用户先要求查询全部工单，随后补充“只看我负责的”。应用需要更新有效筛选条件，而不是让旧条件与新条件并列竞争。已查询到的工单编号、尚未执行的操作、用户最后确认的对象，可以作为明确状态保存。哪些信息应长期保留，则要看业务需要与用户授权。

## 任务什么时候算完成

查询类任务完成，意味着所需信息已经取得并向用户说明；修改类任务完成，则需要业务状态真的改变。评价 Agent 不能只看最终回答是否流畅，还要看工具是否选对、参数是否正确、必要步骤是否执行。

系统还要定义正常停止条件：任务已完成、需要用户补充信息、权限不足或无法继续。对于写入、发送、删除等操作，确认对象与范围尤其重要。工具接口的权限由应用控制，不能因为模型在文本中声称获得授权就扩大权限。

## 为什么增加 Agent 数量不一定更好

多个 Agent 可以分担相对独立的工作，但也会增加信息传递、协调和检查成本。如果一个固定查询加一次摘要就能完成任务，拆成多个角色不一定带来收益。比较方案时，需要同时观察任务结果、执行时间、调用成本与可定位性。

分析失败案例时，可以沿“理解任务—选工具—填参数—执行—解释结果”逐段定位。工具返回正确而摘要遗漏关键工单，与工具根本查错负责人，是两种不同错误。这样的区分能帮助产品决定规则、开发修改接口，也能帮助算法团队选择需要优化的部分。

## 参考资料与出处

- [Building effective agents](https://www.anthropic.com/engineering/building-effective-agents)（Anthropic）

- [Demystifying evals for AI agents](https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents)（Anthropic）

- [LLM Powered Autonomous Agents](https://lilianweng.github.io/posts/2023-06-23-agent/)（Lilian Weng）

- [MCP Architecture](https://modelcontextprotocol.io/docs/learn/architecture)（Model Context Protocol）

- [Hello-Agents：从零开始构建智能体](https://github.com/datawhalechina/hello-agents)（Datawhale / 陈思州、孙韬等贡献者）

## 对应经验原帖

- [面经](https://www.nowcoder.com/feed/main/detail/aca039781c9246b2a641bc3154f7c276?sourceSSR=dynamic)｜Showieee｜页面显示 09-02；面试写为 9.1，未显示年份｜雷鸟创新 · 软件开发实习

## 关联阅读

- [RAG 详解：从一份资料到一个有依据的回答](https://cv.shujinxing777.com/career/handbook/rag-design)

- [评测详解：怎样判断 AI 真的做对了](https://cv.shujinxing777.com/career/handbook/evaluation-design)

- [AI 开发：把模型接入真实系统](https://cv.shujinxing777.com/career/handbook/engineering)

- [产品方案：从用户问题到可验收的功能](https://cv.shujinxing777.com/career/handbook/product-discovery)

---

# 评测详解：怎样判断 AI 真的做对了

> 从任务定义到样本、评分和实验，解释回答质量、执行结果与业务收益为什么需要分别观察。

适合阅读：参与 AI 效果判断的所有方向  
更新：2026-09-05

## 先定义“对”是什么意思

评测是把任务与判断标准固定下来，再观察系统在这些条件下的表现。知识问答可能关注事实是否有依据、适用条件是否完整；工单 Agent 还需要检查操作对象和实际结果；写作助手则可能关注要求遵循与编辑成本。任务不同，“正确”的含义也不同。

不要只记录一个笼统的满意度。把判断拆成具体维度后，才能知道改进方向。例如知识客服可以分别记录回答事实是否正确、引用是否支持结论、无依据时是否说明，以及用户是否完成后续办理。答案层面的成功不能替代业务层面的成功。

## 一条评测样本应包含哪些信息

样本不仅是一句提问，还应保留回答所需条件与判定依据。涉及制度版本时，要给定可使用的资料；涉及工具时，要说明初始状态和期望的最终状态。否则同一道题在不同环境中可能有不同答案，评分就会失去意义。

样本可以来自具有代表性的真实任务、已经出现的失败问题和人为设计的边界情况。真实任务要适当去除个人信息。边界样本用于检查重要行为，不应全部混入总体均值后冒充真实用户分布。

| 字段 | 知识客服教学示例 |
| --- | --- |
| 输入与条件 | 员工询问异地交通费；明确地区和日期 |
| 允许使用的资料 | 当前有效的交通费制度与地区补充条款 |
| 应覆盖的内容 | 金额、适用条件、出处与办理入口 |
| 不应出现的行为 | 套用另一地区标准或生成不存在的条款 |
| 评分方式 | 事实与条件人工核对；引用链接用程序检查 |
| 问题类别 | 跨地区、多文档条件组合 |

## 程序、人工与模型评分各有所长

程序适合判断明确规则，例如字段是否存在、链接是否可解析、最终工单负责人是否符合预期。人工适合处理需要业务理解或较细腻质量判断的样本。模型评分可以辅助比较大量文本，但也会受指令、样本表达和评分偏好影响，需要与人工判断对照。

同一个任务可以组合多种评分方式。工单摘要格式正确，可以由程序检查；是否遗漏最重要的问题，需要内容判断；转派是否成功，则应查询实际业务状态。只让另一个模型给出一个总分，会把这些不同层次混在一起。

## 怎样比较两个版本

比较模型、提示或检索配置时，应尽量使用相同样本、相同资料条件和清楚的评分规则。记录改动了什么，再看哪些问题改善、哪些问题退步。生成系统可能在重复运行中表现不同，因此关键任务不能仅凭一次漂亮回答下结论。

日常用来调提示的样本与最后评价的样本应区分。把测试题反复用于修改方案，会高估对陌生问题的适应能力。除总体结果外，还应按业务类型、资料长度或错误类别查看表现，否则一个常见类别的改善可能掩盖重要小类的退步。

## 离线质量与线上收益怎么连接

离线评测帮助比较固定任务的表现，线上观察帮助理解真实使用过程。要判断一个功能改动是否造成指标变化，需要考虑用户构成、时间、活动和流量来源等因素；上线前后两个数的差异，不自动等于改动带来的效果。

A/B 实验通常通过随机分配可比对象来比较方案，并提前定义主要指标、观察窗口和停止规则。实验期间频繁改变条件，会影响解释。分流比例明显偏离计划时，应先检查实验实施。即使某个业务指标改善，也需要同时关注错误回答、等待时间等相关结果，避免局部优化损害整体体验。

## 参考资料与出处

- [Demystifying evals for AI agents](https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents)（Anthropic）

- [Your AI Product Needs Evals](https://hamel.dev/blog/posts/evals/)（Hamel Husain）

- [LangSmith Evaluation](https://docs.langchain.com/langsmith/evaluation)（LangChain）

- [Cross-validation: evaluating estimator performance](https://scikit-learn.org/stable/modules/cross_validation.html)（scikit-learn）

- [Keys to successful experimentation](https://learn.microsoft.com/en-us/xbox/playfab/live-service-management/game-configuration/experiments/experimentation-keys)（Microsoft / PlayFab）

## 对应经验原帖

- [字节跳动数据运营日常实习面试](https://ac.nowcoder.com/discuss/433123)｜Camouflaged｜2020-05-28（编辑日期）｜数据运营 · 数据质量与标注标准

- [面试官视角聊聊，怎么准备AI大模型产品面试？](https://ac.nowcoder.com/discuss/1607778?type=0)｜武枫楠｜页面显示 01-28，未显示年份｜AI 产品 · 项目与业务讨论

- [百度文心一言AI产品面经](https://www.nowcoder.com/discuss/796074462360641536)｜Fauna_Blanc｜2025-09-12｜AI 产品 · 业务一面

- [字节面经-字节运营岗面经-01](https://api-cdn.nowcoder.com/discuss/924099496047280128?sourceSSR=enterprise)｜林小白zii｜页面显示 09-01；条目含 2026 年面试日期｜AI 数据、模型与服务运营 · 汇编

## 关联阅读

- [AI 运营：知识、标注与质量反馈怎样运转](https://cv.shujinxing777.com/career/handbook/operations-quality)

- [RAG 详解：从一份资料到一个有依据的回答](https://cv.shujinxing777.com/career/handbook/rag-design)

- [Agent 详解：模型怎样调用工具完成任务](https://cv.shujinxing777.com/career/handbook/agent-design)

- [数据与指标：从回答质量到业务结果](https://cv.shujinxing777.com/career/handbook/metrics)

---

# 研究与算法：把论文、训练和实验结果接起来

> 解释研究问题、基线、数据切分、微调和误差分析，让技术经历能够被完整理解。

适合阅读：Research、算法及希望了解训练链路的开发方向  
更新：2026-09-05

## 研究从可回答的问题开始

“做大模型”是领域名称，不是一个可以直接验证的研究问题。更具体的问题可能是：在某类长文档查询中，给检索片段补充章节上下文，是否能减少条件遗漏？这个问题需要说明任务、数据、比较方法与评价标准，才能设计实验。

阅读论文时，可以沿问题、方法、比较、结果与限制梳理。方法的名称有助于交流，但真正重要的是它改变了哪一步、解决了什么假设下的问题。研究实习常需要把这种理解进一步落实为实验；算法实习可能更侧重既定任务中的实际效果优化。

## 基线与对照为什么重要

基线是比较的参照，可以是简单规则、已有模型或当前系统。一个复杂方法的结果不错，并不能说明复杂部分有用，仍需比较相称的方案。如果新方法使用更多数据、更长输入或更多计算，应说明这些变化，否则难以解释收益来自哪里。

消融实验通过改变某个组成部分观察影响。例如比较“原检索”“补充上下文的检索”“补充上下文并重排”，可以帮助区分两项改动的作用。实验不只是追求最高分，还用于判断方法在什么条件下有效，失败样本又说明了什么。

## 数据切分发生在训练之前

训练集用于学习参数，验证集用于选方案，测试集用于最终评价。预处理也可能泄漏信息：如果先用全部数据选择特征、计算标准化参数，再划分训练与测试，测试信息已经影响了模型建设。需要从训练数据学习的变换，应在训练部分拟合，再应用到其他部分。

同一用户、同一文档的相似片段或连续时间记录之间可能相关。随机拆行不一定能模拟真实使用场景。应根据任务判断按用户、文档或时间划分是否更合理，并清楚说明评价的是新样本、新用户还是未来时间的数据。

| 过程 | 需要说明的内容 |
| --- | --- |
| 数据准备 | 样本来自哪里，标签怎样得到，是否包含近重复内容 |
| 训练 | 基础模型、输入输出、优化目标与可训练参数 |
| 选择方案 | 依据哪个验证集和指标进行比较 |
| 最终评价 | 测试条件、指标定义和主要失败类别 |
| 结果解释 | 哪些结论由实验支持，哪些场景尚未覆盖 |

## SFT、LoRA 与 RAG 的关系

监督微调（SFT）使用输入与目标输出等监督样本继续训练模型。LoRA 是一种参数高效适配方法：通常冻结基础权重，学习较小的低秩更新矩阵，以减少需要训练的参数。它描述“怎样更新参数”，而 SFT 描述训练任务与监督方式，两者可以同时使用。

RAG 则侧重回答时检索外部材料，通常不在该步骤更新模型参数。因此“做了 LoRA”并不能说明训练数据怎样构造，“用了 RAG”也不能说明检索质量如何。介绍技术方案时，要分别解释数据、模型、训练或检索流程，以及评价方式。

## 结果需要回到错误与使用条件

总体指标可能掩盖不同问题。例如检索平均效果提升，但对制度编号的精确查询变差；模型回答更完整，却产生更长等待。误差分析需要把结果回到具体样本和任务条件，而不是只列一个提升百分比。

解释一段研究或算法经历，可以按照“研究问题—数据与基线—本人实现—实验观察—失败原因”展开。若工作基于公开代码，应说明自己修改的部分；若只完成复现，也可以清楚讲出复现条件与发现。能解释一个不理想的实验为何不支持假设，通常比只展示最好一次结果更有内容。

## 参考资料与出处

- [CS336: Language Modeling from Scratch](https://cs336.stanford.edu/)（Stanford）

- [CS224N: Natural Language Processing with Deep Learning](https://web.stanford.edu/class/cs224n/)（Stanford / 2026 课程团队）

- [Common pitfalls and recommended practices](https://scikit-learn.org/stable/common_pitfalls.html)（scikit-learn）

- [Cross-validation: evaluating estimator performance](https://scikit-learn.org/stable/modules/cross_validation.html)（scikit-learn）

- [LoRA](https://huggingface.co/docs/peft/main/conceptual_guides/lora)（Hugging Face / PEFT）

- [Rules of Machine Learning](https://developers.google.com/machine-learning/guides/rules-of-ml)（Martin Zinkevich / Google）

- [Introduction to Machine Learning Interviews Book](https://huyenchip.com/ml-interviews-book/)（Chip Huyen）

## 对应经验原帖

- [百度大模型算法实习生 一面](https://www.nowcoder.com/feed/main/detail/e90de24cd51f42918df7044adb34fbaf)｜长行莫倦｜2025-08-22｜大模型算法 · 实习一面

- [整理下近期的大模型日常实习面经](https://www.nowcoder.com/feed/main/detail/44b2baec47c740c4b9bccb8a013abd56)｜大模型丁真｜2025-05-07｜字节、百度、快手 · 多场实习复盘

## 关联阅读

- [岗位分工：一个 AI 应用由谁完成](https://cv.shujinxing777.com/career/handbook/ai-team-map)

- [AI 算法：数据、模型与任务效果](https://cv.shujinxing777.com/career/handbook/algorithms)

- [评测详解：怎样判断 AI 真的做对了](https://cv.shujinxing777.com/career/handbook/evaluation-design)

- [寻找实习：从招聘信息到面试问题](https://cv.shujinxing777.com/career/handbook/internship-process)

---

# 寻找实习：从招聘信息到面试问题

> 解释实习渠道、JD 阅读、投递条件和项目追问，将信息检索与已有经历连接起来。

适合阅读：准备申请第一段 AI 实习的硕士生  
更新：2026-09-05

## 先识别招聘项目和实际条件

日常实习、暑期实习和面向特定毕业批次的实习项目，可能具有不同的申请范围与安排。职位标题中的“实习”不能替代毕业时间、到岗日期、每周出勤和连续实习时长等条件。研究生还需要考虑课程、课题组安排与所在地，这些信息会影响是否能够实际到岗。

招聘官网用于确认职位与条件；学校就业平台、实验室公告、企业公开账号和社区帖子可以帮助发现机会。发现岗位后，应落到具体公司、团队、职位编号和公告日期。历史帖子仍可帮助理解职责，但不代表现在仍有名额。

## 岗位搜索要组合职责和对象

仅搜索“AI 实习”容易把不同工作混在一起。产品可以组合应用、平台、策略、智能体等词；运营可以组合内容、用户、数据、模型、标注或评测；技术线可以组合研究、NLP、多模态、检索、推荐、应用开发、推理或基础设施。搜索词是发现信息的方法，不是对岗位的最终分类。

把搜索结果读成一句具体工作描述：“在什么团队，为谁，处理什么问题，交付什么结果。”尤其要留意同名职位在不同业务线的差异。搜索结果没有解释清楚的部分，可以在招聘沟通中确认，例如是否偏数据标注组织、是否需要长期训练实验、是否涉及后端业务开发。

## JD 的三类内容分别怎样看

职责说明入职后可能处理的工作；任职要求说明筛选与工作所需条件；加分项说明团队可能优先考虑的经历。不要把每个名词都理解成同等权重，也不要把“了解”自动改写成“必须精通”。关键是看动作和对象之间的联系。

| 招聘表述示例 | 主要含义 | 可联系的经历 |
| --- | --- | --- |
| 参与需求调研与原型设计 | 理解用户任务并表达方案 | 访谈、流程、原型与方案取舍 |
| 构建评测集并分析问题 | 定义质量并定位失败 | 样本组织、评分规则与误差分类 |
| 负责模型训练与优化 | 处理数据并改善模型表现 | 训练实现、对照实验与指标解释 |
| 实现 Agent 业务接口 | 把模型行动接入真实系统 | 接口、状态管理、权限和测试 |
| 维护知识与标注质量 | 持续处理资料与规则 | 版本分类、边界规则与复核过程 |

## 面试追问为什么会从项目一直问下去

一个项目名称只能提供入口，不能说明实际参与深度。面试讨论往往需要还原问题为什么存在、采取过哪些方案、本人做了哪一段、结果怎样测量。产品方向可以从用户问题与功能取舍展开；运营方向可以从数据规则与反馈处理展开；技术方向则需要解释实现、实验或系统行为。

例如介绍知识客服时，回答“用了向量库和大模型”只说明组件。进一步需要解释资料怎么来、为什么这样切分、哪些问题没有检索到、评价样本如何准备，以及是否真的帮助完成任务。这里提供的是问题分析方式，具体面试轮次和题目仍随团队变化。

## 怎样组织回答与反问

一个清楚的回答可以先交代任务和约束，再解释本人采取的行动，最后说明结果与尚未解决的问题。讨论方案时，先澄清输入、输出与条件；编码题则需要解释思路、实现和测试。遇到未做过的部分，可以区分已有实践与现场推理，让对方知道哪些是经历、哪些是分析。

反问可以围绕实际工作展开：实习生主要参与哪条业务链路，产品与算法怎样协作，数据和评测由谁维护，入职后主要交付什么，以及团队预期的出勤与时间安排。这样的信息有助于判断工作内容，而不是只看公司名称。投递记录保留职位、渠道、日期、状态和沟通结论即可，便于后续核对。

## 参考资料与出处

- [字节跳动校园招聘](https://jobs.bytedance.com/campus)（字节跳动）

- [字节跳动校园招聘常见问题](https://jobs.bytedance.com/campus/page-6272Gc?spread=49TMNMC)（字节跳动）

- [百度实习职位列表](https://talent.baidu.com/jobs/list?recruitType=INTERN)（百度）

- [Seed Early Career](https://seed.bytedance.com/zh/seedearlycareer)（字节跳动 Seed）

- [Technical interviews](https://careers.microsoft.com/v2/global/en/hiring-tips/technical-interviewing.html)（Microsoft Careers）

- [Introduction to Machine Learning Interviews Book](https://huyenchip.com/ml-interviews-book/)（Chip Huyen）

## 对应经验原帖

- [面试官视角聊聊，怎么准备AI大模型产品面试？](https://ac.nowcoder.com/discuss/1607778?type=0)｜武枫楠｜页面显示 01-28，未显示年份｜AI 产品 · 项目与业务讨论

- [25实习历程](https://www.nowcoder.com/feed/main/detail/cc44a0e2afb64ee988d390f9a2be165f)｜zxxxxxr｜2024-06-19（编辑日期）｜产品与运营 · 多家公司投递记录

- [26届秋招字节后端二+三面速通面经详细版（附timeline）](https://ac.nowcoder.com/discuss/1554249?type=0)｜嵐jlu｜2025-10-09｜后端开发 · 校招流程复盘

## 关联阅读

- [岗位分工：一个 AI 应用由谁完成](https://cv.shujinxing777.com/career/handbook/ai-team-map)

- [读懂 JD：条件、职责与技术词](https://cv.shujinxing777.com/career/handbook/read-jd)

- [把经历说清楚：简历与面试资料](https://cv.shujinxing777.com/career/handbook/resume-interview)

- [研究与算法：把论文、训练和实验结果接起来](https://cv.shujinxing777.com/career/handbook/research-practice)

---

# 经验原帖索引

整理日期：2026-09-05

## 字节跳动数据运营日常实习面试

作者：Camouflaged  
时间：2020-05-28（编辑日期）  
背景：数据运营 · 数据质量与标注标准 · 实习 · 个人面经

从数据采集与评估追问到标注标准、搜索内容匹配和数据库分类，呈现数据运营与算法工作的交接。

问题主题：资料质量如何判断？；标注规则怎样定义？；如何分类和组织业务知识？

阅读背景：2020 年历史样本，用于解释数据运营的工作对象。

[原帖地址](https://ac.nowcoder.com/discuss/433123)

## 面试官视角聊聊，怎么准备AI大模型产品面试？

作者：武枫楠  
时间：页面显示 01-28，未显示年份  
背景：AI 产品 · 项目与业务讨论 · 未注明批次 · 求职复盘

讨论项目背景、数据来源、技术取舍及结果衡量，涉及客服应用和产品运营协作。

问题主题：项目解决什么任务？；为什么选择检索或微调？；怎样连接问答质量与使用结果？

阅读背景：作者自述具有面试官经历；身份未独立核实。

[原帖地址](https://ac.nowcoder.com/discuss/1607778?type=0)

## 25实习历程

作者：zxxxxxr  
时间：2024-06-19（编辑日期）  
背景：产品与运营 · 多家公司投递记录 · 实习 · 求职复盘

记录内容工具、语音助手、内容生成等不同场景的投递经历，展示产品岗位在业务对象上的差异。

问题主题：同名产品岗位分别服务什么场景？；如何记录投递公司与进度？

阅读背景：2024 年历史记录；录用结果为作者自述。

[原帖地址](https://www.nowcoder.com/feed/main/detail/cc44a0e2afb64ee988d390f9a2be165f)

## 百度文心一言AI产品面经

作者：Fauna_Blanc  
时间：2025-09-12  
背景：AI 产品 · 业务一面 · 未注明批次 · 个人面经

从用户需求挖掘追问到功能设计、收益拆分和对话体验。适合观察“做了什么”如何被继续追问成“为什么有效”。

问题主题：需求怎样变成功能？；增长能否归因到改动？；产品比较的评价集如何设计？

阅读背景：作者回忆的单次业务面，不代表百度统一题库。

[原帖地址](https://www.nowcoder.com/discuss/796074462360641536)

## 富途AI产品经理日常实习二面

作者：刘下苍茫  
时间：2025-05-22  
背景：内部 AI 应用 · 日常实习 · 实习 · 个人面经

项目数据、金融业务理解和知识问答被放在同一场面试中讨论。反问环节涉及投研、资讯与搜索提效。

问题主题：项目对业务有什么作用？；知识问答经过哪些步骤？；为什么选择产品方向？

阅读背景：作者明确是补发的历史记录；发帖日不是面试日。

[原帖地址](https://www.nowcoder.com/feed/main/detail/34d7ed816cac425da58f4dd35210d913)

## 小米AI策略产品面经

作者：Fauna_Blanc  
时间：2025-10-24  
背景：语音助手 · 策略产品 · 未注明批次 · 个人面经

从小爱同学的使用问题追问普遍性、改进方式与先后顺序。能帮助区分“个人感觉不好用”和有依据的产品问题。

问题主题：问题在多少用户中存在？；哪些改进应先做？；如何判断用户正在对助手说话？

阅读背景：与百度产品帖为同一作者，不能当成两个独立人群样本。

[原帖地址](https://www.nowcoder.com/feed/main/detail/60becb16810e411796bc6ccda6815b35)

## 蚂蚁ai产品实习一面分享

作者：Ori12  
时间：页面显示 05-01，未显示年份  
背景：AI 产品 · 场景与评测 · 实习 · 个人面经

围绕项目动机、提示迭代、模型费用和用户群体展开，包含 B 端与 C 端设计差异的讨论。

问题主题：为什么选这个模型？；如何评价产品结果？；不同用户的需求有何差异？

阅读背景：案例为面试话题，不作为医疗建议或产品安全效果证明。

[原帖地址](https://www.nowcoder.com/feed/main/detail/50694c1390a54107bf36d180e4df2975)

## 美团大模型产品转正实习面经（已offer）

作者：美团专业内推官  
时间：2025-03-25  
背景：大模型产品 · 转正实习 · 实习 · 个人面经

将知识库、失败案例标准和商业模式放在一起讨论。可对照产品人员如何参与数据与模型效果的工作。

问题主题：失败样例按什么标准判定？；知识如何分段？；技术方案对应什么商业价值？

阅读背景：原帖含内推广告，结果为作者自述；站内仅整理问题主题。

[原帖地址](https://www.nowcoder.com/feed/main/detail/2550761776d8461ab8aea206ff2db36f)

## 腾讯- AI产品实习面经 喜提人才库

作者：Stella_Chiara  
时间：页面显示 03-09，未显示年份  
背景：AI 产品 · 形态与体验 · 实习 · 个人面经

讨论独立应用与已有产品功能的取舍、对话记忆和体验指标，并涉及需求与研发之间的沟通。

问题主题：能力应嵌入还是独立成产品？；记忆功能如何设计？；体验用什么指标观察？

阅读背景：原帖含早期插件生态话题；面试年份不明，不标记为最新题目。

[原帖地址](https://www.nowcoder.com/feed/main/detail/26f18f2c96404679aa03539c219755ce?sourceSSR=users)

## 字节数据运营面经

作者：ButtercupGlimmer  
时间：2025-09-13  
背景：数据运营 · 业务分析 · 未注明批次 · 个人面经

从校园和实习经历追问独立贡献、指标选择、异常发现，再讨论文本反馈与数值数据的分析区别。

问题主题：为什么观察这些指标？；如何分析用户文字反馈？；能否说明完整的数据处理过程？

阅读背景：这是数据运营样本，不能直接等同于所有 AI 运营岗位。

[原帖地址](https://www.nowcoder.com/discuss/796319639306248192?sourceSSR=dynamic)

## 字节面经-字节运营岗面经-01

作者：林小白zii  
时间：页面显示 09-01；条目含 2026 年面试日期  
背景：AI 数据、模型与服务运营 · 汇编 · 实习 · 社区汇编

前六组条目涉及知识库质量、评测集、服务交付和图像数据标准，可用来发现运营岗位中的技术关联。

问题主题：知识库质量如何维护？；评测样本从哪里来？；数据标准如何制定？

阅读背景：已读前六组；汇编未逐一给出原始作者，作为补充线索，不计作独立面试次数。

[原帖地址](https://api-cdn.nowcoder.com/discuss/924099496047280128?sourceSSR=enterprise)

## 运营小白 字节跳动某频道运营实习生面经，已offer

作者：牛客34414447号  
时间：2020-06-05  
背景：内容运营 · 跨专业实习历史样本 · 实习 · 求职复盘

记录非相关专业候选人如何被问到频道理解、过往经历和改进想法。为理解内容运营的基础工作提供历史参照。

问题主题：是否了解具体业务频道？；过往经历能说明什么？；产品内容有哪些改进空间？

阅读背景：2020 年历史样本，招聘节奏与录用结果不能外推到现在。

[原帖地址](https://ac.nowcoder.com/discuss/436314?channel=-1&ncTraceId=9cbc975b9810404eb129b0135b3b0fa3.248.17369598512043794&source_id=discuss_terminal_discuss_sim_nctrack)

## 百度大模型算法实习生 一面

作者：长行莫倦  
时间：2025-08-22  
背景：大模型算法 · 实习一面 · 实习 · 个人面经

项目讨论之外，涉及偏好学习方法、视觉语言训练与编程，也追问从视觉研究转向 NLP 的原因。

问题主题：不同奖励学习方法有何差异？；视觉语言模型怎样训练？；已有研究如何连接新方向？

阅读背景：记录问题而非验证过的技术答案；Research 标签表示研究经历关联。

[原帖地址](https://www.nowcoder.com/feed/main/detail/e90de24cd51f42918df7044adb34fbaf)

## 整理下近期的大模型日常实习面经

作者：大模型丁真  
时间：2025-05-07  
背景：字节、百度、快手 · 多场实习复盘 · 实习 · 求职复盘

同一作者比较数场大模型实习面试，包含多模态项目追问和编程过程中的失误。可观察岗位与项目背景的联系。

问题主题：项目模型为何这样选择？；多模态信息怎样结合？；模型之外的编程基础如何考查？

阅读背景：多场记录仍来自同一个人，不据此计算公司录取率或题目频率。

[原帖地址](https://www.nowcoder.com/feed/main/detail/44b2baec47c740c4b9bccb8a013abd56)

## 字节-tac-二面面经记录（实习面试）

作者：老辣鸡了  
时间：2025-05-09（搜索记录；页面显示 05-09）  
背景：搜推业务 · 交叉面 · 实习 · 个人面经

把业务指标、冷启动、模型结构和损失实现连接起来。简历中的方法会进一步落到公式和代码。

问题主题：业务指标的含义是什么？；新用户或新内容如何处理？；损失函数如何实现？

阅读背景：原帖中的简略技术判断并非教材结论，概念需回到课程核对。

[原帖地址](https://www.nowcoder.com/feed/main/detail/ddfcfae15432465bb30f0573fe204dc5?sourceSSR=enterprise)

## 面经

作者：Showieee  
时间：页面显示 09-02；面试写为 9.1，未显示年份  
背景：雷鸟创新 · 软件开发实习 · 实习 · 个人面经

围绕语音助手项目讨论上下文、工作流和优化；反问进一步涉及实习任务及实际业务场景。

问题主题：多轮对话如何保留上下文？；工作流如何组织？；实习实际负责什么？

阅读背景：页面年份未明，按原文展示；不把题目整理成公司固定要求。

[原帖地址](https://www.nowcoder.com/feed/main/detail/aca039781c9246b2a641bc3154f7c276?sourceSSR=dynamic)

## 26届秋招字节后端二+三面速通面经详细版（附timeline）

作者：嵐jlu  
时间：2025-10-09  
背景：后端开发 · 校招流程复盘 · 校招 · 求职复盘

记录实习业务如何在后续校招中被深入追问。可学习如何说明服务在系统中的位置，以及讨论实现与挑战。

问题主题：负责的服务连接哪些上下游？；业务中的困难是什么？；抽象算法如何落到具体例子？

阅读背景：普通后端校招样本，不当作 AI 实习面试或统一流程。

[原帖地址](https://ac.nowcoder.com/discuss/1554249?type=0)

## MSRA Intern面经

作者：dogfar  
时间：2020-08-08  
背景：研究院实习 · 系统问题历史样本 · 实习 · 个人面经

作者记录了面对陌生存储问题时，在追问中逐步修改方案的过程。重点是问题讨论方式，而非题目背诵。

问题主题：如何提出初步方案？；如何解释方案代价？；得到新约束后怎样修改？

阅读背景：2020 年系统方向样本，不能代表大模型 Research 岗或当前研究院门槛。

[原帖地址](https://www.nowcoder.com/discuss/353156718697848832)
