BERTopic 与大模型辅助的 AI“数字复活”受众话语分析
通过语义向量与 BERTopic 发现 AI“数字复活”评论中的讨论主题,再结合大模型解释与统计口径分析情感和伦理话语。
项目亮点
- 语义聚类与关键词统计有什么区别
- 大模型怎样辅助解释主题
- 主题比例为何需要说明分母
数据与任务
| 样本量 | 23,242 条原始评论 |
|---|---|
| 核心方法 | BERTopic · 主题解释 |
| 技术栈 | Python · UMAP · HDBSCAN |
面对 AI“数字复活”视频,观众谈论的是技术效果、思念关系,还是同意与尊严?这个项目用主题发现整理大规模评论,再将统计结果与传播学问题联系起来。
先说清楚,它到底在做什么
正式分析从 23,242 条评论中整理出 22,899 条候选文本,18,520 条用于主题发现,形成 35 个有效主题。通过主题证据和概念归纳,将讨论组织成六类受众话语,观察不同关注点的比例与关系。

搞懂它,你能在面试里讲清楚什么
语义聚类与关键词统计有什么区别
语义向量让表达不同但内容相近的评论靠近,UMAP 压缩表示,HDBSCAN 识别密度结构,BERTopic 为主题提取关键词。主题数量与离群文本都需要结合样本理解。

大模型怎样辅助解释主题
模型读取主题关键词与代表性证据,给出结构化解释,再由主题映射形成六类分析口径。解释环节围绕已有主题证据展开,统计数量来自实际结果表。

主题比例为何需要说明分母
在进入六类实质主题的 16,344 条候选评论中,“思念与关系延续”占 44.2%。项目同时提供两种统计口径,帮助区分全部候选评论、进入主题的文本以及具体主题内部的比例。

怎样阅读实验与配图
主题规模图、六类话语分布和两种口径对照图,适合用于解释“技术讨论如何与关系需求和伦理边界交织”。配套保留正式统计与处理流程,完整原始评论按资料授权范围使用。
面试与答辩可以怎样准备
BERTopic 的主题与研究者归纳的六类话语是什么关系?
为什么部分评论会成为离群文本?
改变统计分母会怎样影响传播学结论?
配套讲解材料围绕整体思路、关键步骤与结果解读展开,并提供面试问答与简历表达参考。准备时可以先按流程说明输入和输出,再选一个样例解释方法,最后用结果图回答具体问题。简历描述结合实际参与内容调整,配图可以放入 PPT 模板组织汇报。
配套资料
技术文档从任务背景、数据组织讲到模型与实验,再结合图表解释结果,包含面试问答和项目表达参考。下面展示正文选页,便于了解讲解内容与图文组织。



代码覆盖数据处理、核心方法和实验分析。下面是实际源码中的关键函数节选,可以结合文档中的流程与公式阅读,再沿输入、计算与输出理解具体实现。


适合谁
新闻传播、社会学、数字人文与自然语言处理方向。 项目资料可用于学习、选题交流与面试答辩准备;沿着数据、方法、实验和解释逐步掌握,形成能够独立讲清楚的项目经历。
想把这样的项目做成你简历上的亮点?
这是一套配齐了代码、文档、面试问答和配图的 AI+X 项目,可写进简历、在面试里讲清楚。 想做同类项目、或获取「BERTopic 与大模型辅助的 AI“数字复活”受众话语分析」的完整资料(代码 / 数据处理流程 / 论文文档 / 配图), 请联系为你介绍本页面的老师咨询,按你的情况定一个合适的项目。