BERTopic 与大模型辅助的 AI“数字复活”受众话语分析

通过语义向量与 BERTopic 发现 AI“数字复活”评论中的讨论主题,再结合大模型解释与统计口径分析情感和伦理话语。

  • 技术与任务自然语言处理 · 大模型与智能体 · 统计与数据分析
  • 应用方向信息与人工智能 · 经管与人文社科

项目亮点

  • 语义聚类与关键词统计有什么区别
  • 大模型怎样辅助解释主题
  • 主题比例为何需要说明分母

数据与任务

样本量23,242 条原始评论
核心方法BERTopic · 主题解释
技术栈Python · UMAP · HDBSCAN

面对 AI“数字复活”视频,观众谈论的是技术效果、思念关系,还是同意与尊严?这个项目用主题发现整理大规模评论,再将统计结果与传播学问题联系起来。

flowchart LR N0["评论清洗"] N1["中文语义向量"] N2["UMAP 与 HDBSCAN 聚类"] N3["BERTopic 关键词"] N4["大模型解释与六类话语"] N0 --> N1 --> N2 --> N3 --> N4

先说清楚,它到底在做什么

正式分析从 23,242 条评论中整理出 22,899 条候选文本,18,520 条用于主题发现,形成 35 个有效主题。通过主题证据和概念归纳,将讨论组织成六类受众话语,观察不同关注点的比例与关系。

真实数据分析主流程
真实数据分析主流程

搞懂它,你能在面试里讲清楚什么

语义聚类与关键词统计有什么区别

语义向量让表达不同但内容相近的评论靠近,UMAP 压缩表示,HDBSCAN 识别密度结构,BERTopic 为主题提取关键词。主题数量与离群文本都需要结合样本理解。

项目总体方法与模块关系
项目总体方法与模块关系

大模型怎样辅助解释主题

模型读取主题关键词与代表性证据,给出结构化解释,再由主题映射形成六类分析口径。解释环节围绕已有主题证据展开,统计数量来自实际结果表。

大模型辅助主题解释机制
大模型辅助主题解释机制

主题比例为何需要说明分母

在进入六类实质主题的 16,344 条候选评论中,“思念与关系延续”占 44.2%。项目同时提供两种统计口径,帮助区分全部候选评论、进入主题的文本以及具体主题内部的比例。

两种统计口径对照
两种统计口径对照

怎样阅读实验与配图

主题规模图、六类话语分布和两种口径对照图,适合用于解释“技术讨论如何与关系需求和伦理边界交织”。配套保留正式统计与处理流程,完整原始评论按资料授权范围使用。

面试与答辩可以怎样准备

BERTopic 的主题与研究者归纳的六类话语是什么关系?

为什么部分评论会成为离群文本?

改变统计分母会怎样影响传播学结论?

配套讲解材料围绕整体思路、关键步骤与结果解读展开,并提供面试问答与简历表达参考。准备时可以先按流程说明输入和输出,再选一个样例解释方法,最后用结果图回答具体问题。简历描述结合实际参与内容调整,配图可以放入 PPT 模板组织汇报。

配套资料

技术文档从任务背景、数据组织讲到模型与实验,再结合图表解释结果,包含面试问答和项目表达参考。下面展示正文选页,便于了解讲解内容与图文组织。

技术文档正文节选,第 12 页
技术文档正文节选,第 12 页
技术文档正文节选,第 13 页
技术文档正文节选,第 13 页
技术文档正文节选,第 20 页
技术文档正文节选,第 20 页

代码覆盖数据处理、核心方法和实验分析。下面是实际源码中的关键函数节选,可以结合文档中的流程与公式阅读,再沿输入、计算与输出理解具体实现。

关键实现节选:load_comments
关键实现节选:load_comments
关键实现节选:clean_comments
关键实现节选:clean_comments

适合谁

新闻传播、社会学、数字人文与自然语言处理方向。 项目资料可用于学习、选题交流与面试答辩准备;沿着数据、方法、实验和解释逐步掌握,形成能够独立讲清楚的项目经历。

想把这样的项目做成你简历上的亮点?

这是一套配齐了代码、文档、面试问答和配图的 AI+X 项目,可写进简历、在面试里讲清楚。 想做同类项目、或获取「BERTopic 与大模型辅助的 AI“数字复活”受众话语分析」的完整资料(代码 / 数据处理流程 / 论文文档 / 配图), 请联系为你介绍本页面的老师咨询,按你的情况定一个合适的项目。

加载中…