基于多源城市空间数据融合的PM2.5时空预测与污染暴露风险评估

融合北京12个国控站点2013-2017年真实逐小时空气质量数据与OpenStreetMap真实城市空间数据,对比LSTM/Informer-lite/STGCN三类模型在1/6/24小时PM2.5预测上的表现,用SHAP+Moran's I/LISA双轨可解释性分析产出面向城市规划的污染暴露风险分级图。配套代码、36页技术文档、面试问答和完整配图。

  • 任务类型深度学习-图神经网络
  • 专业方向计算机 · 环境科学 · 城市规划

数据与任务

样本量UCI北京12站点·2013-2017逐小时·420768条 + OpenStreetMap真实城市空间数据
核心方法LSTM/Informer-lite/STGCN三模型对比 + SHAP + Moran's I/LISA空间自相关
技术栈PyTorch / osmnx / SHAP

如果你想要一个融合时序建模、图神经网络和真实城市空间数据的完整项目,这个"PM2.5时空预测与污染暴露风险评估"的题目会很合适——数据是真实的国控监测站观测和真实的OpenStreetMap城市数据,三个模型的对比诚实到"预测越久越难"这个现实规律都如实报告,最后还落地成城市规划能用的风险分级图。代码、36页技术文档、面试问答和整套配图都给你备齐了。

flowchart LR A["UCI北京12站点<br/>真实逐小时观测2013-17"] --> C["时空数据融合"] B["OpenStreetMap<br/>真实城市空间数据"] --> C C --> D["三模型对比<br/>LSTM/Informer-lite/STGCN"] D --> E["SHAP+空间自相关<br/>双轨可解释性"] E --> F["城市规划风险分级图"]

先说清楚,它到底在做什么

预测未来几小时的 PM2.5 浓度,对城市空气质量预警和污染治理很有实际价值。这个项目融合两类真实数据:北京 12 个国控空气质量监测站 2013-2017 年逐小时观测数据(UCI Beijing Multi-Site Air-Quality Data Set,420,768条记录)和OpenStreetMap 真实城市空间数据(路网、POI、绿地、水体、建筑密度,通过 osmnx 实时查询 Overpass API 获取)。项目文档明确声明:全部数据均为真实公开数据源,未做任何模拟或构造;模型实验结果为真实训练产出。

项目技术流程图
项目技术流程:多源真实数据融合(空气质量+气象+城市空间特征)→ 三类时空模型对比 → SHAP+空间自相关双轨可解释性 → 城市规划风险分级图。

数据长什么样

12 个监测站分布在北京不同区域,PM2.5 浓度的月均水平和季节性波动各不相同:

12站点月均PM2.5浓度小倍数图
12站点月均浓度小倍数图:共享坐标轴的网格小图,同一张图里直接比较各站点的季节性波动和整体水平差异——东四站历史PM2.5均值最高(86.2 µg/m³),地处山区、建筑密度最低的站点则明显更低。

时间序列本身有清晰的趋势和日周期结构,这是后续建模要显式利用的信息:

东四站PM2.5时间序列加法分解
东四站PM2.5时间序列加法分解(趋势/日周期/残差,展示45天窗口):日周期结构清晰可见——这也是为什么模型要显式加入(hour_sin, hour_cos)、(doy_sin, doy_cos)周期编码的原因。

三类模型的诚实对比

项目对比了 LSTM、Informer-lite(简化版时序 Transformer,报告中如实标注不含 ProbSparse 稀疏注意力和蒸馏机制,不冒充完整 Informer)、STGCN 风格时空图神经网络三类模型,在 1/6/24 小时三个预测时长上对比 PM2.5 和 NO2 预测表现:

各模型不同预测时长的MAE对比
各模型不同预测时长的MAE对比:所有模型的误差都随预测时长拉长而明显增大,这是符合物理直觉的诚实结果,没有夸大长期预测能力。
三模型R²雷达图
三模型R²雷达图(1/6/24小时对比):1小时预测三个模型都很强(R²≈0.94-0.95),但24小时预测差距明显拉开——STGCN(0.279)大幅领先LSTM(0.106)和Transformer(0.054)。

为什么STGCN在长时长预测上优势最明显? 这是这个项目最值得讲的发现。短期(1小时)预测主要靠"惯性"——刚才浓度是多少,下一刻大概率差不多,纯时序模型(LSTM/Informer-lite)就能做得很好;但预测时长拉长到24小时后,单站点自身的历史序列信息量迅速衰减,这时候"其他站点在做什么"这一空间信息就变得更有价值——STGCN 通过图结构显式建模站点间的空间传播关系,能借用其他站点的信息弥补单站点历史信息的不足,因此在长时长预测上优势最明显。面试问"为什么用图神经网络",这个"短期看时序、长期看空间"的现象就是最有说服力的实证支撑。

双轨可解释性分析

PM2.5浓度驱动因子SHAP重要性排序
SHAP重要性排序:识别出对PM2.5预测贡献最大的驱动因子(气象要素、历史滞后项等)
中心城区污染暴露风险街区分级图
中心城区污染暴露风险街区分级图(真实区级行政边界底图):结合真实观测与真实城市空间特征,识别出以东四、农展馆等为代表的高暴露街区,用Moran's I/LISA空间自相关检验做统计显著性支撑。

面试官会问的,都帮你备好了

随便感受几个这个项目真实会被追问的问题:

  • 三个模型里哪个最好?为什么STGCN在24小时预测上优势最明显?
  • Informer-lite和完整的Informer架构有什么区别?为什么要做简化?
  • 这个风险分级图能直接指导城市规划决策吗?有什么局限?

看到这几个问题会不会心里有底?面试问答文档把这个项目从数据融合、模型设计到可解释性分析、城市规划落地应用,连参考答案都写好了——包括诚实讨论"这些都是我认为诚实且有价值的后续研究方向,而不是掩盖起来"这类容易被问到局限性时的成熟应对方式。

配套资料:搞懂一个项目需要的,这里全都有

技术文档从数据融合、三类模型设计一路讲到可解释性分析与城市规划落地应用,共 36 页:

技术文档·项目流程图页
技术文档:项目整体技术流程,多源数据融合到风险分级图的完整链路
技术文档·模型对比结果页
模型对比结果:三模型在1/6/24小时上的完整MAE/RMSE/R²数据表
技术文档·面试问答章节
面试问答章节:从数据到建模到应用的全流程追问

技术文档、面试问答、源码注释、整套配图——搞懂一个项目、并在面试里讲清楚它,需要的全都备齐了。

适合谁

不管你是准备环境科学、城市规划、地理信息科学、大气科学方向的考研复试、保研面试,还是想给简历添一个"多源真实数据融合+时空建模"的项目,这个题目都接得住。专业上,环境科学、城市规划、地理信息科学、计算机科学、大气科学方向都很合适。它把时序建模、图神经网络空间建模、可解释性分析和城市规划落地应用串成了一条完整的工程闭环——把它真正搞懂、能讲出来,就是一个经得起追问的项目。

想把这样的项目做成你简历上的亮点?

这是一套配齐了代码、文档、面试问答和配图的 AI+X 项目,可写进简历、在面试里讲清楚。 想做同类项目、或获取「基于多源城市空间数据融合的PM2.5时空预测与污染暴露风险评估」的完整资料(代码 / 数据处理流程 / 论文文档 / 配图), 请联系为你介绍本页面的老师咨询,按你的情况定一个合适的项目。

加载中…