一、研究背景与意义
近年来,我国大气污染防治取得显著成效,但空气质量改善仍面临艰巨任务。据生态环境部统计,2023年全国339个地级及以上城市中,空气质量达标城市仅占47.3%,PM2.5平均浓度为30微克/立方米,虽然较2015年下降了57%,但仍超过世界卫生组织
guideline
值的2倍。京津冀及周边、汾渭平原等重点区域秋冬季重污染天气仍时有发生,雾霾天气对公众健康、交通出行和经济发展造成严重影响。
当前空气质量监测与预警工作存在三大痛点:一是监测站点数量有限,城市内部的空气质量时空分布不均,仅靠固定站点数据难以反映精细化的污染分布;二是空气质量预测精度有待提升,传统统计模型在应对极端污染事件时预测误差较大,而深度学习模型的工程化落地还不够成熟;三是预警与调控脱节,预测出污染过程后,缺乏量化的调控方案建议,环保部门难以快速决策应该采取什么减排措施、减排多少。
深度学习技术的发展为解决上述问题提供了新的技术手段。通过LSTM、GRU等时序深度学习模型,可以充分捕捉空气质量数据的时间依赖特征,大幅提升预测精度;通过Spark分布式计算处理海量历史监测和气象数据,实现大规模数据的高效训练;再结合污染源排放清单和减排成本数据,可以生成量化的智能调控方案。构建一个集空气质量预测、污染成因分析、调控方案推荐于一体的智能系统,对于提升大气污染防治的科学性和精准性具有重要意义。
二、国内外研究现状
(一)国外研究现状
在空气质量预测领域,国外研究起步较早,深度学习方法应用广泛。美国斯坦福大学的Li等人在2019年开发了基于LSTM的城市PM2.5浓度预测模型,融合历史空气质量数据和气象预报数据,提前48小时预测PM2.5浓度,其研究目的是提升城市空气污染预警的时效性。美国加州大学伯克利分校的Zhang等人在2020年提出了CNN-LSTM混合模型,利用卷积神经网络提取污染物的空间分布特征,再用LSTM捕捉时间变化规律,其研究目的是同时利用时空信息提升预测精度。
在大数据空气质量平台方面,美国环保署(EPA)的Johnson等人在2021年基于Spark构建了全国空气质量大数据分析平台,处理全美4000余个监测站20年的逐小时数据,采用分布式机器学习模型进行空气质量历史趋势分析和未来预测,其研究目的是为国家大气环境管理提供数据支撑。欧盟联合研究中心的Keller等人在2022年设计了欧洲城市空气质量实时监测与预警系统,融合地面监测站和卫星遥感数据,逐小时更新PM2.5和O3浓度分布,其研究目的是向公众实时发布空气质量健康提示。
在智能调控方面,美国麻省理工学院的Sun等人在2023年开展了城市空气污染精准减排优化研究,建立了排放清单与空气质量响应的定量模型,计算不同减排措施的边际减排成本,其研究目的是在有限减排预算下最大化空气质量改善效果。总体来看,国外在空气质量深度学习预测和精准减排方面积累了丰富经验,但主要面向欧美城市的污染源结构,与我国以煤为主的排放结构存在差异。
(二)国内研究现状
国内学者在空气质量预测领域也取得了一系列成果。清华大学环境学院的贺克斌团队在2020年开展了基于深度学习的京津冀地区PM2.5浓度预测研究,使用LSTM模型融合气象和排放数据,提前72小时预测区域重污染过程,其研究目的是支撑京津冀大气污染联防联控。浙江大学计算机学院的陈为团队在2021年研发了城市空气质量可视化分析平台,利用ECharts绘制污染时空分布热力图、污染物浓度时间序列折线图、污染源贡献桑基图,其研究目的是帮助环保部门直观理解污染传输规律。
在大数据处理方面,北京大学环境科学与工程学院的胡敏团队在2022年基于Spark
MLlib构建了分布式空气质量预测模型,处理全国339个城市的历史监测数据,对比随机森林、XGBoost、LSTM三种算法在小时级PM2.5预测任务上的表现,其研究目的是筛选最适合业务化运行的预测算法。南京大学的王体健团队在2023年设计了重污染天气智能调控决策系统,基于污染过程预测结果,自动生成工业限产、机动车限行、扬尘管控等措施的量化建议,其研究目的是实现从预警到调控的闭环决策。
在AI辅助环境决策方面,复旦大学的肖仰华团队在2024年将大语言模型引入环境数据分析场景,利用DeepSeekAI工具对空气质量监测数据和污染过程报告进行智能解读,其执行过程包括污染过程自动识别、成因分析报告生成、调控措施建议撰写三个环节,其结果是实现了从原始监测数据到决策报告的自动化生成,其研究目的是提升环保部门的决策效率。
(三)研究述评
综合国内外研究现状可以发现,现有研究在空气质量深度学习预测、污染可视化分析、精准减排优化等方面已取得丰富成果,为本次系统开发提供了理论基础和技术参考。但现有研究仍存在以下不足:一是多数研究聚焦于预测算法本身,缺乏集数据采集、预测、调控、可视化于一体的完整系统;二是数据获取和分析的工程化描述不够详细,多源数据的融合处理链路不清晰;三是智能调控方案的量化程度不足,多数为定性建议,缺乏具体的减排力度测算。
在前人研究基础上,本课题将面向国内城市大气污染防治需求,构建一个基于深度学习的空气质量预测及智能调控系统。系统将融合空气质量监测、气象预报、污染源排放等多源数据,基于Spark进行分布式数据处理,采用LSTM深度学习模型实现高精度空气质量预测,并基于污染响应模型生成量化的智能调控方案,弥补现有研究在完整系统实现和量化调控方面的不足。
三、研究内容与目标
(一)研究目标
本课题的总体目标是设计并实现一个基于深度学习的空气质量预测及智能调控系统,通过多源环境数据的整合分析,实现未来72小时的城市空气质量精准预测,并基于预测结果提供量化的污染调控方案建议。
具体目标包括:第一,构建覆盖研究城市5年以上的空气质量和气象观测数据集,包含PM2.5、PM10、SO2、NO2、O3、CO六项污染物逐小时浓度;第二,基于LSTM深度学习模型实现PM2.5浓度预测,预测准确率(R²)达到0.85以上,提前期为72小时;第三,建立污染调控措施效果评估模型,输出不同减排方案的预期空气质量改善效果;第四,实现空气质量监测和预测结果的可视化展示,为环保部门提供决策支持。
(二)主要研究内容
本课题的主要研究内容包括以下四个方面:
第一,多源环境数据获取与预处理研究。针对空气质量监测数据、气象观测数据、污染源排放清单等多个数据源,设计数据采集和集成方案。研究多源时空数据的清洗、对齐和标准化方法,将不同时空分辨率的数据统一为网格尺度的数据集。
第二,空气质量深度学习预测模型研究。基于PyTorch构建LSTM空气质量预测模型,融合污染物浓度时间序列和气象要素数据,预测未来72小时的PM2.5浓度变化。研究不同模型结构和超参数对预测精度的影响。
第三,智能调控方案生成研究。基于污染排放与空气质量响应关系,建立主要污染源的减排效果模型。针对预测的污染过程,结合减排成本数据,生成投入产出比最优的调控方案组合,包括工业限产比例、机动车限行范围、扬尘管控强度等。
第四,预测与调控可视化系统实现研究。基于SpringBoot+Vue前后端分离架构开发Web系统,实现空气质量实时监测、预测结果展示、调控方案对比等可视化功能。引入DeepSeekAI工具实现污染成因的智能解读和调控报告自动生成。
四、系统功能设计
(一)系统总体架构
本系统采用分层架构设计,自下而上分为数据采集层、数据存储层、计算引擎层、业务逻辑层和前端展示层五层。数据采集层负责从环境监测站、气象部门、排放清单采集多源数据;数据存储层基于Hive数据仓库存储历史监测数据,InfluxDB存储实时时序数据;计算引擎层以Spark+PyTorch为核心,负责特征工程和深度学习模型训练;业务逻辑层基于SpringBoot提供API服务;前端展示层基于Vue+ECharts实现可视化交互界面。
系统技术栈选型如下:大数据存储采用Hadoop 3.3(HDFS+Hive);时序数据库采用InfluxDB 2.0;计算引擎采用Spark
3.2进行数据预处理,PyTorch 2.0进行深度学习模型训练;后端采用SpringBoot 2.7 + Java 11;前端采用Vue 3 + Element Plus + ECharts 5;数据库采用MySQL 8.0。
(二)核心功能模块
- 数据管理模块 数据管理模块负责多源环境数据的接入、清洗和标准化。系统通过定时任务每小时同步最新的空气质量监测数据和气象观测数据,自动完成数据清洗(缺测值插补、异常值剔除、时间对齐)和标准化处理,将不同来源的数据统一为逐小时网格数据集。模块提供数据质量监控面板,展示各监测站数据完整率、缺测率、异常值比例等指标。
- 空气质量预测模块 空气质量预测模块是系统的核心功能,基于LSTM深度学习模型实现。系统每日自动运行两次预测,输出未来72小时每小时的PM2.5、PM10、O3浓度预测值和AQI指数。预测结果分为四个等级:优(AQI
0-50)、良(AQI 51-100)、轻度污染(AQI 101-150)、中度及以上污染(AQI>150)。
模型输入特征包括:过去24小时的六项污染物浓度、过去24小时的气象要素(温度、湿度、风速、风向、气压)、未来72小时的气象预报数据。输出为未来72小时逐小时PM2.5浓度预测值。- 智能调控模块 智能调控模块基于空气质量预测结果,针对预测的重污染过程,自动生成量化的调控方案。系统根据污染来源解析结果,计算不同减排措施对降低PM2.5浓度的贡献。例如,当预测未来48小时将出现中度污染时,系统推荐启动黄色预警措施:工业企业限产20%、主城区机动车尾号限行、建筑工地扬尘管控升级。每个方案都附带预期减排效果和实施成本估算。
系统支持方案对比功能,用户可以调整不同措施的强度,实时查看预期的空气质量改善效果和总成本,辅助决策。- 可视化分析模块 可视化分析模块面向环保部门工作人员,提供多维度的空气质量数据和预测结果展示: (1)污染物浓度对比柱状图:展示研究城市各监测站PM2.5年均浓度对比。柱状图横轴为监测站名称,纵轴为年均浓度(μg/m³)。例如,2023年研究城市各监测站PM2.5年均浓度:工业西区站42.5μg/m³、交通干道站38.7μg/m³、居民区站32.1μg/m³、风景区站25.3μg/m³、对照点站18.6μg/m³。该柱状图的意义在于直观识别污染最严重的区域,为精准治污提供靶点。 (2)城市空气质量雷达图:从PM2.5、PM10、SO2、NO2、O3、CO六个维度绘制城市空气质量的综合画像雷达图。例如,冬季的雷达图在PM2.5和PM10维度突出,夏季的雷达图在O3维度突出。雷达图的意义在于多维度综合刻画城市空气污染的结构特征,识别主要污染物类型。
(3)空气质量预测折线图:展示未来72小时PM2.5浓度预测趋势。横轴为时间,纵轴为浓度(μg/m³),历史实测值和未来预测值用不同颜色折线表示,预测区间用阴影区域表示置信区间。环保部门可以直观看到污染过程的起止时间和峰值浓度,提前部署应对措施。
(4)污染源贡献饼图:展示PM2.5的来源解析结果。例如,工业源占比32%、机动车源占比26%、扬尘源占比18%、区域传输占比15%、其他源占比9%。饼图帮助管理者了解污染来源结构,确定治污的重点方向。- 智能决策问答模块 智能决策问答模块基于DeepSeekAI大语言模型构建,环保人员可以用自然语言向系统提问,例如"明天会不会出现重污染?"“如果启动工业限产30%,PM2.5能降多少?”"这个季节主要的污染源是什么?"系统自动解析问题,调用后端API获取预测和模拟数据,并以文字+图表的形式返回决策建议。
该模块按照"执行+过程+结果"三段式逻辑运行:执行阶段,系统接收用户自然语言问题,通过意图识别和实体提取确定查询时间、区域和问题类型;过程阶段,系统调用Spark计算引擎对历史监测数据进行聚合统计,运行深度学习预测模型和减排模拟模型;结果阶段,DeepSeekAI将计算结果转化为通俗易懂的决策建议,同时自动生成对应的可视化图表。
五、数据获取与数据分析方案
(一)数据获取方案
本研究的数据获取涵盖空气质量监测数据、气象观测数据、污染源排放数据和外部参考数据四大类,具体如下:
第一类是空气质量逐小时监测数据,来源于国家环境监测总站的全国城市空气质量实时发布平台。获取研究城市8个国控监测站2019-2023年共5年的逐小时监测数据,字段包括:站点编号、监测时间、PM2.5浓度、PM10浓度、SO2浓度、NO2浓度、O3浓度、CO浓度、AQI指数、首要污染物。这是预测模型最核心的训练数据。数据量约8站×5年×365天×24小时=35万条逐小时记录。
第二类是气象观测与预报数据,来源于中国气象数据网和中央气象台。历史气象数据包括:逐小时平均气温、相对湿度、风速、风向、气压、降水量,共5年数据;未来72小时气象预报数据每日更新,作为预测模型的输入特征。气象数据是影响空气质量的关键因素,风速扩散条件、逆温层结都会显著影响污染物浓度变化。
第三类是污染源排放清单数据,来源于当地生态环境局的大气污染源排放清单。包含工业源、移动源、扬尘源、生活源四大类排放源的逐季度排放量数据,以及主要排放企业的地理位置和排放量。这些数据用于污染来源解析和减排效果模拟。
第四类是外部参考数据,通过Python脚本从公开渠道采集,包括:城市人口密度、机动车保有量、能源消费结构、地形地貌数据。这些数据用于空间分析和污染成因的辅助解释。
数据获取的技术方案:空气质量监测数据通过爬虫定时从公开平台采集后写入HDFS;气象数据通过中国气象数据网API批量下载;排放清单数据从生态环境局公开报告中解析提取。所有原始数据按年份和站点分区存储,便于增量更新和历史追溯。预计累计数据量达到数百万条监测记录。
(二)数据清洗与预处理
多源环境数据存在缺测值、异常值、时间分辨率不统一等问题,需要进行系统化的清洗和预处理,分为四个步骤:
第一步是数据解析与格式统一。将从不同来源采集的CSV、JSON、Excel等格式数据解析为统一的结构化表格,统一字段命名规范(如station_id、datetime、pm25、pm10、so2、no2、o3、co、temperature、humidity、wind_speed等),统一时间格式为yyyy-MM-dd
HH:mm,统一时区为北京时间。
第二步是缺测值和异常值处理。对于污染物浓度缺测记录,采用前后2小时线性插值法进行插补;对于明显异常的观测值(如PM2.5浓度超过1000μg/m³或为负值),标记为异常并替换为插值结果;对于气象要素缺测记录,采用邻近站点均值插补。数据完整率要求达到95%以上。
第三步是时间对齐与特征构造。将空气质量数据和气象数据按小时对齐,构造滞后特征(过去1小时、3小时、6小时、12小时、24小时的污染物浓度)、滑动平均特征(过去24小时滑动平均浓度)、时间特征(小时、星期、月份、季节)。每个时间步长最终生成约30个输入特征。
第四步是数据集划分与标准化。按时间维度将数据集划分为训练集(2019-2022年)、验证集(2023年1-6月)、测试集(2023年7-12月),模拟真实场景中的时间预测任务。对所有数值特征进行Z-Score标准化处理,使均值为0、方差为1,加速神经网络训练收敛。处理后的数据写入Hive数据仓库,按ODS、DWD、DWS、ADS四层架构组织。
(三)深度学习模型训练
本研究采用PyTorch框架构建LSTM深度学习模型作为空气质量预测主模型,同时对比GRU和BP神经网络两种模型。
选择LSTM的原因:一是空气质量浓度具有强时间序列依赖性,LSTM的门控机制能够有效捕捉长期依赖关系;二是LSTM对噪声数据鲁棒性强,适合处理存在一定观测误差的环境监测数据;三是PyTorch提供了成熟的LSTM实现,便于灵活调整网络结构。
模型训练流程:
第一步,数据加载与窗口构造。从Hive中读取预处理好的标准化数据,构造滑动时间窗口:输入窗口长度为24小时(过去24小时数据),输出窗口长度为72小时(未来72小时预测)。将数据按8:1:1划分为训练集、验证集和测试集。
第二步,模型结构设计。LSTM网络包含2个隐藏层,每个隐藏层有64个神经元;输入维度为30个特征;输出维度为72个时间步长的PM2.5浓度预测值。在LSTM层后接全连接层输出最终预测结果。Dropout比率设置为0.2,防止过拟合。
第三步,模型训练。使用PyTorch的Adam优化器,学习率设置为0.001,批量大小batch_size=64,训练轮数epochs=100。损失函数采用均方误差(MSE)。训练过程中每轮在验证集上评估,当验证集损失连续10轮不下降时提前停止训练(Early
Stopping),防止过拟合。
第四步,模型评估。在测试集上评估模型性能,使用四个指标:均方根误差RMSE、平均绝对误差MAE、决定系数R²、预测准确率(相对误差<20%的样本占比)。对比LSTM、GRU、BP神经网络三种模型的指标表现,选择最优模型。
(四)空气质量多维度分析
在预测模型基础上,开展多维度空气质量数据分析:
第一是空气质量时空分布分析。统计研究城市各监测站5年来的空气质量达标天数比例、主要污染物类型、季节变化规律。例如,分析发现冬季PM2.5污染最重,月均浓度可达55μg/m³;夏季O3污染突出,月均最大8小时平均浓度可达160μg/m³。通过时空分布分析,识别污染高发期和高污染区域。
第二是污染特征分析。分析不同气象条件下的污染物浓度变化规律,例如风速大于3m/s时PM2.5浓度平均下降20%,相对湿度大于80%时PM2.5浓度平均升高15%。通过气象-污染关联分析,理解污染形成和扩散的气象条件。
第三是污染源贡献分析。基于排放清单和监测数据,用受体模型解析PM2.5的来源构成,识别工业源、移动源、扬尘源、区域传输的贡献比例。例如,研究城市PM2.5来源中工业源占32%、机动车源占26%、扬尘源占18%、区域传输占15%。通过来源解析,确定治污的重点方向。
第四是调控效果模拟分析。基于排放与浓度响应关系,模拟不同减排措施下的空气质量改善效果。例如,工业限产20%可降低PM2.5浓度约6.4μg/m³,机动车限行30%可降低约5.2μg/m³,两者叠加可降低约11.6μg/m³。通过效果模拟,量化评估各措施的减排贡献。
(五)可视化实现方案
前端可视化采用ECharts 5实现,针对不同分析需求设计不同的图表类型:
对于类别型数值对比(如各监测站浓度对比),采用柱状图进行展示。柱状图横轴为监测站名称,纵轴为年均浓度,柱子按浓度从高到低排列。例如,展示2023年研究城市8个监测站PM2.5年均浓度,工业西区站42.5μg/m³、交通干道站38.7μg/m³、居民区站32.1μg/m³、风景区站25.3μg/m³、对照点站18.6μg/m³,柱状图按降序排列后,管理者可以一眼看出污染最严重的区域。
对于多维度综合评价(如城市空气质量综合画像),采用雷达图进行展示。雷达图六个顶点分别对应PM2.5、PM10、SO2、NO2、O3、CO六个污染物指标,每个指标的数值经过归一化处理。雷达图的面积和形状直观反映城市空气污染的结构特征,例如冬季雷达图在PM2.5维度突出,夏季雷达图在O3维度突出。
对于时间序列预测数据(如未来72小时PM2.5预测),采用折线图进行展示。折线图横轴为时间,纵轴为浓度,历史实测值和未来预测值用不同颜色和线型表示,预测置信区间用阴影区域表示。环保人员可以直观看到污染过程的发展趋势和峰值。
对于来源构成数据(如PM2.5来源解析),采用饼图进行展示。饼图各扇形的面积对应各污染源的贡献占比,支持点击某一污染源下钻查看该源的详细排放情况。
对于空间分布数据(如城市污染热力图),采用地图热力图进行展示。地图颜色深浅表示该区域的PM2.5浓度高低,颜色越深代表污染越重。用户可以通过鼠标悬停查看具体数值,点击区域可下钻查看该区域的详细监测数据。
所有可视化图表均支持交互功能:数据缩放、图例筛选、数据高亮、下钻查询等,用户可以从城市整体污染状况下钻到单个监测站的详细数据。