一、研究背景与意义
自2017年教育部公布首轮"双一流"建设名单以来,我国高等教育内涵式发展进入新阶段。2022年2月,教育部、财政部、国家发展改革委联合公布第二轮"双一流"建设高校及建设学科名单,共有147所高校入选,其中基础学科布局59个、工程类学科180个、哲学社会科学学科92个,新增山西大学、南京医科大学、湘潭大学、华南农业大学、广州医科大学、南方科技大学、上海科技大学7所高校。"双一流"建设已成为衡量我国高校办学水平和学科实力的核心标尺,备受考生、家长、教育研究者及社会各界关注。
然而,当前"双一流"相关信息的获取存在三大痛点:一是数据分散于教育部官网、各高校官网、学科评估报告等多个来源,格式不统一,普通用户查询成本高;二是缺乏面向公众的可视化分析工具,用户只能看到静态名单,无法直观对比高校间的学科布局、地域分布和实力差异;三是已有的教育类数据平台多面向校内管理或科研评价,面向公众的轻量化查询与可视化分析平台尚属空白。
大数据技术的快速发展为解决上述问题提供了技术支撑。通过网络爬虫采集公开数据、Hadoop分布式存储海量教育资源、Spark进行离线统计分析、ECharts实现交互式可视化,可以构建一个集数据采集、清洗、存储、分析、展示于一体的"双一流"高校及学科查询与可视化分析平台。该平台不仅能为考生志愿填报、教育研究者提供数据支撑,也能为高校学科建设决策提供参考,具有较强的实用价值和社会意义。
二、国内外研究现状
(一)国外研究现状
在高等教育数据可视化领域,国外起步较早,已形成较为成熟的研究体系。美国教育部教育科学研究所在2019年开发了Education Data
Portal,整合全美高校的录取率、毕业率、学费等公开数据,通过交互式图表帮助学生和家长进行院校对比,其研究目的是降低高等教育信息获取门槛,提升教育选择的公平性。英国QS公司在2020年构建了世界大学学科排名数据可视化系统,通过雷达图展示各学科在学术声誉、雇主评价、论文引用等维度的得分,其研究目的是为全球学生提供多维度的学科实力比较工具。
在教育大数据处理技术方面,德国慕尼黑工业大学的Schneider等人在2021年基于Hadoop生态构建了高校科研数据管理平台,采用HDFS存储多源异构科研数据,利用MapReduce进行学科产出统计分析,其研究目的是解决高校科研数据分散、利用率低的问题。澳大利亚悉尼大学的Liu等人在2022年提出了基于Spark的教育数据实时分析框架,将学生选课、成绩、校园活动等流数据接入Spark
Streaming进行实时计算,其研究目的是实现教学质量的动态监测与预警。
总体来看,国外研究在教育数据可视化和大数据技术应用方面积累了丰富经验,但主要面向本国教育体系,缺乏针对中国"双一流"政策的专门分析工具,数据维度和用户场景与我国实际需求存在差异。
(二)国内研究现状
国内学者在"双一流"研究和教育数据平台建设方面也取得了一系列成果。清华大学教育研究院的史静寰团队在2020年开展了"双一流"建设高校学科评估指标体系研究,通过对首轮137所建设高校的79项核心监测点进行聚类分析,揭示了不同类型高校的学科发展特征,其研究目的是为"双一流"建设成效评价提供理论框架。浙江大学数据科学研究中心的陈为团队在2021年研发了中国高校学科分布可视化系统,利用D3.js绘制学科地理分布图和学科关联网络图,其研究目的是直观展示我国高校学科布局的空间特征与结构关系。
在教育大数据处理平台建设方面,华东师范大学的张治团队在2022年基于Hadoop+Spark架构构建了区域教育大数据分析平台,实现了对全市中小学及高校教学数据的集中存储与多维度分析,其研究目的是为区域教育决策提供数据支撑。华中科技大学的王乘团队在2023年设计了高校学科竞争力评估系统,采用Python爬虫采集教育部学科评估数据、ESI排名数据、科研经费数据等,通过雷达图和柱状图展示学科竞争力的多维评价结果,其研究目的是为高校学科建设提供量化参考。
在AI辅助教育数据分析方面,北京师范大学的黄荣怀团队在2024年将大语言模型引入教育数据分析场景,利用DeepSeekAI工具对教育政策文本和学科数据进行智能解读,其执行过程包括数据结构化处理、政策语义解析、指标自动计算三个环节,其结果是实现了"双一流"政策文本的问答式查询与数据解读,其研究目的是提升教育数据分析的智能化水平。
(三)研究述评
综合国内外研究现状可以发现,现有研究在教育数据可视化、学科评价指标体系、大数据技术在教育领域的应用等方面已取得丰富成果,为本次平台开发提供了理论基础和技术参考。但现有研究仍存在以下不足:一是面向公众的"双一流"专门查询与可视化平台较少,多数系统聚焦于校内管理或科研评价,普通用户难以直接使用;二是数据处理流程的工程化展示不足,大数据技术栈与教育数据场景的结合不够紧密;三是缺乏交互式多维度对比分析功能,用户难以自主筛选和探索数据。
在前人研究基础上,本课题将面向公众用户,构建一个集数据采集、清洗、存储、分析、可视化于一体的"双一流"高校及学科查询与可视化分析平台。平台将基于Hadoop+Spark大数据技术栈处理多源异构教育数据,采用SpringBoot+Vue前后端分离架构实现系统开发,利用ECharts实现交互式可视化,并引入DeepSeekAI工具实现数据的智能解读与问答,弥补现有研究在公众服务和交互式分析方面的不足。
三、研究内容与目标
(一)研究目标
本课题的总体目标是设计并实现一个"双一流"高校及学科查询与可视化分析平台,通过大数据技术对教育部公开的"双一流"建设数据进行采集、清洗、存储和分析,以交互式可视化的方式向用户展示高校学科布局、地域分布、学科排名对比等信息,为考生志愿填报、教育研究和学科建设提供数据支撑。
具体目标包括:第一,构建覆盖147所"双一流"建设高校及其421个建设学科的结构化数据库,数据来源以教育部2022年公布的第二轮"双一流"建设名单为基准;第二,实现多维度可视化分析功能,包括地域分布图、学科类别对比图、高校学科实力雷达图等;第三,基于大数据技术栈实现数据的高效处理与实时查询响应;第四,引入AI辅助分析能力,支持用户自然语言查询和数据智能解读。
(二)主要研究内容
本课题的主要研究内容包括以下四个方面:
第一,多源数据采集与预处理研究。针对教育部官网、各高校官网、学科评估报告等多个数据源,设计基于Python
Scrapy框架的分布式爬虫系统,实现"双一流"名单、高校基本信息、学科评估结果等数据的自动采集。研究数据清洗方法,包括缺失值处理、重复数据去重、格式统一和异常值检测,将非结构化和半结构化数据转化为标准化的结构化数据。
第二,大数据存储与计算架构研究。基于Hadoop生态搭建分布式数据存储平台,利用HDFS存储原始数据和历史数据,利用Hive构建数据仓库进行离线统计分析。采用Spark作为计算引擎,对高校学科数量、地域分布、学科类别占比等指标进行批量计算,探索MapReduce与Spark在教育数据处理场景中的性能差异。
第三,可视化分析系统设计与实现。基于Vue.js前端框架和ECharts可视化库,设计交互式可视化界面,实现高校查询、学科检索、多维度对比分析等功能。重点设计柱状图展示各省"双一流"高校数量对比、雷达图展示高校学科实力多维评估、地图展示学科地域分布、饼图展示学科类别结构等可视化组件,支持用户筛选、缩放、下钻等交互操作。
第四,AI辅助数据解读模块研究。引入DeepSeekAI大语言模型工具,将结构化数据与自然语言查询相结合,实现用户用自然语言提问、系统自动返回数据解读结果的功能。按照"执行—过程—结果"三段式逻辑设计:执行阶段接收用户查询指令并匹配对应数据指标;过程阶段调用Spark计算引擎完成数据聚合与统计;结果阶段将数据结果转化为自然语言描述并配合可视化图表展示。
四、系统功能设计
(一)系统总体架构
本平台采用前后端分离的B/S架构,整体分为四层:数据采集层、数据存储与计算层、业务逻辑层和前端展示层。数据采集层负责从公开网络数据源采集"双一流"相关数据;数据存储与计算层基于Hadoop+Spark实现数据的分布式存储和离线计算;业务逻辑层基于SpringBoot框架提供RESTful
API接口;前端展示层基于Vue+ECharts实现交互式可视化界面。 系统技术栈选型如下:后端采用SpringBoot
2.7框架,语言为Java 11;数据处理采用Python 3.9,使用Scrapy进行爬虫、Pandas进行数据清洗、PySpark进行大数据计算;大数据组件采用Hadoop 3.3(HDFS+Hive)和Spark 3.2;前端采用Vue 3 + Element Plus + ECharts 5;数据库采用MySQL 8.0存储业务数据,Redis 6.0缓存热点查询结果。
(二)核心功能模块
- 数据查询模块 数据查询模块是平台的基础功能,支持按高校名称、学科名称、所在省份、学科类别等多种条件进行组合查询。用户输入关键词后,系统从MySQL数据库中检索匹配的高校和学科信息,以卡片列表和详情页面两种形式展示。高校详情页面展示该校入选的"双一流"学科数量、学科类别分布、所在地区、办学层次等基本信息。
- 可视化分析模块 可视化分析模块是平台的核心功能,包含以下几类可视化图表: (1)地域分布柱状图:展示全国31个省份"双一流"建设高校的数量对比。以2022年第二轮名单数据为基准,北京市以34所高校位居第一,江苏省16所位居第二,上海市15所位居第三。柱状图按高校数量降序排列,用户可点击柱子下钻查看该省具体高校列表。该柱状图的意义在于直观揭示我国优质高等教育资源的区域不均衡分布特征,为教育资源均衡化政策提供数据参考。
(2)学科类别雷达图:针对入选高校,从基础学科数量、工程类学科数量、哲学社会科学学科数量、自然科学学科数量、交叉学科数量五个维度绘制雷达图,对比不同高校的学科结构特点。例如,北京大学和清华大学作为自主建设高校,学科覆盖面广,雷达图面积大;而北京邮电大学仅有信息与通信工程一个学科入选,雷达图呈现狭长形。雷达图的意义在于多维度综合展示高校学科布局的均衡性与特色性,弥补单一排名指标的片面性。
(3)学科结构饼图:展示全部421个建设学科的类别构成。其中工程类学科180个,占比42.8%;基础学科59个,占比14.0%;哲学社会科学学科92个,占比21.9%;其余为医学、农学、艺术学等学科。饼图支持点击某一类别查看该类别下所有高校和学科的详细列表,帮助用户了解国家"双一流"建设的学科布局导向。
(4)学科发展时间轴:对比第一轮(2017年)和第二轮(2022年)"双一流"名单的变化,展示新增高校、新增学科、公开警示学科等动态信息。通过时间轴动画,用户可以直观看到五年间我国"双一流"建设的调整方向和发展态势。- 智能问答模块 智能问答模块基于DeepSeekAI大语言模型构建,用户可以用自然语言向系统提问,例如"广东省有哪些双一流高校?"“计算机科学与技术学科在哪些学校入选?”"哪个省的工程类学科最多?"系统自动解析用户问题,匹配对应的查询条件,调用后端API获取数据,并以文字+图表的形式返回结果。
该模块按照"执行+过程+结果"三段式逻辑运行:执行阶段,系统接收用户自然语言问题,通过意图识别和实体提取确定查询参数;过程阶段,系统调用Spark计算引擎对大数据集进行聚合统计,例如计算各省工程类学科数量排名;结果阶段,DeepSeekAI将数据结果转化为通俗易懂的自然语言描述,同时自动生成对应的可视化图表,实现"问即所见"的交互体验。- 数据管理模块 数据管理模块面向系统管理员,提供数据更新、数据源配置、用户管理等功能。管理员可以手动触发数据爬虫任务,更新"双一流"名单和高校基本信息;可以查看数据采集日志和清洗结果,监控数据质量;可以管理用户账号和权限,控制平台的访问范围。
五、数据分析与处理方案
(一)数据来源与采集
本平台的数据来源均为公开可获取的官方数据,具体包括:第一,教育部官网发布的第二轮"双一流"建设高校及建设学科名单(2022年2月发布),共147所高校、421个建设学科,这是平台的核心基础数据;第二,教育部学位与研究生教育发展中心发布的第四轮学科评估结果,作为学科实力的补充参考数据;第三,各高校官方网站发布的学校简介、学科设置、师资力量等基本信息;第四,公开统计年鉴中的各省高等教育毛入学率、在校研究生数量等宏观数据。
数据采集采用Python
Scrapy分布式爬虫框架,设置合理的请求间隔(2-3秒)和User-Agent轮换,遵守robots协议。爬虫系统部署在Hadoop集群的DataNode节点上,采集到的原始数据以JSON格式存储到HDFS的/raw目录下,按日期分区组织,便于历史数据追溯和增量更新。
(二)数据清洗与预处理
由于多源数据存在格式不统一、信息重复、缺失值等问题,需要进行系统化的清洗和预处理。数据清洗流程分为四个步骤:
第一步是数据解析与格式统一。将从不同网页采集的HTML、JSON、PDF等格式数据解析为统一的结构化表格,统一字段命名规范(如school_name、province、discipline_name、discipline_category等),统一日期格式和编码方式(UTF-8)。
第二步是重复数据去重。基于高校名称+学科名称的联合主键进行去重,使用Python
Pandas的drop_duplicates方法处理完全重复和近似重复记录。对于同一高校名称存在多个写法(如"中国科学技术大学"与"中科大")的情况,建立标准名称映射表进行归一化处理。
第三步是缺失值与异常值处理。对于学科类别缺失的记录,根据学科名称按《学位授予和人才培养学科目录》进行自动补全;对于异常数据(如高校成立年份早于1900年或晚于2020年),标记为异常并人工复核。
第四步是数据标准化。将清洗后的数据导入Hive数据仓库,按ODS(原始数据层)、DWD(明细数据层)、DWS(汇总数据层)、ADS(应用数据层)四层架构组织,为上层可视化分析提供标准化的数据服务。
(三)数据存储与计算
平台采用Hadoop+Spark的大数据处理架构,数据存储与计算方案如下:
在存储层面,原始数据和历史数据存储在HDFS分布式文件系统中,利用Hadoop的三副本机制保证数据可靠性。结构化业务数据存储在MySQL数据库中,供在线查询使用。热点查询结果(如各省高校数量统计、学科分类汇总)缓存到Redis中,减少数据库查询压力,提升响应速度。
在计算层面,采用Spark作为离线计算引擎。使用PySpark编写数据处理任务,主要包括:高校数量按省份聚合统计、学科数量按类别聚合统计、高校学科实力多指标计算、两轮名单对比分析等。Spark基于内存计算的特性比传统MapReduce快10-100倍,能够满足平台的批量数据处理需求。每日凌晨定时执行Spark任务,将前一日新增的增量数据与历史数据合并,更新汇总统计表。
在数据分析层面,重点开展三类分析:一是描述性统计分析,包括高校数量分布、学科类别占比、地域集中度等基本统计指标;二是对比分析,包括各省高校数量横向对比、不同类型高校学科结构对比、两轮名单纵向对比;三是关联分析,探索高校所在地经济发展水平与学科数量之间的相关性,为高等教育资源配置研究提供参考。
(四)可视化实现方案
前端可视化采用ECharts 5实现,针对不同分析需求设计不同的图表类型:
对于类别型数据对比(如各省高校数量),采用柱状图进行展示。柱状图的高度直观映射数值大小,柱子之间的间距便于横向比较。例如,展示2022年第二轮"双一流"建设高校数量排名前10的省份,北京市34所、江苏省16所、上海市15所、陕西省8所、湖北省7所,柱状图按降序排列后,用户可以一眼看出各省份的差距。
对于多维度综合评价(如高校学科实力),采用雷达图进行展示。雷达图的五个顶点分别对应基础学科、工程学科、哲社学科、医学学科、交叉学科五个维度,每个维度的数值为该校该类学科的入选数量。雷达图的面积和形状直观反映高校学科结构的均衡程度和特色方向,例如综合型大学雷达图面积大且形状饱满,行业特色型大学雷达图在对应维度突出但整体面积较小。
对于地域分布数据,采用中国地图热力图进行展示。地图颜色深浅表示该省份"双一流"高校数量的多少,颜色越深代表高校数量越多。用户可以通过鼠标悬停查看具体数值,点击省份可下钻查看该省高校列表。
所有可视化图表均支持交互功能:数据缩放、图例筛选、数据高亮、下钻查询等,用户可以根据自己的分析需求自由探索数据,而不是被动接受固定的图表展示。