Data Science for Beginners:用 Planetary Computer Explorer 探索可持续性数据集——实战作业全解析
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
导读
本篇文章围绕 Data Science for Beginners 课程最后一课(20-Real-World-Examples)的实战作业展开,任务是利用微软 Planetary Computer 的 Explorer 界面,选择一个与可持续性相关的遥感数据集,通过「选数据集 → 选预设查询 → 选渲染方式」三步完成可视化,并回答五个关于数据特征、洞察、影响、局限与替代可视化的分析问题。读完本文,你将掌握无账号探索地球系统大数据的基本流程,并能把课程前几课学到的 pandas / matplotlib / seaborn 可视化技能迁移到真实地理空间数据上,甚至通过 Launch Hub 在 Notebook 中实现自己的替代可视化。
作业的来龙去脉:数据科学 × 可持续性
这项作业对应课程的最后一节「数据科学在真实世界中的应用」(英文原版、西班牙语翻译)。该课将数据科学的应用划分为四个领域:工业、科研(如 MIT Gender Shades 研究)、数字人文(如 Emily Dickinson 诗歌情感分析)与可持续性——作业正是聚焦最后一个领域。
可持续性议题的宏大背景是 2015 年联合国通过的《2030 年可持续发展议程》及其 17 项目标;微软可持续性倡议进一步将其落到四项可量化的工程目标:碳负排放(carbon negative)、水正效益(water positive)、零废弃物(zero waste)与生物多样性(bio-diverse)。要在大规模、及时的条件下应对气候与生态挑战,必须依赖云规模的算力和大规模数据——这正是 Planetary Computer 项目存在的意义。项目本身处于预览阶段,共提供四个组件:
| 组件 | 用途 |
|---|---|
| Data Catalog(数据目录) | PB 级地球系统数据,免费且托管于 Azure |
| Planetary API | 按空间与时间检索相关数据 |
| Hub | 供科学家处理海量地理空间数据集的托管环境 |
| Applications(应用) | 展示可持续性洞察的使用案例与工具 |
本作业使用的Explorer即建立在 Data Catalog 之上,是不需要申请账号即可体验的交互式可视化入口;若想走「加分项」的完整流程(申请账号、用 Hub 打开 Notebook),才需要额外申请访问权限。
核心操作流程:Explorer 的三步工作流
Explorer 的界面(见下图)遵循**「数据集 → 查询 → 渲染」**三步筛选逻辑:左侧交互面板提供三个下拉菜单,右侧地图区域实时渲染所选数据的空间分布,顶部导航栏提供 Explore / Data Catalog / Hub / Applications / Documentation 等入口。
作业要求依次完成三个步骤:
- 阅读 Explorer 文档:先理解界面各选项的含义——数据集下拉菜单决定你要可视化的卫星/遥感数据源;预设查询用于按时间范围、地理区域等条件过滤数据;渲染选项决定数据在地图上的呈现方式(如假彩色合成、植被指数 NDVI 等色带映射)。理解这些选项是后续能提出有质量问题的前提。
- 浏览数据集目录(Catalog):逐一了解每个数据集的用途——例如 Landsat、Sentinel-2 等光学遥感数据,以及冰川、土地覆盖、森林等专题数据,判断哪个与可持续性议题(如森林砍伐率、冰川消融、土地利用变化)最相关。
- 使用 Explorer 完成一次完整探索:从目录中选择一个自己感兴趣的数据集,配合一个相关性强的预设查询与合适的渲染选项,在浏览器中生成可视化。
操作时界面还提供Reset(重置)按钮,便于清空当前设置重新开始筛选,可放心反复尝试不同组合。
分析任务:五个必须回答的核心问题
可视化生成后,作业要求围绕以下五个问题展开书面分析。这五个问题构成了一条完整的「数据 → 洞察 → 行动 → 反思」分析链条:
- 数据特征(features):数据集包含哪些特征(字段)?例如时间分辨率(每天/每 8 天/每年)、空间分辨率(米级/公里级)、波段类型、覆盖的地理区域等。需要回到 Catalog 中的数据集元数据确认。
- 洞察或结果(insights):当前可视化揭示了什么?例如某区域植被指数在时间序列上的变化趋势、森林覆盖率的空间分布差异等。描述你从图中实际读到的信息,而不是泛泛而谈。
- 对可持续性目标的含义(implications):这些洞察对课程中提到的可持续性目标(碳负排放、水正效益、零废弃物、生物多样性,或联合国 17 项 SDG)意味着什么?例如发现某流域水体面积持续缩小,可能指向水正效益目标下的监测需求。
- 可视化的局限(limitations):你从当前可视化中没有得到什么信息?例如缺少数值精度、无法量化变化幅度、只有单一时相看不到趋势、渲染色带掩盖了小范围异常等。
- 替代可视化(alternative visualizations):如果能拿到原始数据,你会构建哪些替代可视化?为什么?——这是把问题引向本课程可视化专题的关键一步,具体思路见下文。
加分项:申请账号并用 Launch Hub 在 Notebook 中验证假设
基础任务无需账号即可完成;加分项则要求走完整流程:
- 申请访问权限:在 Planetary Computer 站点提交账号申请,获批后登录。
- 使用 Launch Hub 打开原始数据:在 Explorer 中通过Launch Hub选项,把当前数据集以原始形式载入 Notebook 环境,得到可编程访问的数据(通常对应 STAC 检索 API 返回的影像与元数据)。
- 交互式探索并实现替代可视化:在 Notebook 中加载数据,把你在第 5 个问题中设想的可视化逐一实现出来。
- 复盘对比:分析你的自定义可视化——之前缺失的信息(如精确数值、时间趋势、统计分布)现在拿到了吗?哪些新的局限又浮现出来?
这一流程恰好完整复刻了本课程所教授的数据科学生命周期:数据获取(Acquisition)→ 数据清理 → 数据分析 → 可视化,是把它从教学 Notebook 搬到真实云端数据上的一次演练。
与课程可视化章节的衔接:替代可视化怎么设计
课程在第 3 部分用了五个章节专门讲可视化(数量、分布、比例、关系、有意义可视化),作业第 5 问正是要求你调用这些知识。设计替代可视化时,可参照课程 Notebook 中的成熟做法:
- 时间趋势:若数据集含多个时相(如月/年序列),可参照 09-visualization-quantities 用折线图展现植被指数或水体面积的年际变化,捕捉 Explorer 单帧渲染看不到的趋势。
- 分布刻画:参照 10-visualization-distributions 用直方图或箱线图刻画某指标(如 NDVI 值、地表温度)的总体分布,判断是否存在偏态或离群区域。
- 占比构成:参照 11-visualization-proportions 用饼图/环形图或堆叠条形图展示土地利用类型占比,量化「被占用/被破坏」的结构。
- 关系探索:参照 12-visualization-relationships 用散点图探究两个指标间的关系(如人口密度与植被覆盖、降水量与 NDVI)。
- 相关性分析:参照 13-meaningful-visualizations/correlation-analysis.ipynb 中
pandas + seaborn + matplotlib的组合套路(import pandas as pd / import seaborn as sns / import matplotlib.pyplot as plt),在 Notebook 中计算相关系数并用热力图或pairplot呈现多维关系。
快速选型对照表(可直接用于回答第 5 问):
| 你想回答的问题 | 建议的可视化 | 参考 Notebook |
|---|---|---|
| 指标随时间如何变化? | 折线图 / 时间序列 | 09 数量可视化 |
| 指标值分布是否均衡? | 直方图 / 箱线图 | 10 分布可视化 |
| 不同类别各占多少? | 饼图 / 堆叠条形图 | 11 比例可视化 |
| 两个变量是否相关? | 散点图 / 相关热力图 | 12 关系可视化 与 13 相关性分析 |
同时可阅读课程对「有意义可视化」(13-meaningful-visualizations)的讨论:好的可视化要能诚实地传达信息、避免误导性比例与失真的坐标轴——这正好用来审视 Explorer 默认渲染可能带来的局限。
评分标准(Rúbrica)
作业附带的评分标准明确了三个档次,可作为自查清单:
| 卓越(Excepcional) | 合格(Adecuado) | 需改进(Necesita Mejorar) |
|---|---|---|
| 回答了全部五个核心问题,并清晰指出当前可视化与替代可视化如何为可持续性目标或成果提供洞察 | 至少详细回答了前三个问题,表现出对 Explorer 的实际操作经验 | 多个问题未作答或细节不足,说明未对项目做出有意义的尝试 |
对照此表,建议按「先完成前三个问题 → 补足全部五问 → 再走加分项验证」的次序推进,确保至少达到「合格」档。
小结与延伸
这项作业的价值在于:它把课程前 19 课积累的数据处理与可视化技能,投射到一个真实的、PB 级的地球观测数据生态中,让你以极低门槛(甚至无需账号)体验从「数据源选择」到「空间可视化」再到「洞察评估」的完整闭环。完成后你还可以回到 课程目录 与 整套课程仓库 回顾对应的可视化与数据分析章节,把这次作业的思考沉淀为自己可持续性数据科学作品的起点。
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考