Data Science for Beginners 课程使用指南:从课程结构到 Jupyter、Quiz 与离线部署的完整实战手册
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
本指南以 Data Science for Beginners 课程的 USAGE.md(本仓库根目录)为核心骨架,系统讲解这套"10 周、20 课"数据科学课程的实际使用方法。你将掌握课程的标准化学习流程、Jupyter Notebook 的启动与运行技巧、内置 Quiz 测验应用的本地启动与题目编号规则、四条典型学习路径(自学者路径、专题路径、项目制路径、云上路径),以及面向教师的教学计划安排与离线环境部署方案。
课程概况与本指南的定位
Data Science for Beginners 是一个面向零基础学习者的数据科学课程仓库,共包含20 节课、40 个测验、20 个作业,课程按主题划分为 6 大部分,每部分对应仓库中的独立目录(可从 docs/_sidebar.md 的侧边栏结构确认):
- 1-Introduction:定义数据科学(01)、数据伦理(02)、定义数据(03)、概率与统计(04);
- 2-Working-With-Data:关系型数据库(05)、非关系型数据库(06)、Python(07)、数据准备(08);
- 3-Data-Visualization:数量可视化(09)、分布可视化(10)、占比可视化(11)、关系可视化(12)、有意义的信息图(13);
- 4-Data-Science-Lifecycle:生命周期导论(14)、分析(15)、沟通(16);
- 5-Data-Science-In-Cloud:云端数据科学导论(17)、低代码 ML 工具(18)、Azure 机器学习工作室(19);
- 6-Data-Science-In-Wild:真实世界案例(20)。
本指南面向的是"如何使用"这套课程,而不是"如何安装"——环境搭建细节请参阅 INSTALLATION.md(包含 Git、Python、Jupyter、Node.js、Docsify 的逐步安装流程)。如果学习中遇到环境问题,可查阅 TROUBLESHOOTING.md 或 CONTRIBUTING.md。
如何使用这套课程
课程设计为高度灵活的形态,官方建议四种使用方式,可单独使用也可组合:
- 自学(Self-paced learning):按自己的节奏独立完成每一课;
- 课堂教学(Classroom instruction):作为结构化课程,由教师引导授课;
- 学习小组(Study groups):与同伴协作学习、互相讨论;
- 工作坊(Workshop format):以短期密集型学习班的形式集中推进。
无论采用哪种方式,每一课都遵循一套统一的"标准化课程结构",这是整套课程可复用的关键设计。
课程的标准结构与单课学习流程
每课固定的七步结构
每节课都按以下顺序组织内容,以保证学习体验的一致性:
- 课前测验(Pre-lesson Quiz):先测试既有知识,带着问题进入学习;
- 涂鸦笔记 Sketchnote(可选):对关键概念的视觉化总结,全部速记图集中在 sketchnotes 目录;
- 视频(可选):补充性的视频教学内容;
- 书面课程(Written Lesson):核心概念讲解,即各课目录下的
README.md; - Jupyter Notebook:动手编程练习;
- 作业(Assignment):练习并巩固所学;
- 课后测验(Post-lesson Quiz):强化理解。
以第一课为例,1-Introduction/01-defining-data-science 目录下同时包含README.md(书面课程)、notebook.ipynb(编程练习)、assignment.md(作业)与solution/(参考答案),完整体现了这一结构。
单课标准操作流程
官方给出的单课学习命令流程如下(命令中的注释即操作说明):
# 1. 进入课程目录 cd 1-Introduction/01-defining-data-science # 2. 阅读 README.md # 在浏览器或编辑器中打开 README.md # 3. 完成课前测验 # 点击 README 中的测验链接 # 4. 打开 Jupyter notebook(如该课提供) jupyter notebook # 5. 完成 notebook 中的练习 # 6. 完成作业 # 7. 完成课后测验在 Jupyter Notebook 中动手实践
启动 Jupyter
进入任一课程目录后,先激活虚拟环境再启动 Jupyter:
# 激活虚拟环境(macOS/Linux) source venv/bin/activate # Windows 使用 venv\Scripts\activate # 在仓库根目录启动 Jupyter jupyter notebook浏览器将自动打开 Jupyter 界面,随后即可导航到任意课程的.ipynb文件。仓库中大量课程都预置了 notebook:例如 1-Introduction/04-stats-and-probability/notebook.ipynb、2-Working-With-Data/08-data-preparation/notebook.ipynb、3-Data-Visualization/09-visualization-quantities/notebook.ipynb 等。
Notebook 单元格的三种核心操作
- 执行单个单元格:按
Shift + Enter,或点击工具栏 "Run" 按钮; - 执行全部单元格:菜单 "Cell" → "Run All";
- 重启内核:若遇到状态异常或变量污染,选择 "Kernel" → "Restart" 重新初始化。
在 Notebook 中处理数据的标准范式
课程 notebook 统一使用 pandas + numpy + matplotlib 的"加载—探索—可视化"三段式写法(这段代码也是本仓库各课程 notebook 的共同模式,例如 08-data-preparation 的作业 notebook 即按此范式组织):
# 导入必需库 import pandas as pd import numpy as np import matplotlib.pyplot as plt # 加载数据集 df = pd.read_csv('data/sample.csv') # 探索数据 df.head() df.info() df.describe() # 创建可视化 plt.figure(figsize=(10, 6)) plt.plot(df['column_name']) plt.title('Sample Visualization') plt.xlabel('X-axis Label') plt.ylabel('Y-axis Label') plt.show()实际练习时可将'data/sample.csv'替换为仓库 data 目录中真实存在的数据集,例如birds.csv(鸟类体征数据,用于可视化课程)、honey.csv(美国蜂蜜产量数据)、diabetes.tsv(糖尿病指标数据,注意是制表符分隔,需pd.read_csv('data/diabetes.tsv', sep='\t'))、mushrooms.csv、taxi.csv等;COVID 时序数据位于 data/COVID。
保存你的工作
- Jupyter 会周期性自动保存;
- 手动保存按
Ctrl + S(macOS 为Cmd + S); - 所有进度保存在
.ipynb文件中,该文件为 JSON 格式,可直接纳入版本管理。
使用 Quiz 测验应用
本地启动 Quiz 应用
Quiz 应用是一个基于 Vue 2 的前端工程,位于 quiz-app 目录,其package.json定义的启动脚本为vue-cli-service serve:
# 进入 quiz 应用目录 cd quiz-app # 启动开发服务器 npm run serve # 浏览器访问 http://localhost:8080从 quiz-app/src/main.js 可以看到应用使用 vue-router(mode: 'history')与 vue-i18n(默认语言en,回退语言en)构建;路由配置位于 quiz-app/src/router/index.js,核心路由为/quiz/:id,因此测验 URL 形如/quiz/0。生产构建使用npm run build,代码检查使用npm run lint。
测验规则与编号体系
- 每课两个测验:课前测验链接在每课 README 顶部,课后测验链接在 README 底部;
- 每场测验 3 道题:这并非约定而是源码强制逻辑——quiz-app/src/components/Quiz.vue 的
handleAnswerClick方法中写死nextQuestion < 3才继续出下一题,答满 3 题后进入完成状态; - 测验定位为"强化学习"而非"应试评估":答错会提示错误并要求重试(对应源码中的
error状态); - 编号 0-39 共 40 个:与"20 课 × 每课前后各 1 个"一一对应,测验 URL 中包含编号,例如官方示例
https://ff-quizzes.netlify.app/en/ds/quiz/0(第 1 课课前测验); - 多语言支持:测验题库按语言分组存放于 quiz-app/src/assets/translations,目前包含
en、es、fr三套,可通过 URL 查询参数?loc=fr切换语言。
四条常见学习路径(Common Workflows)
路径 1:零基础完整路线
适合没有任何数据科学背景的初学者,按顺序学完 20 课:
# 1. 配置环境(参见 INSTALLATION.md) # 2. 从第 1 课开始 cd 1-Introduction/01-defining-data-science # 3. 对每一课: # - 完成课前测验 # - 阅读课程内容 # - 完成 notebook 练习 # - 完成作业 # - 完成课后测验 # 4. 依次学完全部 20 课路径 2:专题定向学习
对某个主题感兴趣时,可跳过其他部分直达目标专题。例如聚焦数据可视化(第 9-13 课):
cd 3-Data-Visualization # 依次探索: # - 第 9 课:数量可视化 # - 第 10 课:分布可视化 # - 第 11 课:占比可视化 # - 第 12 课:关系可视化 # - 第 13 课:有意义的信息图该目录下除各课 README 外,还提供 R 语言版本的可视化实现(见 3-Data-Visualization/R),适合偏好 R 的学习者对照学习。
路径 3:项目制学习
先建立"数据科学生命周期"的整体框架,再通过真实案例把知识串起来:
# 1. 先学习数据科学生命周期课程(第 14-16 课) cd 4-Data-Science-Lifecycle # 2. 完成第 20 课的真实世界案例 cd ../6-Data-Science-In-Wild/20-Real-World-Examples # 3. 将所学概念应用到自己的项目中路径 4:云端数据科学
聚焦云端工作流(第 17-19 课),对应仓库 5-Data-Science-In-Cloud 目录:
# 学习云端数据科学(第 17-19 课) cd 5-Data-Science-In-Cloud # 第 17 课:云端数据科学导论 # 第 18 课:低代码 ML 工具 # 第 19 课:Azure 机器学习工作室自学者建议
- 保持组织性:建立学习日志,为每课创建笔记文件:
mkdir my-learning-journal echo "# Lesson 1 Notes" > my-learning-journal/lesson-01-notes.md - 规律练习:每天或每周固定投入时间,建议每周至少完成一课,并周期性回顾已学内容;
- 学以致用:学完课程后将技术迁移到自己的项目,官方给出的自查清单覆盖了课程核心技能:
# 示例:分析自己的数据集 import pandas as pd # 加载自己的数据 my_data = pd.read_csv('my-project/data.csv') # 应用学到的技术 # - 数据清洗(第 8 课) # - 探索性数据分析(第 7 课) # - 数据可视化(第 9-13 课) # - 数据分析(第 15 课)
教师使用指南
课堂环境搭建
- 详细指引参见 for-teachers.md,其中说明了如何 fork 本仓库并使用 GitHub Classroom 按课拆分仓库、以私有仓库让学生提交作业等操作;
- 搭建共享环境(GitHub Classroom 或 Codespaces);
- 建立沟通渠道(Discord、Slack 或 Teams)。
推荐的 10 周教学计划
官方按"6 大部分、20 课"给出了可直接照搬的教学排期:
- 第 1-2 周:导论(第 1-4 课);
- 第 3-4 周:处理数据(第 5-8 课);
- 第 5-6 周:数据可视化(第 9-13 课);
- 第 7-8 周:数据科学生命周期(第 14-16 课);
- 第 9 周:云端数据科学(第 17-19 课);
- 第 10 周:真实世界应用与期末项目(第 20 课)。
用 Docsify 实现离线课堂访问
本仓库以 Docsify 组织文档(侧边栏结构见 docs/_sidebar.md),教师可用 Docsify 在本地起一个纯静态文档站,学生连接同一局域网即可访问,首次初始化后无需联网:
# 在仓库根目录本地托管文档 docsify serve # 学生访问 localhost:3000 # 初始配置完成后无需联网作业批改与自定义作业模板
- 批改要点:检查学生 notebook 是否完成全部练习、通过测验得分判断理解程度、用数据科学生命周期原则评估期末项目;
- 自定义作业模板:官方给出的标准模板要求作业覆盖"加载探索 → 清洗准备 → 至少 3 张可视化 → 分析 → 沟通结论"完整链路,产出物为带代码与解释的 Jupyter notebook 加书面结论总结。
完全离线使用
预下载资源
# 克隆整个仓库 git clone https://github.com/microsoft/Data-Science-For-Beginners.git # 数据集已提前内置 # 大多数数据集已包含在仓库的 data/ 目录中克隆后即可在无网环境中使用全部课程文档、数据集与 notebook。
本地运行文档与 Quiz
# 1. 用 Docsify 本地托管文档 docsify serve # 访问 localhost:3000 # 2. 本地启动 Quiz 应用 cd quiz-app npm run serve # 访问 localhost:8080需要说明的是:Quiz 应用与 Docsify 文档站依赖 npm 依赖包预装完成,因此建议在联网环境下先完成 INSTALLATION.md 中的环境准备步骤。
访问多语言翻译内容
仓库在 translations 目录下提供40+ 语言的完整翻译,每套翻译与英文原版保持完全一致的目录结构(各语言均包含 70 个 md 文档与 25 个 ipynb notebook):
# 访问翻译版课程 cd translations/fr # 法语 cd translations/es # 西班牙语 cd translations/de # 德语 # ... 以及更多语言本文档对应的希腊语版本即位于 translations/el/USAGE.md,可对照阅读。此外 translated_images 目录为各语言提供翻译后的课程配图。
常见问题排查与进一步学习
遇到问题时按以下顺序排查:
- 查看 TROUBLESHOOTING.md 中记录的常见问题(如端口被占用、notebook 内核异常等);
- 在仓库 Issues 中搜索是否已有相同问题;
- 如需报告问题或参与贡献,遵循 CONTRIBUTING.md 的流程。
本课程是微软"for Beginners"系列课程之一,同系列还包括 AI、ML、Web Dev 与 Generative AI 等主题课程,学完本课程后可沿同类路径继续进阶。所有课程资源(含数据集、notebook、涂鸦笔记)均已包含在本仓库中,无需额外获取外部资料即可完整走完 10 周的学习旅程。
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考