news 2026/9/12 16:28:44

Data Science for Beginners 课程使用指南:从课程结构到 Jupyter、Quiz 与离线部署的完整实战手册

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Data Science for Beginners 课程使用指南:从课程结构到 Jupyter、Quiz 与离线部署的完整实战手册

Data Science for Beginners 课程使用指南:从课程结构到 Jupyter、Quiz 与离线部署的完整实战手册

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

本指南以 Data Science for Beginners 课程的 USAGE.md(本仓库根目录)为核心骨架,系统讲解这套"10 周、20 课"数据科学课程的实际使用方法。你将掌握课程的标准化学习流程、Jupyter Notebook 的启动与运行技巧、内置 Quiz 测验应用的本地启动与题目编号规则、四条典型学习路径(自学者路径、专题路径、项目制路径、云上路径),以及面向教师的教学计划安排与离线环境部署方案。

课程概况与本指南的定位

Data Science for Beginners 是一个面向零基础学习者的数据科学课程仓库,共包含20 节课、40 个测验、20 个作业,课程按主题划分为 6 大部分,每部分对应仓库中的独立目录(可从 docs/_sidebar.md 的侧边栏结构确认):

  • 1-Introduction:定义数据科学(01)、数据伦理(02)、定义数据(03)、概率与统计(04);
  • 2-Working-With-Data:关系型数据库(05)、非关系型数据库(06)、Python(07)、数据准备(08);
  • 3-Data-Visualization:数量可视化(09)、分布可视化(10)、占比可视化(11)、关系可视化(12)、有意义的信息图(13);
  • 4-Data-Science-Lifecycle:生命周期导论(14)、分析(15)、沟通(16);
  • 5-Data-Science-In-Cloud:云端数据科学导论(17)、低代码 ML 工具(18)、Azure 机器学习工作室(19);
  • 6-Data-Science-In-Wild:真实世界案例(20)。

本指南面向的是"如何使用"这套课程,而不是"如何安装"——环境搭建细节请参阅 INSTALLATION.md(包含 Git、Python、Jupyter、Node.js、Docsify 的逐步安装流程)。如果学习中遇到环境问题,可查阅 TROUBLESHOOTING.md 或 CONTRIBUTING.md。

如何使用这套课程

课程设计为高度灵活的形态,官方建议四种使用方式,可单独使用也可组合:

  • 自学(Self-paced learning):按自己的节奏独立完成每一课;
  • 课堂教学(Classroom instruction):作为结构化课程,由教师引导授课;
  • 学习小组(Study groups):与同伴协作学习、互相讨论;
  • 工作坊(Workshop format):以短期密集型学习班的形式集中推进。

无论采用哪种方式,每一课都遵循一套统一的"标准化课程结构",这是整套课程可复用的关键设计。

课程的标准结构与单课学习流程

每课固定的七步结构

每节课都按以下顺序组织内容,以保证学习体验的一致性:

  1. 课前测验(Pre-lesson Quiz):先测试既有知识,带着问题进入学习;
  2. 涂鸦笔记 Sketchnote(可选):对关键概念的视觉化总结,全部速记图集中在 sketchnotes 目录;
  3. 视频(可选):补充性的视频教学内容;
  4. 书面课程(Written Lesson):核心概念讲解,即各课目录下的README.md
  5. Jupyter Notebook:动手编程练习;
  6. 作业(Assignment):练习并巩固所学;
  7. 课后测验(Post-lesson Quiz):强化理解。

以第一课为例,1-Introduction/01-defining-data-science 目录下同时包含README.md(书面课程)、notebook.ipynb(编程练习)、assignment.md(作业)与solution/(参考答案),完整体现了这一结构。

单课标准操作流程

官方给出的单课学习命令流程如下(命令中的注释即操作说明):

# 1. 进入课程目录 cd 1-Introduction/01-defining-data-science # 2. 阅读 README.md # 在浏览器或编辑器中打开 README.md # 3. 完成课前测验 # 点击 README 中的测验链接 # 4. 打开 Jupyter notebook(如该课提供) jupyter notebook # 5. 完成 notebook 中的练习 # 6. 完成作业 # 7. 完成课后测验

在 Jupyter Notebook 中动手实践

启动 Jupyter

进入任一课程目录后,先激活虚拟环境再启动 Jupyter:

# 激活虚拟环境(macOS/Linux) source venv/bin/activate # Windows 使用 venv\Scripts\activate # 在仓库根目录启动 Jupyter jupyter notebook

浏览器将自动打开 Jupyter 界面,随后即可导航到任意课程的.ipynb文件。仓库中大量课程都预置了 notebook:例如 1-Introduction/04-stats-and-probability/notebook.ipynb、2-Working-With-Data/08-data-preparation/notebook.ipynb、3-Data-Visualization/09-visualization-quantities/notebook.ipynb 等。

Notebook 单元格的三种核心操作

  1. 执行单个单元格:按Shift + Enter,或点击工具栏 "Run" 按钮;
  2. 执行全部单元格:菜单 "Cell" → "Run All";
  3. 重启内核:若遇到状态异常或变量污染,选择 "Kernel" → "Restart" 重新初始化。

在 Notebook 中处理数据的标准范式

课程 notebook 统一使用 pandas + numpy + matplotlib 的"加载—探索—可视化"三段式写法(这段代码也是本仓库各课程 notebook 的共同模式,例如 08-data-preparation 的作业 notebook 即按此范式组织):

# 导入必需库 import pandas as pd import numpy as np import matplotlib.pyplot as plt # 加载数据集 df = pd.read_csv('data/sample.csv') # 探索数据 df.head() df.info() df.describe() # 创建可视化 plt.figure(figsize=(10, 6)) plt.plot(df['column_name']) plt.title('Sample Visualization') plt.xlabel('X-axis Label') plt.ylabel('Y-axis Label') plt.show()

实际练习时可将'data/sample.csv'替换为仓库 data 目录中真实存在的数据集,例如birds.csv(鸟类体征数据,用于可视化课程)、honey.csv(美国蜂蜜产量数据)、diabetes.tsv(糖尿病指标数据,注意是制表符分隔,需pd.read_csv('data/diabetes.tsv', sep='\t'))、mushrooms.csvtaxi.csv等;COVID 时序数据位于 data/COVID。

保存你的工作

  • Jupyter 会周期性自动保存;
  • 手动保存按Ctrl + S(macOS 为Cmd + S);
  • 所有进度保存在.ipynb文件中,该文件为 JSON 格式,可直接纳入版本管理。

使用 Quiz 测验应用

本地启动 Quiz 应用

Quiz 应用是一个基于 Vue 2 的前端工程,位于 quiz-app 目录,其package.json定义的启动脚本为vue-cli-service serve

# 进入 quiz 应用目录 cd quiz-app # 启动开发服务器 npm run serve # 浏览器访问 http://localhost:8080

从 quiz-app/src/main.js 可以看到应用使用 vue-router(mode: 'history')与 vue-i18n(默认语言en,回退语言en)构建;路由配置位于 quiz-app/src/router/index.js,核心路由为/quiz/:id,因此测验 URL 形如/quiz/0。生产构建使用npm run build,代码检查使用npm run lint

测验规则与编号体系

  • 每课两个测验:课前测验链接在每课 README 顶部,课后测验链接在 README 底部;
  • 每场测验 3 道题:这并非约定而是源码强制逻辑——quiz-app/src/components/Quiz.vue 的handleAnswerClick方法中写死nextQuestion < 3才继续出下一题,答满 3 题后进入完成状态;
  • 测验定位为"强化学习"而非"应试评估":答错会提示错误并要求重试(对应源码中的error状态);
  • 编号 0-39 共 40 个:与"20 课 × 每课前后各 1 个"一一对应,测验 URL 中包含编号,例如官方示例https://ff-quizzes.netlify.app/en/ds/quiz/0(第 1 课课前测验);
  • 多语言支持:测验题库按语言分组存放于 quiz-app/src/assets/translations,目前包含enesfr三套,可通过 URL 查询参数?loc=fr切换语言。

四条常见学习路径(Common Workflows)

路径 1:零基础完整路线

适合没有任何数据科学背景的初学者,按顺序学完 20 课:

# 1. 配置环境(参见 INSTALLATION.md) # 2. 从第 1 课开始 cd 1-Introduction/01-defining-data-science # 3. 对每一课: # - 完成课前测验 # - 阅读课程内容 # - 完成 notebook 练习 # - 完成作业 # - 完成课后测验 # 4. 依次学完全部 20 课

路径 2:专题定向学习

对某个主题感兴趣时,可跳过其他部分直达目标专题。例如聚焦数据可视化(第 9-13 课):

cd 3-Data-Visualization # 依次探索: # - 第 9 课:数量可视化 # - 第 10 课:分布可视化 # - 第 11 课:占比可视化 # - 第 12 课:关系可视化 # - 第 13 课:有意义的信息图

该目录下除各课 README 外,还提供 R 语言版本的可视化实现(见 3-Data-Visualization/R),适合偏好 R 的学习者对照学习。

路径 3:项目制学习

先建立"数据科学生命周期"的整体框架,再通过真实案例把知识串起来:

# 1. 先学习数据科学生命周期课程(第 14-16 课) cd 4-Data-Science-Lifecycle # 2. 完成第 20 课的真实世界案例 cd ../6-Data-Science-In-Wild/20-Real-World-Examples # 3. 将所学概念应用到自己的项目中

路径 4:云端数据科学

聚焦云端工作流(第 17-19 课),对应仓库 5-Data-Science-In-Cloud 目录:

# 学习云端数据科学(第 17-19 课) cd 5-Data-Science-In-Cloud # 第 17 课:云端数据科学导论 # 第 18 课:低代码 ML 工具 # 第 19 课:Azure 机器学习工作室

自学者建议

  • 保持组织性:建立学习日志,为每课创建笔记文件:
    mkdir my-learning-journal echo "# Lesson 1 Notes" > my-learning-journal/lesson-01-notes.md
  • 规律练习:每天或每周固定投入时间,建议每周至少完成一课,并周期性回顾已学内容;
  • 学以致用:学完课程后将技术迁移到自己的项目,官方给出的自查清单覆盖了课程核心技能:
    # 示例:分析自己的数据集 import pandas as pd # 加载自己的数据 my_data = pd.read_csv('my-project/data.csv') # 应用学到的技术 # - 数据清洗(第 8 课) # - 探索性数据分析(第 7 课) # - 数据可视化(第 9-13 课) # - 数据分析(第 15 课)

教师使用指南

课堂环境搭建

  1. 详细指引参见 for-teachers.md,其中说明了如何 fork 本仓库并使用 GitHub Classroom 按课拆分仓库、以私有仓库让学生提交作业等操作;
  2. 搭建共享环境(GitHub Classroom 或 Codespaces);
  3. 建立沟通渠道(Discord、Slack 或 Teams)。

推荐的 10 周教学计划

官方按"6 大部分、20 课"给出了可直接照搬的教学排期:

  • 第 1-2 周:导论(第 1-4 课);
  • 第 3-4 周:处理数据(第 5-8 课);
  • 第 5-6 周:数据可视化(第 9-13 课);
  • 第 7-8 周:数据科学生命周期(第 14-16 课);
  • 第 9 周:云端数据科学(第 17-19 课);
  • 第 10 周:真实世界应用与期末项目(第 20 课)。

用 Docsify 实现离线课堂访问

本仓库以 Docsify 组织文档(侧边栏结构见 docs/_sidebar.md),教师可用 Docsify 在本地起一个纯静态文档站,学生连接同一局域网即可访问,首次初始化后无需联网:

# 在仓库根目录本地托管文档 docsify serve # 学生访问 localhost:3000 # 初始配置完成后无需联网

作业批改与自定义作业模板

  • 批改要点:检查学生 notebook 是否完成全部练习、通过测验得分判断理解程度、用数据科学生命周期原则评估期末项目;
  • 自定义作业模板:官方给出的标准模板要求作业覆盖"加载探索 → 清洗准备 → 至少 3 张可视化 → 分析 → 沟通结论"完整链路,产出物为带代码与解释的 Jupyter notebook 加书面结论总结。

完全离线使用

预下载资源

# 克隆整个仓库 git clone https://github.com/microsoft/Data-Science-For-Beginners.git # 数据集已提前内置 # 大多数数据集已包含在仓库的 data/ 目录中

克隆后即可在无网环境中使用全部课程文档、数据集与 notebook。

本地运行文档与 Quiz

# 1. 用 Docsify 本地托管文档 docsify serve # 访问 localhost:3000 # 2. 本地启动 Quiz 应用 cd quiz-app npm run serve # 访问 localhost:8080

需要说明的是:Quiz 应用与 Docsify 文档站依赖 npm 依赖包预装完成,因此建议在联网环境下先完成 INSTALLATION.md 中的环境准备步骤。

访问多语言翻译内容

仓库在 translations 目录下提供40+ 语言的完整翻译,每套翻译与英文原版保持完全一致的目录结构(各语言均包含 70 个 md 文档与 25 个 ipynb notebook):

# 访问翻译版课程 cd translations/fr # 法语 cd translations/es # 西班牙语 cd translations/de # 德语 # ... 以及更多语言

本文档对应的希腊语版本即位于 translations/el/USAGE.md,可对照阅读。此外 translated_images 目录为各语言提供翻译后的课程配图。

常见问题排查与进一步学习

遇到问题时按以下顺序排查:

  1. 查看 TROUBLESHOOTING.md 中记录的常见问题(如端口被占用、notebook 内核异常等);
  2. 在仓库 Issues 中搜索是否已有相同问题;
  3. 如需报告问题或参与贡献,遵循 CONTRIBUTING.md 的流程。

本课程是微软"for Beginners"系列课程之一,同系列还包括 AI、ML、Web Dev 与 Generative AI 等主题课程,学完本课程后可沿同类路径继续进阶。所有课程资源(含数据集、notebook、涂鸦笔记)均已包含在本仓库中,无需额外获取外部资料即可完整走完 10 周的学习旅程。

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 16:28:33

Supertonic语音合成:社区贡献从0到1实战

Supertonic语音合成&#xff1a;社区贡献从0到1实战 【免费下载链接】supertonic Lightning-Fast, On-Device, Multilingual TTS — running natively via ONNX. 项目地址: https://gitcode.com/GitHub_Trending/sup/supertonic 电子阅读器上 RTF 0.3 实时朗读&#xff…

作者头像 李华