Data Science for Beginners 环境安装配置完全指南:从零搭建数据科学学习环境
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
本篇技术指南围绕开源课程仓库 Data Science for Beginners 的安装文档展开,系统讲解如何从零搭建一套可用于学习 20 节课、10 周数据科学课程(含 Jupyter Notebook 实战、40 道课前/课后测验 Quiz 与离线文档)的完整本地开发环境。读完本文,你将掌握 Git 克隆、Python/Jupyter 环境配置、数据科学依赖库安装、Vue Quiz 应用启动以及 Docsify 离线文档服务的完整实操流程,并了解仓库底层配置对各项命令的支撑原理。
安装前置条件
在开始安装之前,建议先确认自己具备以下基础条件,这决定了后续流程能否顺利推进:
- 命令行/终端的基本操作能力:后续的克隆、虚拟环境激活、包管理命令都在终端中完成;
- 一个 GitHub 账号(免费):用于克隆仓库,并支持后续通过 Codespaces 云端开发或提交 Issue 获取帮助;
- 稳定的网络连接:首次安装需要下载 Git、Python、Node.js 以及若干 Python 包和 npm 依赖。
快速开始:两种方式任选
安装文档提供了两条路径:云端零配置的 Codespaces 方案(适合初学者)和本地完整安装方案(适合深度定制)。
方式一:GitHub Codespaces(初学者推荐)
Codespaces 会在浏览器中直接启动一个预装全部依赖的开发环境,省去所有本地安装步骤:
- 打开本课程仓库主页;
- 点击Code下拉菜单;
- 切换到Codespaces标签页;
- 点击Create codespace on main;
- 等待环境初始化完成(约 2~3 分钟)。
初始化完成后,环境中已预装全部依赖,可直接打开任意一课对应的.ipynb文件开始学习。
方式二:本地开发环境
如果需要在自己电脑上长期、稳定地使用课程资源(例如配合翻译版课程离线学习),请按下文八个步骤完整搭建。下文命令与仓库实际结构一一对应,可放心复制执行。
本地安装八步走
第 1 步:安装 Git
Git 用于克隆仓库并跟踪你的改动,是后续所有操作的基础。
Windows:从 git-scm.com 下载安装包,按默认设置完成安装。
macOS:通过 Homebrew 安装,或从 git-scm.com 下载。
brew install gitLinux(按发行版选择):
# Debian/Ubuntu sudo apt-get update sudo apt-get install git # Fedora sudo dnf install git # Arch sudo pacman -S git安装后可用git --version验证版本。
第 2 步:克隆仓库
# 克隆课程仓库 git clone https://github.com/microsoft/Data-Science-For-Beginners.git # 进入仓库目录 cd Data-Science-For-Beginners克隆完成后,仓库根目录包含六个课程单元目录(1-Introduction至6-Data-Science-In-Wild)、data/数据集目录、quiz-app/测验应用、sketchnotes/图解笔记,以及translations/下 40+ 语言的翻译版课程(例如translations/de/德语版、translations/zh-CN/简体中文版),完整目录结构可参见仓库根目录的 README.md。
第 3 步:安装 Python 与 Jupyter
数据科学课程要求Python 3.7 或更高版本,课程中的 Notebook 均基于该版本编写。
Windows:从 python.org 下载安装包,安装时务必勾选"Add Python to PATH",否则命令行无法直接调用python。验证:
python --versionmacOS:
brew install python3 python3 --versionLinux(多数发行版预装 Python 3):
python3 --version # 若未安装,则按发行版安装: # Debian/Ubuntu sudo apt-get install python3 python3-pip # Fedora sudo dnf install python3 python3-pip第 4 步:创建 Python 虚拟环境
推荐使用虚拟环境隔离依赖,避免污染系统 Python 环境:
# 在仓库根目录创建虚拟环境 python -m venv venv # 激活虚拟环境 # Windows: venv\Scripts\activate # macOS/Linux: source venv/bin/activate激活后,终端提示符会显示(venv)前缀,表示当前所有 Python 命令均来自该虚拟环境。
第 5 步:安装数据科学 Python 包
一次性安装课程所需的全部核心库:
pip install jupyter pandas numpy matplotlib seaborn scikit-learn各库在课程中的用途与仓库佐证如下:
- jupyter:运行课程全部
.ipynbNotebook(如 1-Introduction/01-defining-data-science/notebook.ipynb 中的文本挖掘实战、3-Data-Visualization/09-visualization-quantities/notebook.ipynb 中的图表绘制); - pandas / numpy:课程第 7 课 "Working with Python" 的核心依赖,用于 DataFrame 数据探索与数值计算,README.md 中明确列出其用于 Python 数据探索;
- matplotlib / seaborn:第 9~13 课可视化专题使用,仓库 data/ 目录下的
birds.csv、honey.csv、mushrooms.csv等数据集即用于这些绘图练习; - scikit-learn:课程第 15 课数据分析(4-Data-Science-Lifecycle/15-analyzing/notebook.ipynb)中用于建模与分析的机器学习库。
如需按课程单元增量安装,可参考各课 README 中的导入语句按需补充。
第 6 步:安装 Node.js 与 npm(Quiz 测验应用需要)
测验应用(Quiz App)基于 Vue 2 构建,需要 Node.js 与 npm 运行。
Windows/macOS:从 nodejs.org 下载 LTS 版本安装包,运行安装程序即可。
Linux:
# Debian/Ubuntu # 注意:将网络脚本直接管道到 bash 存在安全风险,建议先下载审阅再执行: # curl -fsSL https://deb.nodesource.com/setup_lts.x -o setup_lts.x # less setup_lts.x # sudo -E bash setup_lts.x # # 若接受上述风险,可使用下面的一行命令: curl -fsSL https://deb.nodesource.com/setup_lts.x | sudo -E bash - sudo apt-get install -y nodejs # Fedora sudo dnf install nodejs # 验证安装 node --version npm --version第 7 步:安装 Quiz 应用依赖
仓库的 quiz-app/package.json 声明了测验应用的依赖与脚本,从中可以看到该应用的核心技术栈:vue(2.6)、vue-router(路由)、vue-i18n(多语言),以及@vue/cli-service提供的serve/build/lint三个脚本。安装依赖:
# 进入 quiz-app 目录 cd quiz-app # 安装全部依赖(生成 node_modules) npm install # 返回仓库根目录 cd ..第 8 步:安装 Docsify(可选,用于离线阅读文档)
若希望在无网络环境下离线浏览课程文档,可全局安装 Docsify CLI:
npm install -g docsify-cliDocsify 的配置在仓库根目录 index.html 中可见:页面通过window.$docsify配置了name: 'Data Science for Beginners'与relativePath: true,配合docsify.min.js运行时即可将全部 Markdown 文档渲染为可浏览的站点,这正是docsify serve命令能够工作的底层依据。
验证安装是否成功
验证 Python 与 Jupyter
# 若虚拟环境尚未激活,先激活 # Windows: venv\Scripts\activate # macOS/Linux: source venv/bin/activate # 启动 Jupyter Notebook jupyter notebook浏览器会自动打开 Jupyter 界面。此时可导航到任一课程的.ipynb文件,例如 1-Introduction/01-defining-data-science/notebook.ipynb,点击单元格并运行,验证 Python 内核与 pandas 等依赖是否工作正常。
验证 Quiz 测验应用
cd quiz-app npm run servenpm run serve对应 quiz-app/package.json 中的vue-cli-service serve命令。启动后测验应用默认运行在http://localhost:8080(若 8080 端口被占用会自动切换其他端口)。该应用入口为 quiz-app/src/main.js,其中通过vue-i18n将默认语言设为en,并挂载了路由与根组件,可在浏览器中看到 40 道课前/课后测验(编号 0~39)的交互界面。
验证文档服务
# 在仓库根目录执行 docsify serve文档站点默认运行在http://localhost:3000,基于 index.html 中的 Docsify 配置渲染全部课程 Markdown,适合课堂离线教学场景。
使用 VS Code Dev Containers 开发
若已安装 Docker,可采用容器化方案,环境隔离更彻底:
- 安装 Docker Desktop;
- 安装 Visual Studio Code;
- 安装 Remote - Containers 扩展;
- 在 VS Code 中打开仓库;
- 按
F1选择Remote-Containers: Reopen in Container; - 等待容器构建完成(仅首次需要,之后秒级启动)。
容器内会提供一致的依赖环境,避免不同操作系统带来的差异问题。
安装后的下一步
环境就绪后,建议按以下路径继续:
- 阅读仓库根目录 README.md 了解课程全貌与六单元结构(数据科学导论 → 数据处理 → 可视化 → 生命周期 → 云端数据科学 → 真实世界案例);
- 查看 USAGE.md 了解常见学习工作流:逐课顺序学习、按主题选学(如仅学习 3-Data-Visualization 的第 9~13 课)、项目驱动学习以及云端数据科学路径;
- 若在安装或运行中遇到问题,先查阅 TROUBLESHOOTING.md 中的常见问题排查方案;
- 若希望为课程贡献翻译或内容,参考 CONTRIBUTING.md 的贡献流程(仓库中
translations/目录下已有 40+ 语言版本可对照参考)。
常见问题与求助渠道
遇到问题时按顺序排查:
- 先阅读 TROUBLESHOOTING.md 排查指南;
- 在仓库的 GitHub Issues 中搜索是否已有相同问题;
- 加入课程官方 Discord 社区(
aka.ms/ds4beginners/discord)提问; - 若仍未解决,创建新 Issue,并在描述中附带:操作系统版本、Python/Node 版本输出、完整报错日志与已执行命令,以便维护者快速定位问题。
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考