news 2026/9/12 10:22:02

Data Science for Beginners 环境搭建全指南:从零配置 Git、Python、Jupyter 与 Quiz 应用

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Data Science for Beginners 环境搭建全指南:从零配置 Git、Python、Jupyter 与 Quiz 应用

Data Science for Beginners 环境搭建全指南:从零配置 Git、Python、Jupyter 与 Quiz 应用

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

导读

本指南以仓库中的 安装指南(希腊语翻译版) 为骨架,系统讲解 "Data Science for Beginners"(10 周 20 课时的开源数据科学课程)的完整环境搭建流程。无论你是完全零基础的新手,还是想在本机复现课程的开发者,读完本文都能独立完成:Git 安装与仓库克隆、Python 3.7+ 与 Jupyter Notebook 配置、数据科学依赖库安装、Vue 驱动的 Quiz 测验应用本地运行,以及可选的 Docsify 离线文档服务与 VS Code Dev Containers 容器化开发环境。文章同时结合仓库源码(quiz-app/package.json、docs/_sidebar.md 等)给出实现级佐证,确保每一步都可验证、可落地。

环境前置准备

开始之前,请确认你具备以下基础条件:

  • 命令行/终端基本操作能力:安装过程涉及git clonepip installnpm install等命令,需要熟悉终端的基本使用;
  • 一个免费的 GitHub 账号:用于访问仓库、可选地创建 Codespaces 云端开发环境,以及后续 fork 仓库完成课程作业;
  • 稳定的网络连接:首次安装需要下载 Git、Python、Node.js 及各语言包依赖。

以上三点是官方安装指南明确列出的前置要求,其余环节均在下面分步展开。

快速启动选项:两条路线二选一

路线一:GitHub Codespaces(官方推荐给初学者)

如果不想在本机折腾环境,Codespaces 是成本最低的入口——它在浏览器中提供一套预装全部依赖的完整开发环境。操作步骤:

  1. 打开课程仓库页面;
  2. 点击Code下拉菜单;
  3. 切换到Codespaces标签页;
  4. 点击Create codespace on main
  5. 等待环境初始化完成(约 2~3 分钟)。

环境就绪后即自带课程所需的全部依赖,可直接打开各课的.ipynbnotebook 开始学习,无需任何本机安装。

路线二:本机本地开发(详细步骤见下文)

如果希望在自己的电脑上长期学习、做笔记或提交作业,请按下面 "本地安装" 的 8 个步骤逐项操作。

本地安装:8 步完整流程

步骤 1:安装 Git

Git 用于克隆仓库并在本地跟踪你的改动,是后续所有步骤的基础。

Windows从 git-scm.com 下载 Windows 版安装包,按默认设置完成安装。

macOS通过 Homebrew 安装:brew install git,或从 git-scm.com 下载 macOS 版。

Linux(按发行版选择对应包管理器):

# Debian/Ubuntu sudo apt-get update sudo apt-get install git # Fedora sudo dnf install git # Arch sudo pacman -S git

安装完成后可用git --version验证。

步骤 2:克隆仓库

# 克隆仓库(含完整课程与翻译内容) git clone https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners.git # 进入仓库目录 cd Data-Science-For-Beginners

针对大仓库的优化建议:本仓库包含 50+ 语言的翻译目录(translations/)与翻译图片(translated_images/),体积较大。如果只想学习而不需要翻译内容,官方 README 提供了sparse checkout稀疏检出方式,可显著加快下载速度:

# Bash / macOS / Linux git clone --filter=blob:none --sparse https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners.git cd Data-Science-For-Beginners git sparse-checkout set --no-cone '/*' '!translations' '!translated_images'
:: CMD (Windows) git clone --filter=blob:none --sparse https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners.git cd Data-Science-For-Beginners git sparse-checkout set --no-cone "/*" "!translations" "!translated_images"

这样只拉取课程主内容,即可快速完成下载并开始学习。

步骤 3:安装 Python 与 Jupyter

课程的数据科学部分要求Python 3.7 或更高版本

Windows

  1. 从 python.org 下载 Python 安装包;
  2. 安装时务必勾选"Add Python to PATH",否则命令行无法直接调用python
  3. 验证安装:
python --version

macOS

# 通过 Homebrew 安装 brew install python3 # 验证安装 python3 --version

Linux

# 大多数发行版自带 Python,先检查 python3 --version # 若未安装: # Debian/Ubuntu sudo apt-get install python3 python3-pip # Fedora sudo dnf install python3 python3-pip

步骤 4:配置 Python 虚拟环境

官方指南强烈建议使用虚拟环境隔离项目依赖,避免污染系统 Python:

# 创建虚拟环境(在仓库根目录执行) python -m venv venv # 激活虚拟环境 # Windows: venv\Scripts\activate # macOS/Linux: source venv/bin/activate

激活后,命令行提示符会带上(venv)前缀,表示后续安装的包都只作用于该环境。

步骤 5:安装 Python 数据科学依赖包

一次性安装课程各 notebook(分布在1-Introduction2-Working-With-Data3-Data-Visualization等课程目录下的.ipynb文件)所需的全部核心库:

pip install jupyter pandas numpy matplotlib seaborn scikit-learn

各库在课程中的典型用途:

用途仓库中的使用示例
jupyter运行与编辑 notebook各课程的notebook.ipynb,如 1-Introduction/01-defining-data-science/notebook.ipynb
pandas表格数据读取与处理课程数据集位于 data/,如 data/birds.csv、data/honey.csv
numpy数值计算概率统计、分布计算相关 notebook
matplotlib / seaborn数据可视化3-Data-Visualization各课绘制的柱状图、直方图、箱线图等
scikit-learn机器学习基础生命周期与真实案例课程的建模练习

步骤 6:安装 Node.js 与 npm(用于 Quiz 测验应用)

课程配套的 Quiz 测验应用是一个Vue 2 单页应用,源码位于 quiz-app/,运行它需要 Node.js 与 npm。

Windows / macOS:从 nodejs.org 下载安装包(建议使用LTS 长期支持版),运行安装程序即可。

Linux

# Debian/Ubuntu # ⚠️ 安全提示:将互联网脚本直接管道到 bash 存在安全风险, # 官方建议先下载并审查脚本内容再执行: # curl -fsSL https://deb.nodesource.com/setup_lts.x -o setup_lts.x # less setup_lts.x # 审查通过后执行: # sudo -E bash setup_lts.x sudo apt-get install -y nodejs # Fedora sudo dnf install nodejs # 验证安装 node --version npm --version

关于 Node.js 版本的源码依据:从 quiz-app/package.json 可以看到,该应用基于 Vue^2.6.11、Vue CLI~4.5.0构建,属 Vue 2 生态,安装 LTS 版 Node 即可满足构建要求。

步骤 7:安装 Quiz 应用依赖

# 进入 quiz-app 目录 cd quiz-app # 安装依赖(依据 package.json 的 dependencies/devDependencies) npm install # 返回仓库根目录 cd ..

依赖安装成功后,quiz-app/src/main.js 定义的 Vue 入口即可被构建工具正确解析(测验题目数据位于 quiz-app/src/assets/ 下的 JSON 文件)。

步骤 8:安装 Docsify(可选)

如需离线访问课程文档,可全局安装 Docsify CLI,本地以静态站点方式浏览仓库中的全部 Markdown 文档:

npm install -g docsify-cli

仓库文档的导航结构定义在 docs/_sidebar.md,它按 "Introduction / Working With Data / Data Visualization / Data Science Lifecycle / Data Science in the Cloud / Data Science in the Wild" 六大模块组织 20 节课程,安装后可沿此目录离线阅读。

安装验证:三项冒烟测试

环境配置完成后,务必按以下三项逐一验证,确保一切就绪。

验证 Python 与 Jupyter

# 若尚未激活虚拟环境: # Windows: venv\Scripts\activate # macOS/Linux: source venv/bin/activate # 启动 Jupyter Notebook jupyter notebook

浏览器应自动打开 Jupyter 界面,此时即可导航到任意课程的.ipynb文件开始练习。

验证 Quiz 测验应用

# 进入 quiz-app 目录 cd quiz-app # 启动开发服务器(对应 package.json 中 "serve": "vue-cli-service serve") npm run serve

测验应用默认运行在http://localhost:8080(若 8080 端口被占用会自动换用其他端口)。另外两个常用脚本也记录在 quiz-app/package.json 中:

npm run build # 编译并压缩,生成生产环境产物(输出到 dist/) npm run lint # 检查并修复代码规范问题

验证 Docsify 文档服务器

# 在仓库根目录执行 docsify serve

文档站点默认运行在http://localhost:3000,可离线浏览全部课程文档。

进阶:使用 VS Code Dev Containers 容器化开发

如果本机已安装 Docker,可以通过 VS Code Dev Containers 获得与 Codespaces 一致的容器化体验,无需在宿主机装 Python/Node 环境:

  1. 安装 Docker Desktop;
  2. 安装 Visual Studio Code;
  3. 安装Remote - Containers扩展;
  4. 在 VS Code 中打开仓库目录;
  5. F1调出命令面板,选择"Remote-Containers: Reopen in Container"
  6. 等待容器首次构建完成(仅第一次需要,之后秒开)。

容器内将提供统一的开发环境,适合团队协作或需要复现统一环境的场景。

常见问题与获取帮助

若安装过程中遇到问题,按以下优先级处理:

  1. 查阅仓库根目录的 TROUBLESHOOTING.md 故障排查指南,其中收录了安装与运行阶段的常见问题与解决方案;
  2. 在仓库的 Issues 区搜索是否已有相同问题;
  3. 加入课程官方 Discord 社区向维护者与学习者求助;
  4. 以上均无效时,新建一个 issue,并附上完整的错误信息、操作系统版本与已执行命令,便于快速定位。

下一步学习路径

环境搭建完成后,推荐按以下顺序进入课程:

  • 通读 README.md 了解 10 周 20 课的整体课程结构与教学法(课前/课后测验、项目驱动式练习);
  • 阅读 USAGE.md 学习常见工作流,例如单课学习节奏:先做课前测验 → 读课程正文 → 打开对应 notebook 完成练习 → 做课后测验;
  • 动手从第一课开始:1-Introduction/01-defining-data-science/README.md,期间可参考 examples/ 下的 5 个入门脚本快速热身;
  • 若打算参与共建,阅读 CONTRIBUTING.md 了解贡献规范。

补充说明

本指南内容基于仓库的 translations/el/INSTALLATION.md(希腊语翻译版安装文档)整理,其英文原版位于仓库根目录 INSTALLATION.md,两者内容一致,可作为相互对照的权威来源。翻译文档为机器翻译生成,若遇歧义请以英文原版为准。

【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 10:21:46

.NET多语言解决方案:Maomi.In实现动态本地化

1. 项目概述:.NET多语言解决方案的现状与挑战在全球化应用开发中,多语言支持已成为基础需求。传统.NET项目通常采用资源文件(.resx)实现本地化,但这种方式存在明显的局限性:资源文件需要预编译、难以动态更新、缺乏统一的翻译管理…

作者头像 李华
网站建设 2026/9/12 10:21:28

二值化最佳阈值选取方法以及matlab实现

文章目录前言一、真彩色图像转换为灰值图像1.转换公式2.转换过程二、最佳阈值选取方法以及matlab实现1.迭代法2.双峰法3.最大类间方差法4.最大熵阈值法前言 我们利用arcGIS实现对栅格数据的自动批量矢量化时,首先就得需要对栅格图进行二值化处理,即先将…

作者头像 李华
网站建设 2026/9/12 10:17:57

vector autosar RTM使用与集成

目录关键词平台说明技术背景技术难点(关注点)abbreviation整体架构#流程实现过程一、RTM introduction二、Architecture Overview三、RTM集成小结关键词 嵌入式、C语言、autosar、vector、cpuload 平台说明 项目ValueOSautosar OS芯片厂商TI,编程语言…

作者头像 李华
网站建设 2026/9/12 10:15:42

Python进阶:突破初学者瓶颈的四大维度与实战技巧

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 10:14:20

Java继承深度解析:从extends语法到类库设计的最佳实践

刚接触面向对象编程那会儿,我一度以为extends就是把两个类的代码“打通”的语法糖,子类自动拿到父类的一切。直到我在一个类库项目里写出了一棵深度四层的继承树,然后在改父类的一个方法时,眼睁睁看着三个子类同时崩溃&#xff0c…

作者头像 李华