Data Science for Beginners:10 周 20 课开源数据科学课程的完整使用指南
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
本指南基于开源仓库 Data-Science-For-Beginners(对应保加利亚语版translations/bg/README.md)系统梳理这套"10 周、20 课"数据科学入门课程的整体结构、教学法、课程地图、环境搭建与学习工作流。读完本文,你将掌握如何安装环境、按顺序或按主题学习 20 个课程单元、运行 40 个随堂测验(quiz-app)、使用初学者示例代码(examples),以及通过 Docsify 离线阅读文档。
课程概览:为什么是 10 周 20 课
这套课程由微软 Azure 云布道师团队维护,采用**项目驱动(project-based)与高频测验(frequent quizzes)**两大教学法原则。每个课程单元都包含课前/课后测验、书面讲解、解决方案(solution)与作业(assignment),让学习者"边做边学(learn while building)"。
从仓库目录结构可以看到课程被划分为 6 个主题模块、共 20 个编号课程:
1-Introduction/:课程 01–04,数据科学定义、数据伦理、数据定义、统计与概率2-Working-With-Data/:课程 05–08,关系型数据(SQL)、NoSQL、Python 数据处理、数据准备3-Data-Visualization/:课程 09–13,Matplotlib 可视化(数量、分布、比例、关系、有意义可视化)4-Data-Science-Lifecycle/:课程 14–16,数据科学生命周期(引入、分析、沟通)5-Data-Science-In-Cloud/:课程 17–19,云端数据科学(云端入门、Low-Code 工具、Azure Machine Learning Studio)6-Data-Science-In-Wild/:课程 20,真实世界数据科学项目
课程刻意让项目"从小到大"逐步增加复杂度,到 10 周结束时完成一套完整的数据科学能力训练。
教学法:项目驱动 + 课前课后测验
课程设计遵循两个明确的指导原则:
- 项目驱动:学习者通过亲手构建项目来掌握技能,而不是只看理论。每个项目导向型课程都提供分步构建指南(step-by-step guides),并在课程的
/solution目录中提供参考答案。 - 高频测验:课前进行低压力测验(pre-lesson quiz)帮助学生建立学习意图,课后进行第二次测验(post-lesson quiz)强化记忆。
这种"测验包围"设计让整套课程足够灵活——既可以完整学习,也可以只选取部分章节;既适合自学,也适合课堂教学。
每个课程单元的标准结构
文档明确列出了每个课程单元包含的内容清单:
- 可选的 sketchnote(视觉笔记图)
- 可选的补充视频
- 课前热身测验(pre-lesson warmup quiz)
- 书面课程(written lesson)
- 项目型课程的逐步构建指南
- 知识检查(knowledge checks)
- 挑战(challenge)
- 补充阅读(supplemental reading)
- 作业(assignment)
- 课后测验(post-lesson quiz)
以仓库中的 课程 01 为例,目录下同时包含notebook.ipynb(互动式练习)、assignment.md(作业)与solution/(参考答案),课程 04 还提供assignment.ipynb供课后练习,solution/中存放带答案的 notebook。这种"README + notebook + assignment + solution"四件套结构贯穿大多数课程。
测验系统:40 个测验,每题 3 问
关于测验的说明:所有测验均位于 quiz-app 目录,共计40 个测验、每个测验 3 个问题。它们从课程内部链接引用,测验应用既可以在本地运行,也可以部署到 Azure,具体步骤见
quiz-app目录中的说明。测验正在逐步进行本地化(多语言化)。
测验应用是标准的 Vue.js 前端项目,从 quiz-app/package.json 可以看到:
- 依赖 Vue 2(
vue ^2.6.11)、Vue Router(vue-router ^3.4.9)、国际化插件(vue-i18n ^8.22.2) - 提供三个 npm 脚本:
npm run serve:启动本地开发服务器(底层是vue-cli-service serve)npm run build:构建生产版本(vue-cli-service build)npm run lint:代码规范检查(vue-cli-service lint)
本地运行测验应用的命令:
# 进入测验应用目录 cd quiz-app # 安装依赖 npm install # 启动开发服务器 npm run serve应用默认运行在http://localhost:8080(端口被占用时会自动切换到其他端口)。测验的题目资源位于quiz-app/src/assets/translations/目录下,每个语言目录内的 JSON 文件存放对应的测验题目数据。
初学者示例代码:examples 目录
对于完全零基础的学习者,课程专门准备了examples/目录,内含 5 个简单、注释详尽的 Python 示例,覆盖从"Hello World"到完整工作流的进阶路径:
| 示例文件 | 学习目标 |
|---|---|
| 01_hello_world_data_science.py | 第一个数据科学程序:创建简单数据集、操作列表与字典、计算基本统计量 |
| 02_loading_data.py | 从 CSV 读取数据、查看前几行、了解数据类型 |
| 03_simple_analysis.py | 计算均值/中位数/众数、求最大最小值、条件过滤 |
| 04_basic_visualization.py | 柱状图、折线图、饼图,并把图保存为图片 |
| 05_real_world_example.py | 完整工作流:加载仓库真实数据 → 清洗 → 分析 → 可视化 → 得出结论 |
以 01_hello_world_data_science.py 为例,它从 Python 列表构建students/scores两个简单数据集,用max()/min()/sum()/len()计算最高分、最低分与平均分,再通过index()定位最高分学生,最后用字典(key-value pairs)重新组织数据——每一步都配有详细的中文注释,是零基础入门的理想起点。
运行这些示例只需安装基础依赖:
pip install pandas numpy matplotlib然后直接执行:
python examples/01_hello_world_data_science.py课程的数据集统一存放在仓库根目录的data/目录中,包括 COVID 时间序列 CSV、birds.csv(课程 09–13 可视化课程使用的鸟类数据)、diabetes.tsv、honey.csv、mushrooms.csv、taxi.csv等,供各课程与示例代码直接读取。
20 课完整课程地图
文档给出了完整的课程对照表(主题、分组、学习目标、对应课程链接与作者),下表完整保留该信息:
| 课号 | 主题 | 分组 | 学习目标 | 对应课程 |
|---|---|---|---|---|
| 01 | 定义数据科学 | 入门 | 学习数据科学背后的基本概念,以及它与人工智能、机器学习和大数据的关系 | 课程 |
| 02 | 数据科学伦理 | 入门 | 数据伦理的概念、挑战与框架 | 课程 |
| 03 | 定义数据 | 入门 | 数据如何分类及其常见来源 | 课程 |
| 04 | 统计与概率入门 | 入门 | 用概率与统计的数学技术理解数据 | 课程 |
| 05 | 处理关系型数据 | 处理数据 | 关系型数据入门,用 SQL 探索与分析关系型数据 | 课程 |
| 06 | 处理 NoSQL 数据 | 处理数据 | 非关系型数据入门、类型与文档数据库探索分析 | 课程 |
| 07 | 使用 Python | 处理数据 | 用 Pandas 等库进行数据探索的 Python 基础 | 课程 |
| 08 | 数据准备 | 处理数据 | 数据清洗与转换技术,应对缺失、不准确或不完整数据 | 课程 |
| 09 | 可视化数量 | 数据可视化 | 使用 Matplotlib 可视化鸟类数据 🦆 | 课程 |
| 10 | 可视化数据分布 | 数据可视化 | 在区间内可视化观测与趋势 | 课程 |
| 11 | 可视化比例 | 数据可视化 | 可视化离散与分组百分比 | 课程 |
| 12 | 可视化关系 | 数据可视化 | 可视化数据集及其变量之间的关系与相关性 | 课程 |
| 13 | 有意义的可视化 | 数据可视化 | 让可视化对问题解决与洞察真正有价值的技巧与指南 | 课程 |
| 14 | 数据科学生命周期入门 | 生命周期 | 数据科学生命周期及其第一步——获取与提取数据 | 课程 |
| 15 | 分析 | 生命周期 | 生命周期中聚焦数据分析技术的阶段 | 课程 |
| 16 | 沟通 | 生命周期 | 以决策者易于理解的方式呈现数据洞察 | 课程 |
| 17 | 云端数据科学 | 云端 | 云端数据科学系列及其优势 | 课程 |
| 18 | 云端数据科学 | 云端 | 使用 Low Code 工具训练模型 | 课程 |
| 19 | 云端数据科学 | 云端 | 使用 Azure Machine Learning Studio 部署模型 | 课程 |
| 20 | 真实世界的数据科学 | 在真实世界 | 真实世界数据科学驱动项目 | 课程 |
环境搭建与快速开始
方式一:Sparse Checkout 克隆(推荐本地克隆)
仓库包含50+ 种语言的翻译,会显著增加下载体积。如果不需要翻译版本,文档推荐使用 sparse checkout 只拉取课程本体:
Bash / macOS / Linux:
git clone --filter=blob:none --sparse https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners.git cd Data-Science-For-Beginners git sparse-checkout set --no-cone '/*' '!translations' '!translated_images'CMD(Windows):
git clone --filter=blob:none --sparse https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners.git cd Data-Science-For-Beginners git sparse-checkout set --no-cone "/*" "!translations" "!translated_images"其中--filter=blob:none表示克隆时不下载文件内容(按需获取),--sparse配合--no-cone模式排除translations与translated_images两个大目录,即可获得完成课程所需的全部内容且下载更快。
方式二:本地完整安装
完整环境搭建步骤详见仓库的 INSTALLATION.md,核心链路如下:
- 安装 Git:Windows/macOS/Linux 各有对应安装方式(Linux 下
sudo apt-get install git、sudo dnf install git等)。 - 安装 Python 3.7+与 Jupyter:
python3 --version pip install jupyter - 创建虚拟环境(推荐,隔离依赖):
python -m venv venv # macOS/Linux source venv/bin/activate # Windows venv\Scripts\activate - 安装数据科学依赖库:
pip install jupyter pandas numpy matplotlib seaborn scikit-learn - 安装 Node.js 与 npm(运行测验应用需要),然后进入
quiz-app执行npm install。 - 可选:安装 Docsify CLI(离线阅读文档):
npm install -g docsify-cli。
验证安装是否成功:激活虚拟环境后执行jupyter notebook,浏览器会打开 Jupyter 界面,即可导航到任意课程的.ipynb文件;在quiz-app目录执行npm run serve可验证测验应用。
方式三:GitHub Codespaces(云上环境)
如果你希望跳过本地配置,可以在 GitHub 页面点击Code下拉菜单 → 选择Open with Codespaces→ 点击面板底部的+ New codespace,等待 2–3 分钟环境初始化后即可获得预装好全部依赖的开发环境。
方式四:VS Code Remote – Containers
本地已有 Docker 的场景下,可以使用 VS Code 的 Remote - Containers 扩展:
- 首次使用需确保系统满足前提条件(如已安装 Docker)。
- 两种打开方式:
- 在隔离的 Docker 卷中打开:使用Remote-Containers: Clone Repository in Container Volume...命令,将源码克隆进 Docker 卷(卷是容器数据持久化的推荐机制)而非本地文件系统;
- 打开本地克隆副本:先本地克隆仓库,按
F1选择Remote-Containers: Open Folder in Container...,选择克隆目录并等待容器启动。
学习方法与使用工作流
学生快速开始
- 查看 INSTALLATION.md 配置环境
- 阅读 USAGE.md 了解如何配合课程工作
- 从课程 01 开始按顺序学习
- 加入社区获取支持
自学建议(来自文档):完整 Fork 仓库后自行完成练习,先做课前测验 → 阅读课程 → 完成其余活动。尽量通过理解课程来构建项目,而不是照抄/solution中的参考答案代码(虽然项目型课程的每个solution/目录都提供了该代码)。另一个思路是组建学习小组,和朋友一起过内容。
教师使用建议
文档在 for-teachers.md 中提供了课堂教学指南。仓库中的 USAGE.md 进一步给出建议的 10 周排期:
- 第 1–2 周:入门(课程 01–04)
- 第 3–4 周:处理数据(课程 05–08)
- 第 5–6 周:数据可视化(课程 09–13)
- 第 7–8 周:数据科学生命周期(课程 14–16)
- 第 9 周:云端数据科学(课程 17–19)
- 第 10 周:真实世界应用与最终项目(课程 20)
三种典型学习工作流
完整入门路径:从1-Introduction/01-defining-data-science开始,对每个课程依次完成课前测验 → 读课程 → 跑 notebook → 做作业 → 课后测验,按顺序走完 20 课。
主题聚焦路径:只学某个主题模块,例如只学数据可视化时进入3-Data-Visualization,聚焦课程 09–13。
项目驱动路径:先学数据科学生命周期(课程 14–16),再通过课程 20 的真实世界示例(位于6-Data-Science-In-Wild/20-Real-World-Examples)把概念应用到自己项目中。
离线访问:Docsify
课程文档支持通过 Docsify 离线阅读。Fork 仓库后,在本地安装 Docsify,然后在仓库根目录执行:
docsify serve网站会在本机localhost:3000提供服务。文档配套的 docs/_sidebar.md 定义了 Docsify 站点侧边栏导航。
注意:notebook(
.ipynb)不会被 Docsify 渲染,需要运行 notebook 时,请单独在 VS Code 中启动 Python 内核执行。
根目录 package.json 还提供了npm run convert脚本(基于docsify-to-pdf),可将文档批量转换为 PDF。
多语言支持:50+ 语言翻译
课程通过 GitHub Action 自动化维护多语言版本,当前支持包括保加利亚语、中文(简体/繁体多种地区变体)、英语、法语、德语、日语、韩语、俄语、西班牙语等 50+ 语言。翻译版本存放于translations/(Markdown 与 notebook 翻译)与translated_images/(图片翻译)两个目录,每个语言目录保持与英文版完全相同的目录结构,例如本文所基于的保加利亚语版即位于 translations/bg/README.md。translated_images/bg/中存放了本文开头两张手绘笔记的保加利亚语翻译版本。
相关课程与获取帮助
微软团队还维护了同系列的姊妹课程,包括机器学习、人工智能、生成式 AI、Web 开发、IoT、网络安全、XR 开发以及 LangChain、MCP、AI Agents 等方向的 "for Beginners" 系列课程。
遇到问题时,可先查阅仓库的 TROUBLESHOOTING.md 获取常见问题解决方案;需要参与共建时,请阅读 CONTRIBUTING.md 贡献指南与 CODE_OF_CONDUCT.md 行为准则。测验相关的题目维护与本地化工作,则按quiz-app目录内的说明进行。
【免费下载链接】Data-Science-For-Beginners10 Weeks, 20 Lessons, Data Science for All!项目地址: https://gitcode.com/GitHub_Trending/da/Data-Science-For-Beginners
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考