pytorch-deep-learning 环境搭建指南:Google Colab 在线起步与本地 Linux GPU 环境配置
【免费下载链接】pytorch-deep-learningMaterials for the Learn PyTorch for Deep Learning: Zero to Mastery course.项目地址: https://gitcode.com/GitHub_Trending/py/pytorch-deep-learning
本指南以《Learn PyTorch for Deep Learning: Zero to Mastery》课程仓库中的 SETUP.md 为骨架,系统梳理两条深度学习开发环境的搭建路线:一条是近乎零配置的 Google Colab 在线方案,适合课程前四个章节(00–04)快速起步;另一条是基于 Miniconda + Jupyter Lab 的本地 Linux GPU 方案,适合需要长期、灵活、可脚本化开发的学习者。读完本文,你将掌握从在线 notebook 一键运行、GPU 启用与验证,到本地 conda 环境创建、依赖安装与冒烟测试的完整实操流程,并能理解每一条命令和每一个验证步骤背后的原理。
为什么需要一份专门的环境搭建指南
在 SETUP.md 开篇就点明了核心痛点:搭建一台可用于深度学习的机器,「从硬件到软件,再到让代码在你机器上的运行效果与在别人机器上一致的各种细枝末节」,整个过程相当繁琐。为此,该指南刻意保持简单——但又不是简单到无法复用到其他项目。
仓库中的环境搭建说明提供两条可选路径:
- Google Colab(最简单):零配置、免费 GPU、可分享,适合课程起步阶段;
- 本地/远程机器(步骤稍多,但长期更灵活):完全掌控环境,适合脚本化开发与长期项目。
需要强调的是,这两条路线都不是 PyTorch 官方安装文档 的替代品。如果你打算长期编写 PyTorch 代码,熟悉官方安装文档是必要的功课——本指南只是课程语境下「其中一种」可行的装法。
两条路线怎么选:先用 Colab 起步,需要时再扩展
原文给出了一个非常务实的取舍逻辑:课程起始 notebook(00–04)完全在 Google Colab 中完成,因为它足以满足课程初期的全部需求;当你想把一个实验沉淀成更大的项目、或需要长时间稳定计算时,再迁移到本地或云端算力。
| 对比维度 | Google Colab | 本地 Linux + NVIDIA GPU |
|---|---|---|
| 上手成本 | 几乎为零,预装 PyTorch、pandas、NumPy、Matplotlib | 需安装 Miniconda、创建环境、逐条安装依赖 |
| GPU | 免费额度 + 付费升级选项 | 依赖本机显卡与驱动 |
| 会话持久性 | 约 2–3 小时超时(付费可延长),状态易丢失 | 长期稳定,无超时限制 |
| 本地存储 | 无直接访问,需借助挂载等变通方案 | 直接读写本地磁盘 |
| 脚本化开发 | 不太适合把代码整理成模块 | 完全可控,适合模块化工程 |
作者的推荐工作流是:大量初学者实验在 Colab 里做,一旦发现值得做成更大项目或需要持续投入的内容,就转移到本地或云端计算。这与课程 05 章节「Going Modular」的设计一脉相承——先是 notebook 单元模式,再转向going_modular/下的脚本模式(详见 going_modular/going_modular 目录)。
方案一:Google Colab 零配置起步
Google Colab 是一个基于 Jupyter Notebook 的免费在线交互式计算平台。它随附了 PyTorch 以及 pandas、NumPy、Matplotlib 等大量数据科学包,基本做到了「打开即用」。
优点:
- 几乎零配置(PyTorch 与常用数据科学包已预装);
- 可通过链接分享你的工作成果;
- 免费访问 GPU(GPU 能显著加速深度学习代码),付费可解锁更多算力。
缺点:
- 超时限制(多数 notebook 状态只能保持 2–3 小时,付费可延长);
- 无法直接访问本地存储(虽有变通办法);
- 不太适合脚本化开发(把代码整理成模块)。
上手:先熟悉 Colab 界面
开始使用前,建议先过一遍 Google Colab 官方提供的「Introduction to Google Colab」示例 notebook(路径colab.research.google.com中的 basic features overview),熟悉按钮和各项功能的位置。
方式一:通过「Open in Colab」一键打开
课程每个 notebook 的在线书版本或 GitHub 版本顶部都有Open in Colab按钮,点击即可直接在 Colab 中运行该 notebook。
如果你想把 notebook 的副本保存到自己的 Google Drive,可以接着点击Copy to Drive按钮。
方式二:通过 GitHub 链接直接打开
你也可以把任意 GitHub 上的 notebook 链接直接粘贴进 Google Colab,效果与方式一相同。
原文特别提醒:这种方式只建议用于测试目的。正式学习课程时,强烈推荐自己动手把代码写一遍,而不是直接运行现成代码——这正是课程「学徒制」教学方式的精髓(我写代码,你写代码)。
在 Colab 中启用并验证 GPU
Colab 默认的运行时可能没有 GPU。启用 CUDA 支持的 NVIDIA GPU 的路径为:
Runtime -> Change runtime type -> Hardware Accelerator -> GPU注:切换硬件加速器会要求重启运行时。
启用后,在 notebook 单元中运行以下命令即可确认当前可用的 GPU 型号:
!nvidia-smi若输出显卡信息,说明已获得 GPU 访问权。接下来确认 PyTorch 是否能真正使用这块 GPU:
import torch # Google Colab 已预装 torch print(torch.cuda.is_available()) # 返回 True 说明 PyTorch 可以使用 GPU如果 Colab 上的 PyTorch 能看到 GPU,上述代码会打印True。
这个torch.cuda.is_available()检查模式,在仓库中已经成为「设备无关代码」的标配。例如 going_modular/going_modular/train.py 中就是用同一套逻辑来自动选择计算设备:
device = "cuda" if torch.cuda.is_available() else "cpu"也就是说:在 Colab 里打开 GPU 后,课程代码无需任何改动就会自动跑到 GPU 上;没有 GPU 的环境则会回退到 CPU,保证代码在任何机器上都能运行。
方案二:本地 Linux + NVIDIA GPU 环境搭建
适用前提与设计动机
这套方案有两个明确的适用前提:
- 面向 Linux 系统(世界上使用最广泛的操作系统);如果你运行的是 Windows 或 macOS,应参考 PyTorch 官方安装文档;
- 假设你拥有一块 NVIDIA GPU。
原文以机器学习工程师的日常使用为出发点:这套流程「几乎每天都会用到」,能覆盖大量工作流,且足够灵活以便按需调整。
需要注意:原文档将「安装 CUDA 驱动」这一步标记为
TK TODO(尚未补全),并在整体架构示意图片处留有占位符。因此本文假设你已经拥有可用的 CUDA 驱动环境;驱动层面的安装请参考 PyTorch 官方安装文档与显卡厂商提供的说明。
第 1 步:安装 Miniconda
首先安装 Miniconda(如果已安装 Anaconda 也可以直接使用)。核心要求是:命令行里能访问到conda命令。务必完整走完 Miniconda 官方安装指南中的所有步骤,再进入下一步。
第 2 步:创建课程目录
为课程材料建一个目录(名称随意),并进入该目录:
mkdir ztm-pytorch-course cd ztm-pytorch-course第 3 步:创建 conda 环境
用--prefix把环境直接建在当前目录下的env文件夹中(例如ztm-pytorch-course/env)。命令提示y/n?时按y:
conda create --prefix ./env python=3.8.13这里用--prefix而非-n(命名环境)的好处是:环境与项目目录绑定,整个课程项目(代码 + 环境)可以整体迁移、备份,也便于多个项目各自隔离依赖。python=3.8.13是课程编写时的推荐版本,锁定了具体的 Python 小版本以保证依赖兼容性。
第 4 步:激活环境
conda activate ./env激活后,命令行提示符前缀会出现(env),后续安装的包都只会进入这个环境,不影响系统全局 Python。
实操提示:如果你的 shell 尚未对 conda 初始化,
conda activate可能提示CommandNotFoundError。这种情况先执行conda init bash(或对应 shell)并重启终端即可(这是 Miniconda 官方安装指南的收尾步骤)。
第 5 步:安装课程依赖
以下命令专门针对「Linux 系统 + NVIDIA GPU」的组合,可以一次性全部执行:
conda install -c pytorch pytorch=1.10.0 torchvision cudatoolkit=11.3 -y conda install -c conda-forge jupyterlab torchinfo torchmetrics -y conda install -c anaconda pip -y conda install pandas matplotlib scikit-learn -y各条命令与包的用途拆解如下:
| 命令/包 | 渠道 | 在本仓库中的作用 |
|---|---|---|
pytorch=1.10.0 | -c pytorch | PyTorch 核心框架,全部 00–09 章节 notebook 与 going_modular 脚本的基础 |
torchvision | -c pytorch | 视觉工具库,如 data_setup.py 中的datasets.ImageFolder、transforms,以及 helper_functions.py 中的torchvision.io.read_image |
cudatoolkit=11.3 | -c pytorch | CUDA 运行时工具包,让 PyTorch 能在 GPU 上加速计算 |
jupyterlab | -c conda-forge | 本地交互式开发环境,用于逐单元运行课程代码 |
torchinfo | -c conda-forge | 打印模型结构摘要(课程 06/07 章节大量使用,如torchinfo.summary(...)输出冻结/解冻层的参数量) |
torchmetrics | -c conda-forge | 提供标准化评估指标(课程实验跟踪章节配合使用) |
pip | -c anaconda | Python 包管理器,后续安装其他工具链时备用 |
pandas/matplotlib/scikit-learn | 默认(Anaconda 主渠道) | 数据探索、可视化与经典机器学习;例如 helper_functions.py 中大量使用matplotlib(绘制决策边界、损失曲线、预测图)与numpy,02 章节分类实验使用scikit-learn生成数据集 |
值得注意的两点工程细节:
- 使用
-c <channel>指定渠道:PyTorch 相关包必须来自 PyTorch 官方 conda 渠道(pytorch),torchinfo/torchmetrics来自conda-forge,pip来自anaconda渠道。混用渠道时,conda 会按顺序解析,指定渠道可以避免装到不兼容的构建版本。 cudatoolkit与驱动是两回事:cudatoolkit=11.3是 PyTorch 运行所需的 CUDA 运行时组件,随 conda 环境安装;而 NVIDIA 显卡驱动属于系统层软件,需要单独安装(即原文档中标注 TODO 的那一步)。两者版本需要匹配才能正常工作。
第 6 步:启动 Jupyter Lab 验证安装
环境安装完成后,先启动 Jupyter Lab 服务确认一切正常:
jupyter lab第 7 步:Notebook 冒烟测试
在 Jupyter Lab 中新建一个 notebook,在单元里运行以下代码:
import pandas as pd import numpy as np import torch import sklearn import matplotlib import torchinfo, torchmetrics # 检查 PyTorch 计算是否正常(应打印出一个张量) print(torch.randn(3, 3)) # 检查 GPU(应返回 True) print(torch.cuda.is_available())这段冒烟测试覆盖了三层验证:
- 依赖完整性:
pandas、numpy、torch、sklearn、matplotlib、torchinfo、torchmetrics全部能成功导入,说明第 5 步的依赖安装没有缺漏; - PyTorch 基础计算:
torch.randn(3, 3)能打印出一个 3×3 随机张量,说明张量运算链路正常; - GPU 可用性:
torch.cuda.is_available()返回True,说明 PyTorch 已正确链接到 CUDA 运行时并识别到本机 GPU——这也是后续所有课程代码自动跑上 GPU 的前提。
如果以上代码无报错运行,你的本地环境就绪,可以开始课程了。若遇到错误,可以在课程的 GitHub Discussions 页提问,或查阅 PyTorch 官方安装文档。
版本说明与升级建议
本仓库 SETUP.md 中锁定的版本(Python 3.8.13、PyTorch 1.10.0、cudatoolkit 11.3)反映了课程编写时(2022 年 2 月前后,见 README.md 更新日志中「added setup guide」的记录)的推荐环境。这一组版本组合是验证过可互相兼容的,照抄可以避免大量环境踩坑。
同时,README.md 也明确指出:PyTorch 2.0 是向后兼容的增量发布,此前所有课程材料在 PyTorch 2.0 下依然可以运行。因此如果你已经安装了更新版本的 PyTorch,课程代码理论上无需改动;而如果你希望完全复现课程原始环境,按上述命令安装即可。两者的前提与限制不同,请根据自身需求选择。
从环境到代码:仓库里的资源地图
环境就绪后,可以按以下路径开始使用本仓库:
- 课程 notebook(00–09):位于仓库根目录的 00_pytorch_fundamentals.ipynb 至 09_pytorch_model_deployment.ipynb,在 Colab 中「Open in Colab」即可运行;
- 模块化代码:going_modular/going_modular 下的
data_setup.py、engine.py、model_builder.py、train.py、utils.py、predictions.py是课程 05 章节把 notebook 转成脚本的成果,其中 train.py 就是「设备无关代码 + 依赖库」的完整组合示例; - 公共工具函数:helper_functions.py 汇集了课程反复使用的绘图、精度计算、数据下载等函数,其导入的
torch、matplotlib、numpy、torchvision与第 5 步安装的依赖一一对应; - 在线书版本:docs/index.md 是课程在线书的入口页,包含完整的章节大纲与学习方法建议(代码跟随、实验探索、可视化、提问、做练习、分享成果)。
总之,无论你选择 Colab 的零配置路线,还是本地 Linux GPU 的完整控制路线,本指南提供的命令、验证代码与版本组合都可以直接照搬使用。环境搭好后,剩下的就交给那句课程格言:if in doubt, run the code(拿不准就跑一下代码),以及experiment, experiment, experiment!(实验、实验、再实验)。
【免费下载链接】pytorch-deep-learningMaterials for the Learn PyTorch for Deep Learning: Zero to Mastery course.项目地址: https://gitcode.com/GitHub_Trending/py/pytorch-deep-learning
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考