30分钟打通深度学习数学基础:跟着李宏毅教程走一遍
【免费下载链接】leedl-tutorial《李宏毅深度学习教程》(李宏毅老师推荐👍,苹果书🍎),PDF下载地址:https://github.com/datawhalechina/leedl-tutorial/releases项目地址: https://gitcode.com/GitHub_Trending/le/leedl-tutorial
第一次翻开李宏毅机器学习课程(leedl-tutorial)这类深度学习课程时,你大概率会被四个字母卡住:grad。梯度下降、反向传播,名字一个比一个唬人,公式更像一堵墙。但别慌,你真正需要的深度学习数学基础,远没有想象中高深,看懂一张图就够了。
一张图讲透
这张图能一次说明白,它就是全文的骨架:
图注:每个输入 x 先乘上权重 W(要学出来的参数),加上偏置 b,再过一遍激活函数 σ(就是那个把输出弯弯曲曲的函数),最后汇出 y。搭模型、调训练、防翻车三件事,全藏在这几条箭头的不同位置里:正向流一遍是搭模型,挪动 W 和 b 是调训练,判断挪得对不对是防翻车。
📐 搭模型要算什么:拆解神经网络的前向传播
神经网络不是玄学,就是"加权求和+弯一下"反复做。每层的计算能压成一行:
a = σ(b + Wx)
W 是权重矩阵(每个输入各值多少),b 是偏置(起点在哪),σ 是激活函数(负责把直线掰弯)。没有 σ,多少层叠起来都会塌成一条直线,什么复杂的事都拟合不了。这就是神经网络原理最朴素的版本,其余都是加层数和换 σ。
多层一叠,就是接力赛:上一层的输出 a 变成下一层的输入,每层多剥一层抽象。
图注:每一层都只是一个 σ(b + Wx)。深度学习里的"深",说穿了就是这套动作重复的次数。
所以呢:你要补的第一块数学,就是会读矩阵乘法 Wx。仓库里 HW1 的第一个 notebook 会让你亲手写这行代码,写得出来,就入门一半了。
🔧 训练时怎么调:梯度下降与反向传播一套
训练就两步:先看 loss(损失函数,衡量模型偏了多远),再朝 loss 变小的方向挪一小步。梯度下降给出挪动规则:
W ← W - η · ∇_W Loss
η 是学习率(每步迈多大),∇ 是梯度(loss 下降最快的方向)。η 大了,看着收敛快,也容易一脚迈过头,摔到更差的位置。
真正唬人的只有"反向传播"四个字。说白了,它就像算账:loss 是总账,反向传播就是从最后一笔往前核,算出每一层的 W 和 b 各背了多少锅。它只是链式法则,反过来用而已。
图注:这是 HW1 里两条 loss 曲线。曲线一路走低、最后压平,就是"收敛了"长什么样。
所以呢:你要补的第二块数学是偏导数和链式法则。不用会推导,记住一句话就够:梯度告诉你往哪迈,学习率决定迈多远。曲线往下走,说明你做对了。
🩹 怎么防止翻车:用正则化压住过拟合
最常见的翻车长这样:训练集 99 分,测试集 60 分。模型把题全背下来了,一换题就露馅,这叫过拟合。
最朴素的解法:给参数太大这件事收一笔罚款,loss 变成:
Loss + λ · Σθ²
λ 是罚款力度(管得多严)。λ 大,参数被摁得老实,模型学得保守;λ 小,它又放开了。罚款轻重,就是这两头的平衡。
图注:红线是 loss,黄线是 λ,两条线此消彼长,正是拟合与罚款互相拉扯的过程——罚款不能没有,也不能罚到没法学。
所以呢:测试分数上不去时,先问一句是不是过拟合。先缩模型,再试加正则项。这条"罚款轻重"的平衡线,在 HW1 到 HW2 的每个 notebook 里都藏着一遍。
动手清单
读完别只点头,照着做这五件事,路径都是仓库里真实存在的:
| 顺序 | 做什么 | 去哪儿做 |
|---|---|---|
| 1 | 没开过 notebook 的,先熟悉打开方式 | Homework/Warmup/ |
| 2 | 跑通一个最小回归,逐行读前向传播代码 | Homework/HW1_Regression/HW1_Regression.ipynb |
| 3 | 改学习率,盯住 loss 曲线怎么变 | Homework/HW1_Regression/HW1_Regression.ipynb |
| 4 | 完成第一个分类,对比训练 loss 和测试 loss | Homework/HW2_Classification/HW2_Classification.ipynb |
| 5 | 试一把卷积,看看卷积核到底在算什么 | Homework/HW3_CNN/HW3_CNN.ipynb |
现在就去打开 HW1 文件夹,跑通回归 notebook,把前向传播那几行代码逐行读懂。第一条 loss 曲线往下掉的那一刻,你就知道这些数学开始干活了。
【免费下载链接】leedl-tutorial《李宏毅深度学习教程》(李宏毅老师推荐👍,苹果书🍎),PDF下载地址:https://github.com/datawhalechina/leedl-tutorial/releases项目地址: https://gitcode.com/GitHub_Trending/le/leedl-tutorial
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考