一句话精华:线性回归的所有数学推导,都建立在 "误差项独立同分布且服从高斯分布" 这个假设之上。
一、一元线性回归模型
基础公式:
y=β0+β1x+ε
- →β0、β1:模型参数(待求)
- →ε:误差项,除线性因素外的随机因素产生的误差
关键问题:误差项能省略吗?→ 不能。正是因为有误差项,我们才能基于误差的特点来估计参数。
二、误差项三大假设
假设1:独立
每个样本点相互独立。例:贷款场景中,每个人贷多少钱只基于自己的工资,互不影响。
假设2:同分布
所有样本都服从同一套分布体系。例:人民银行的评估体系对每个人都一样,不会因人而异。
假设3:高斯分布(正态分布)
误差项服从均值为 0、方差为σ2的正态分布:
三、为什么必须是高斯分布?
因为只有误差服从高斯分布,才能用极大似然估计推导出最小二乘损失函数,整个参数求解才有数学依据。
推导链路:
- 误差项满足高斯分布 →
- 将
代入
- 得到y的条件概率分布
- 用极大似然估计 → 最终推导出最小二乘损失函数
💡结论:高斯分布假设不是随便选的,它是 "最小二乘法" 的数学根基。