Lecture 13-14:贝叶斯方法与正则化
课程简介
贝叶斯统计、最大后验估计、在线学习。
🎬 本课程视频:Stanford CS229 — 斯坦福机器学习
一、贝叶斯统计
1.1 频率派 vs 贝叶斯派
在机器学习中有两种主要的统计思想流派:
频率派(Frequentist):
- 参数 $\theta$ 是固定的未知常数
- 数据是随机的
- 我们通过最大化似然 $P(D|\theta)$ 来估计 $\theta$
- 点估计:MLE $\hat{\theta} = \arg\max P(D|\theta)$
贝叶斯派(Bayesian):
- 参数 $\theta$ 是随机变量,有自己的分布
- 数据是固定的(已经观测到的)
- 我们通过贝叶斯定理计算 $\theta$ 的后验分布
- 全分布估计:$P(\theta|D) = \frac{P(D|\theta)P(\theta)}{P(D)}$
1.2 贝叶斯公式
贝叶斯定理是贝叶斯统计的基石:
$$P(\theta|D) = \frac{P(D|\theta) P(\theta)}{P(D)} = \frac{P(D|\theta) P(\theta)}{\int P(D|\theta) P(\theta) d\theta}$$
- $P(\theta)$:先验分布(Prior)——在看到数据之前对参数的信念
- $P(D|\theta)$:似然(Likelihood)——数据在给定参数下的概率
- $P(\theta|D)$:后验分布(Posterior)——看到数据后对参数的更新后信念
- $P(D)$:证据(Evidence)——归一化常数
1.3 先验的影响
先验在数据量少时起主导作用,数据量多时被似然覆盖。
- 强先验:方差小,对参数的约束强(适合少量数据)
- 弱先验:方差大,对参数的约束弱(让数据说话)
- 共轭先验:先验和后验属于同一分布族,计算方便
常见共轭对:
- Beta 先验 + 二项式似然 $\to$ Beta 后验
- Gamma 先验 + 泊松似然 $\to$ Gamma 后验
- 高斯先验 + 高斯似然 $\to$ 高斯后验
1.4 预测
贝叶斯预测通过积分消除参数的不确定性:
$$P(y|x, D) = \int P(y|x, \theta) P(\theta|D) d\theta$$
这称为后验预测分布(Posterior Predictive Distribution)。它自然地考虑了参数的不确定性,给出更合理的预测区间。
二、MAP 估计
2.1 定义
最大后验估计(Maximum a Posteriori, MAP)是 MLE 的贝叶斯版本:
$$\theta_{\text{MAP}} = \arg\max_\theta P(\theta|D) = \arg\max_\theta P(D|\theta) P(\theta)$$
与 MLE 不同,MAP 包含了先验信息 $P(\theta)$。
2.2 MAP 与正则化的关系
MAP 估计和正则化有深刻的等价关系。
例子:线性回归中的 MAP
假设先验 $\theta \sim \mathcal{N}(0, \lambda^{-1} I)$,似然为 $y \sim \mathcal{N}(\theta^T x, \sigma^2)$:
$$\theta_{\text{MAP}} = \arg\max_\theta \left[ \log P(D|\theta) + \log P(\theta) \right]$$
$$= \arg\min_\theta \left[ \frac{1}{2\sigma^2} \sum_{i=1}^{m} (y^{(i)} - \theta^T x^{(i)})^2 + \frac{\lambda}{2} |\theta|^2 \right]$$
这正是岭回归(Ridge Regression)——L2 正则化的线性回归!
L1 正则化(Lasso):等价于先验为拉普拉斯分布 $P(\theta) \propto \exp(-\lambda |\theta|)$。
| 先验分布 | 正则化项 | 等价于 |
|---|---|---|
| 高斯 $\mathcal{N}(0, 1/\lambda)$ | $\lambda |\theta|^2$ | L2 / 岭回归 |
| 拉普拉斯 $\text{Laplace}(0, 1/\lambda)$ | $\lambda |\theta|_1$ | L1 / Lasso |
2.3 MAP 的优缺点
优点:
- 比 MLE 更稳定,特别是在数据少时
- 先验可以编码领域知识
- 等价于正则化,防止过拟合
缺点:
- 仍然是点估计,没有不确定性度量
- 先验选择具有主观性
- 无法完全捕捉贝叶斯方法的优势
三、在线学习
3.1 问题设定
在线学习(Online Learning)适用于数据流场景——数据源源不断地到来,模型需要实时更新。
与传统批量学习的区别:
- 批量学习:所有数据一次性可用,训练后部署
- 在线学习:数据逐个到达,模型实时更新
3.2 在线梯度下降
每次收到一个新样本 $(x^{(t)}, y^{(t)})$,更新参数:
$$\theta^{(t+1)} = \theta^{(t)} - \alpha_t \nabla \ell(h_{\theta^{(t)}}(x^{(t)}), y^{(t)})$$
其中学习率 $\alpha_t$ 通常随时间衰减,如 $\alpha_t = 1/\sqrt{t}$。
3.3 遗憾分析
在线学习的一个重要指标是遗憾(Regret):
$$\text{Regret}(T) = \sum_{t=1}^{T} \ell_t(\theta^{(t)}) - \min_{\theta} \sum_{t=1}^{T} \ell_t(\theta)$$
即在线算法的累积损失减去最优固定参数在 hindsight 下的累积损失。
对于凸损失,在线梯度下降的遗憾界为 $O(\sqrt{T})$——平均遗憾以 $O(1/\sqrt{T})$ 的速度趋于 0。这意味着在线算法最终会收敛到与最优固定参数几乎相同的表现。
3.4 Follow The Leader(FTL)
FTL 是最直观的在线学习策略:每次选择到目前为止表现最好的参数。
$$\theta^{(t+1)} = \arg\min_\theta \sum_{s=1}^{t} \ell_s(\theta)$$
FTL 的问题是:如果数据分布变化剧烈,它会过度反应。
改进版:Follow The Regularized Leader(FTRL)——加入正则化项使更新更平滑。
3.5 在线学习的应用
- 广告点击率预测:用户点击行为流式到达
- 推荐系统:用户反馈实时更新
- 异常检测:网络流量模式随时间变化
- 自适应控制:机器人实时调整控制策略
def online_gradient_descent(eta=0.1):
theta = np.zeros(n_features)
for t, (x, y) in enumerate(data_stream()):
# 预测
pred = sigmoid(theta @ x)
# 计算梯度
grad = (pred - y) * x
# 更新参数
lr = eta / np.sqrt(t + 1)
theta -= lr * grad
return theta
四、正则化的深入理解
4.1 L1 与 L2 正则化的几何解释
L2 正则化在参数空间中对应一个圆形约束区域,L1 对应菱形区域。
L1 正则化的菱形有"尖角"——这使得最优解更容易落在坐标轴上,产生稀疏解(很多参数为 0)。L2 正则化不会使参数恰好为 0。
4.2 贝叶斯视角的统一
从贝叶斯角度看,所有正则化都是先验分布:
- 任何形式的惩罚项都对应某种先验
- 正则化系数对应先验的强度
- 最优的正则化强度可以通过交叉验证或贝叶斯模型选择来确定
五、总结
- 贝叶斯统计:将参数视为随机变量,用后验分布量化不确定性
- MAP 估计:MLE + 先验 = 正则化,是频率派和贝叶斯派的桥梁
- 在线学习:处理数据流场景,遗憾作为核心指标
- 正则化:从贝叶斯视角看,所有正则化项都是先验分布
六、贝叶斯方法在实践中的应用
6.1 贝叶斯线性回归
贝叶斯线性回归不仅给出参数的点估计,还给出参数的后验分布和预测分布。
假设先验 $\theta \sim \mathcal{N}(0, \tau^2 I)$,似然 $y \sim \mathcal{N}(X\theta, \sigma^2 I)$,则后验为:
$$\theta|X,y \sim \mathcal{N}\left( \frac{1}{\sigma^2} A^{-1} X^T y, A^{-1} \right)$$
其中 $A = \frac{1}{\sigma^2} X^T X + \frac{1}{\tau^2} I$。
后验均值正是岭回归的解——又一次验证了贝叶斯和正则化的等价性。
预测分布给出了预测值的不确定性区间——这在很多实际应用中非常重要。比如在金融风控中,不仅需要预测违约概率,还需要知道预测的置信度。
6.2 贝叶斯 A/B 测试
传统 A/B 测试使用频率派的假设检验(p 值),但 p 值容易被误解。贝叶斯 A/B 测试更直观:
- 对 A、B 两组的转化率设定先验分布(如 Beta 分布)
- 根据观测数据计算后验分布
- 直接计算 B 优于 A 的概率 $P(\theta_B > \theta_A | \text{data})$
这种方法的优点是可以随时停止实验观察结果,而不需要像频率派方法那样预设样本量。
6.3 贝叶斯优化
贝叶斯优化是一种利用概率模型指导黑箱函数优化的方法。它特别适合超参数调优:
- 用高斯过程(Gaussian Process)建模目标函数
- 根据当前观测数据计算后验分布
- 用采集函数(如 Expected Improvement)选择下一个评估点
- 评估后更新模型
相比于网格搜索和随机搜索,贝叶斯优化可以用更少的迭代次数找到更好的超参数组合。
6.4 在线学习的遗憾分析进阶
在线学习算法的一个重要理论结果是:对于凸损失函数,任何在线算法的遗憾至少为 $\Omega(\sqrt{T})$。也就是说,$O(\sqrt{T})$ 的遗憾界是最优的——在线梯度下降达到了这个下界。
对于强凸损失函数,遗憾界可以改进到 $O(\log T)$,这意味着平均遗憾以 $O(\log T/T)$ 的速度趋于零——比一般凸损失的收敛快得多。
L1 与 L2 正则化的贝叶斯解释
从贝叶斯角度看,正则化对应着在参数上施加先验分布。具体来说,L2 正则化等价于在参数上施加高斯先验 $\theta_j \sim \mathcal{N}(0, 1/\lambda)$,然后寻找最大后验估计(MAP)。而 L1 正则化等价于在参数上施加拉普拉斯先验 $\theta_j \sim \text{Laplace}(0, 1/\lambda)$。
这两种先验的关键区别在于它们在原点附近的形状。高斯先验在原点处平滑,倾向于将参数"收缩"到零但不会精确为零。拉普拉斯先验在原点处有一个尖峰,因此 MAP 估计倾向于将不重要的参数精确设为零。这就是为什么 L1 正则化具有特征选择能力——它产生稀疏解,自动告诉我们哪些特征对预测最重要。
贝叶斯信息准则
在模型选择中,贝叶斯信息准则(BIC)提供了一种在拟合优度和模型复杂度之间平衡的度量:
$$\text{BIC} = -2\ln(\hat{L}) + k\ln(m)$$
其中 $\hat{L}$ 是模型的最大似然值,k 是参数数量,m 是样本数。BIC 惩罚参数较多的模型,有助于防止过拟合。与 AIC 相比,BIC 对参数数量的惩罚更严厉($\ln(m)$ vs 2),因此倾向于选择更简单的模型。
延伸阅读
- 📺 B 站播放列表:Stanford CS229 — 斯坦福机器学习
- 📚 更多学习资源,请访问 deeplearning.ai 官网