线性回归的统计和概率解释
1. 核心概览
1.1. 总体
线性回归的几何解释 里梳理过,线性回归的解析解是 \( w = (X^TX)^{-1}X^Ty \) ,当 X 不是列满秩时, \( X^TX \) 不可逆, w 有无数解, 一种数学和建模上都不错的选择是最小 2 范数解 \( w = X^T(XX^T)^{-1}y \) 。
对于 \( w = (X^TX)^{-1}X^Ty \), 统计上的解释是先对它替换一套符号:写成 \(\text{Cov}(X,X)^{-1}\text{Cov}(X,y)\),
这里使用了样本统计量 Cov ,是将特征-目标协方差向量 Cov(X,y) 作为权重,去线性组合特征协方差矩阵的逆矩阵的各列。
加入截距项等效于对数据自动中心化,截距负责将拟合面平移回数据均值中心。(相比于前一篇文章里线性空间的几何解释,这里我们需要把偏置 b 单独拿出来分析,因为统计里我们需要区分稳定项和波动项)
\(\text{Cov}(X,X)^{-1}\text{Cov}(X,y)\) 只是针对当前看到的有限样本的特征 X 和 y 之间线性关系的比例系数。
要让这个数字具备推广意义,必须上升到(无限的)数据总体。这是引入概率的核心动机(从有限数据的描述到无限数据的推断),此时有限样本被视为总体机制的一些采样特例。
对于线性回归,最小的概率假设是线性模型和矩条件: E[Xϵ]=0(加性噪声与输入正交),大数定律确保样本协方差依概率收敛至总体协方差,使得有限样本的一个确定性描述 w 升级为总体参数 w* 的一致估计量。
而更强也更经典的概率假设是线性模型加上高斯分布。
更具体一点:
1.2. 无概率模型的统计解释
- 原点过回归 (\(y = wx\)) 解为 \(w = \frac{\sum x_i y_i}{\sum x_i^2}\),即 X 与 Y 的点积除以 X 的模长平方(投影系数)。 若 X,Y 已中心化(均值为零),则退化为统计量: \[ w = \frac{\text{Cov}(X,Y)}{\text{Var}(X)} \] 斜率衡量 Y 随 X 单位波动的敏感度。
带偏置的单变量回归 (\(y = wx + b\)) ,等价于对数据做隐式中心化预处理(减去均值),再应用无截距回归,最后用均值补回截距。斜率仅关注围绕均值的波动,不受绝对位置干扰。
\[ b = \bar{y} - w\bar{x} \]
\[ w = \frac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sum (x_i-\bar{x})^2} = \frac{\text{Cov}(X,Y)}{\text{Var}(X)} \]
- 多特征过约束模型 (\(y = Xv + b\)) 可以引入增广矩阵 \( \tilde{X} = [X \ \mathbf{1}] \),参数 \(w = [v \ b]^T\)。 正规方程解耦后,令中心化特征 \(X_c = X - \mathbf{1}\bar{x}^T\),中心化标签 \(y_c = y - \mathbf{1}\bar{y}\),斜率满足: \[ v = (X_c^T X_c)^{-1} X_c^T y_c, \quad b = \bar{y} - \bar{x}^T v \] 这里 \(X_c^T X_c\) 是特征协方差矩阵,\(X_c^T y_c\) 是特征-目标协方差向量。带偏置的多元最小二乘,就是先中心化所有特征和目标,解一个无偏置的线性系统,再通过 \(b\) 将预测平面平移回原始均值处。
多特征欠约束模型 (\(m < n\)) 最小范数解为 \(w = X^T(XX^T)^{-1}y\)。 此时权重 w 被表示为样本的线性组合(对偶表示):\(w = \sum \alpha_i X_{i,}\)。
预测新样本时,\(f(x) = \sum \alpha_i \langle x, X_i \rangle\)。这切换了视角:从“学习特征权重”变为“衡量新样本与历史样本的内积”,是核方法(Kernel Method)的起点。
1.3. 概率中矩方法解释
概率视角(矩估计):只需线性加性噪声 \(Y = wX + \epsilon\),且噪声与输入无关(\(\mathbb{E}[X\epsilon]=0\))。取矩(期望)可得: \[ w = \frac{\mathbb{E}[XY] - \mathbb{E}[X]\mathbb{E}[Y]}{\mathbb{E}[X^2] - \mathbb{E}[X]^2} = \frac{\text{Cov}(X,Y)}{\text{Var}(X)} \] 由大数定律,样本协方差/方差依概率收敛于总体矩,解释最小二乘估计的一致性。矩条件比 MLE 弱得多,仅依赖期望线性性质,但因难以推广至非线性模型,现代 ML 更常采用似然/经验风险最小化框架。
2. 线性回归解的统计解释
2.1. 单特征且无偏置模型
如果线性回归的模型是 \(y = x^Tw\),其中 x, y 是观测向量,即数据 X 只有一列,且没有偏置 b。
目标是最小化残差平方和 \[ L(a) = \sum_{i=1}^n (y_i - w x_i)^2. \]
对 w 求导并令导数为零: \[ \frac{dL}{dw} = -2\sum_{i=1}^n x_i (y_i - w x_i) = 0 \quad\Longrightarrow\quad \sum_{i=1}^n x_i y_i - w \sum_{i=1}^n x_i^2 = 0. \]
解得: \[ w = \frac{\sum_{i=1}^n x_i y_i}{\sum_{i=1}^n x_i^2} \]
写成向量形式为 \( w= \frac{\vec{x} \cdot \vec{y}}{|\vec{x}|^2} \)
w 的分子是各个样本输入特征和输出目标乘积的和,而分母是输入数据的平方和(2 范数的平方)。
如果 x 和 y 都被中心化了,即 \( \sum x_i = \sum y_i = 0 \), 那么解可以写成:
\[ w = \frac{\sum x_i y_i}{\sum x_i^2} = \frac{\frac{1}{n}\sum (x_i - 0)(y_i - 0)}{\frac{1}{n}\sum (x_i - 0)^2} \]
这时候分子是样本协方差的计算公式,记为 \( \hat{Cov}(X, Y) \),而分母是样本特征的方差计算公式,记为 \( \hat{Cov}(X, X) \), 或者 \( \hat{Var}(X) \)
注意这里 \( \hat{Cov} \) 可以认为仅仅是一个统计数据的算法的函数名,给定两个长度相等的列表 X 和 Y, 就能用以下方式计算出分子分母:
def cov(x,y):
n = len(x)
x_ave = sum(x)
y_ave = sum(y)
return sum([(xi-x_ave)*(yi-y_ave) for xi,yi in zip(x,y)])/n
def var(x):
return cov(x,x)
2.2. 单特征有偏置模型和隐式中心化
接着看有偏置模型 \(y = w x + b\) 在一维输入的解及其数据构成
损失函数为: \[ L(w,b) = \sum_{i=1}^n (y_i - w x_i - b)^2 \]
对 b 求导置 0: \[ \frac{\partial L}{\partial b} = -2\sum_{i=1}^n (y_i - w x_i - b) = 0 \] 化简得: \[ \sum y_i - w\sum x_i - n b = 0 \] 因此截距 b 必须满足: \[ b = \bar{y} - w \bar{x} \] 其中 \(\bar{x} = \frac{1}{n}\sum x_i\),\(\bar{y} = \frac{1}{n}\sum y_i\)。
这里对 b 的解释为:把所有输入求均值后应用到模型 w 上的结果和 y 的均值的差异
接着对 w 求导置 0,并代入 b \[ \frac{\partial L}{\partial w} = -2\sum_{i=1}^n x_i (y_i - w x_i - b) = 0 \] 将 \(b = \bar{y} - w \bar{x}\) 代入: \[ \sum x_i y_i - w\sum x_i^2 - (\bar{y} - w \bar{x})\sum x_i = 0 \] 因为 \( \sum x_i = n\bar{x} \),展开: \[ \sum x_i y_i - w\sum x_i^2 - n\bar{x}\bar{y} + w n\bar{x}^2 = 0 \] 提取公因式 \(w\): \[ (\sum x_i y_i - n\bar{x}\bar{y}) - w(\sum x_i^2 - n\bar{x}^2) = 0 \] 因此,带偏置时的斜率解为: \[ w = \frac{\sum x_i y_i - n\bar{x}\bar{y}}{\sum x_i^2 - n\bar{x}^2} \]
利用代数恒等式:
- 分子:\(\sum x_i y_i - n\bar{x}\bar{y} = \sum (x_i - \bar{x})(y_i - \bar{y})\)
- 分母:\(\sum x_i^2 - n\bar{x}^2 = \sum (x_i - \bar{x})^2\)
所以斜率也可以写成: \[ w = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2} \]
同样可以在分子分母同时除以 n ;那么不需要假设 x 和 y 已经中心化了,分子就可以解释为数据的样本协方差,而分母则是样本输入特征的方差
可以这么来解释引入偏置后的模型:
斜率 w 不再受数据绝对位置(均值)的影响,它只会关注每个点相对于自身均值的波动关系,而均值产生的影响由截距 b 平移回去。
所以,带偏置的最小二乘解,相当于对数据做了一次隐式的中心化预处理(减去均值),再应用无偏置的过原点回归,最后用均值补回截距。
2.3. 多特征无偏置过约束模型
现在考虑一般的 y=Xw 形式,X 是 (m,n) 形状的纯数据模型(没有增广的全 1 列),如果 X 是列满秩,那么问题转成正规方程 \(X^T X w = X^T y\) 的解:
\[ w = (X^T X)^{-1} X^T y \]
这里 \(X^T X\) 是一个 (n,n) 形状的矩阵,其第 i 行第 j 列元素是 X 第 i 列与第 j 列的内积:\(\sum_k x_{kj} x_{kj}\)。
这是各特征列之间的内积组成的对称矩阵,也称为特征 Gram 矩阵。
\(X^T y\) 是一个 (n,1) 形状的向量,其第 i 个元素是 X 的第 i 列特征与 y 的内积:\(\sum_k x_{ki} y_k\)。
所以 w 完全由所有特征列与目标列之间的原始内积,以及特征列彼此之间的原始内积,通过矩阵求逆和乘法组合而成。它没有任何显式的均值相减。
如果 X 的每一列都中心化了,y 也中心化了,记 \[ \bar{x}_i = \frac{1}{m}\sum_{k=1}^m x_{ki},\quad \bar{y} = \frac{1}{m}\sum_{k=1}^m y_k \]
那么 \( X^TX \) 的第 (i, j) 个元素是为
\[ \sum_{k=1}^m (x_{ki} - \bar{x}_i)(x_{kj} - \bar{x}_j) \]
它是 X 第 i 列特征与第 j 列特征的样本协方差,此时 \( X^TX \) 可以称为特征协方差矩阵。
\( X^Ty \) 的第 i 个元素为:
\[ \sum_{k=1}^m (x_{ki} - \bar{x}_i)(y_k - \bar{y}) \] 它是 X 第 i 列特征和 y 的样本协方差
但对该矩阵求逆然后乘以各个特征和 y 的斜方差向量 \( X^Ty \) 直观上并不容易解释,只能说着这和单特征情况类似,都能用 \( \hat Cov(X,X)^{-1} \hat Cov(X,y) \) 的形式来书写。
2.4. 多特征无偏置欠约束模型
如果 X 是行满秩(即样本数 m 小于特征数 n,且秩为 m),此时系统 \(Xw = y\) 有无穷多解。其最小范数解为:
\[ w = X^T(XX^T)^{-1}y \]
这里,\(XX^T\) 是一个 (m, m) 形状的矩阵。它的第 i 行第 j 列的元素不是特征之间的点积,而是第 i 个样本与第 j 个样本在所有特征维度上的内积: \[ (XX^T)_{ij} = \sum_{k=1}^{n} x_{ik} x_{jk} \]
此时 \(XX^T\) 被称为样本 Gram 矩阵(或核矩阵)。
但除了取几个名字,似乎很难谈论这个解 w 和数据的更具体关系,但当把解拆分写成以下形式
\[ w = X^T \alpha, \quad \quad \alpha = (XX^T)^{-1}y \]
这里 \(\alpha\) 是一个 \(m\) 维向量。
这意味着,参数向量 w 是所有训练样本 X 的行向量(即样本点)的线性组合:
\[ w = \sum_{i=1}^m \alpha_i \, X_{i,} \]
所以 \( (XX^T)^Ty \) 得到的是一个对各个样本的系数向量,也就是说最小范数的解能天然由样本的线性组合构成;
注意这个结论在列满秩的情况下并不特别,因为列满秩意味着 X 的行空间本身就是整个 \( R^n \) 空间,任何 w 都是在 X 的行空间中。但欠约束模型中,行数少于列数,权重 w 很可能不在行空间,但以上表明最小范数解必然还是在行空间。
这意味着 w 的样本表示(是样本的加权组合)可以同时适用于这两种情况的最小二乘解,这是一种通用的解释框架。
在下一次预测中 \( x^Tw \) 其实是新样本 x 和已有所有的样本 \( x_i \) 之间的加权后的内积:
\( f(x) = x^TX^T\alpha \) = \( \sum_{i=1}^m \alpha_i x^Tx_i \)
这是一种非常“经验”或者说非常“统计”性质的结论,模型只关系新样本和历史样本之间的关系, 给定一个新数据,用它去和其他已有数据求内积(某种距离),然后加权,即一切预测还是基于单个样本本身。
这和一般构建线性模型 y=Xw 的初衷是不同的,给定一个数据,它往往有多个特征 (x1,x2,x3,…) 构成,我们假设每个特征有一个权重 (w1,w2,w3…) 然后用线性关系去组合它们
得到 \( y=x_1w_1+x_2w_2+x_3w_3+\dots \), 也就是说我们想要学习的是特征的权重。
但以上分析告诉我们,至少在最小二乘问题下,学习特征的比重和组合样本之间的内积关系是等价的,比如把 \( f(x)=\sum_i^m \alpha_i x^Tx \) 中样本之间距离 \( x^Tx \) 替换成更一般的 k(x1,x2) 就能发展出 kernel 方法,而这种从特征到样本的视角切换是核方法的关键。
这和前一篇文章中用 SVD 和伪逆 \( w = X^+ y \) 统一最小二乘解(残差最小)和最小范数解是类似的,只不过这里我们用样本的某种统计指标来统一。
2.5. 多特征有偏置过约束模型
现在考虑 \( y=\tilde{X}w \) ,这里 \( \tilde{X} \) 是列满秩的增广矩阵 \([X, \mathbf{1}]\) ,满足 \( m > n+1 \)
引入一些更基础的符号:
- 纯特征矩阵为 \( X \in \mathbb{R}^{m \times n} \)(\( m \) 个样本,\( n \) 个特征)
- 全 1 列向量为 \( \mathbf{1} \in \mathbb{R}^{m \times 1} \)
- 增广矩阵 \( \tilde{X} = [X \ \ \mathbf{1}] \in \mathbb{R}^{m \times (n+1)} \)
- 参数向量 \( w = \begin{bmatrix} v \\ b \end{bmatrix} \),其中 \( v \in \mathbb{R}^n \) 是特征斜率,\( b \in \mathbb{R} \) 是截距
模型写成 \( y = \tilde{X} w = X v + b \mathbf{1} \)。
正规方程为: \[ \tilde{X}^T \tilde{X} w = \tilde{X}^T y \]
将 \(\tilde{X} = [X \ \ \mathbf{1}]\) 代入等式左侧,分块展开:
\[ \tilde{X}^T \tilde{X} = \begin{bmatrix} X^T \\ \mathbf{1}^T \end{bmatrix}\begin{bmatrix} X & \mathbf{1} \end{bmatrix} = \begin{bmatrix} X^T X & X^T \mathbf{1} \\ \mathbf{1}^T X & \mathbf{1}^T \mathbf{1} \end{bmatrix} \]
记:
- \( X^T \mathbf{1} = \sum_{k=1}^m x_k \)(各特征列和,是一个 \( n \times 1 \) 向量)
- \( \mathbf{1}^T X = (\sum_{k=1}^m x_k)^T \)
\( \mathbf{1}^T \mathbf{1} = m \)
\(\tilde{X} = [X \ \ \mathbf{1}]\) 代入等式右侧:
\[ \tilde{X}^T y = \begin{bmatrix} X^T y \\ \mathbf{1}^T y \end{bmatrix} = \begin{bmatrix} X^T y \\ \sum_{k=1}^m y_k \end{bmatrix} \]
于是正规方程展开为两个分块方程: \[ \begin{cases} X^T X \, v + X^T \mathbf{1} \, b = X^T y & \quad (1) \\ \mathbf{1}^T X \, v + m \, b = \mathbf{1}^T y & \quad (2) \end{cases} \]
从方程 (2) 解出截距 \( b \) \[ m b = \mathbf{1}^T y - \mathbf{1}^T X v \] 两边同除以 \( m \): \[ b = \bar{y} - \bar{x}^T v \] 其中:
- \( \bar{y} = \frac{1}{m} \sum_{k=1}^m y_k \)(标量,目标均值)
- \( \bar{x} = \frac{1}{m} X^T \mathbf{1} = \frac{1}{m} \sum_{k=1}^m x_k \)(\( n \times 1 \) 向量,各特征均值)
这个 b 的表达式和单特征情况下的解形式完全是一样的,它是在模型作用在输入均值上的补偿。
将 \( b = \bar{y} - \bar{x}^T v \) 代入方程 (1): \[ X^T X \, v + X^T \mathbf{1} (\bar{y} - \bar{x}^T v) = X^T y \]
注意到 \( X^T \mathbf{1} = m \bar{x} \),展开: \[ X^T X \, v + m \bar{x} \bar{y} - m \bar{x} \bar{x}^T v = X^T y \]
将所有含参数 v 的项合并,常数项移到右边: \[ (X^T X - m \bar{x} \bar{x}^T) v = X^T y - m \bar{x} \bar{y} \quad (3) \]
如果令 \[ X_c = X - \mathbf{1} \bar{x}^T \]
\( X_c \) 是中心化后的 X, 其第 \( k \) 行第 i 列为 \( x_{ki} - \bar{x}_i \),那么:
\[ X_c^T X_c = (X - \mathbf{1} \bar{x}^T)^T (X - \mathbf{1} \bar{x}^T) = X^T X - \bar{x} \mathbf{1}^T X - X^T \mathbf{1} \bar{x}^T + \bar{x} \mathbf{1}^T \mathbf{1} \bar{x}^T \]
由于 \( \mathbf{1}^T X = m \bar{x}^T \),\( X^T \mathbf{1} = m \bar{x} \),代入化简:
\[ X_c^T X_c = X^T X - m \bar{x} \bar{x}^T - m \bar{x} \bar{x}^T + m \bar{x} \bar{x}^T = X^T X - m \bar{x} \bar{x}^T \]
所以等式 (3) 左边括号内的矩阵 \( X^T X - m \bar{x} \bar{x}^T \) 就是中心化后的 X 的特征 Gram 矩阵。
(3) 右边向量可以写成: \[ X^T y - m \bar{x} \bar{y} = X_c^T y_c \]
其中 \( y_c = y - \mathbf{1} \bar{y} \) 是中心化的目标向量。
因此 (3) 可以写成: \[ X_c^T X_c \, v = X_c^T y_c \]
由于 \( \tilde{X} \) 列满秩(\( m > n+1 \)),中心化的 \( X_c \) 也列满秩,所以: \[ v = (X_c^T X_c)^{-1} X_c^T y_c \] \[ b = \bar{y} - \bar{x}^T v \]
在统计语境下,\( X_c^T X_c \) 是样本特征的协方差矩阵。
\( X_c^T y_c \) 的第 \( i \) 个元素是特征 i 与目标 y 的协方差。
因此,有偏置模型的特征参数向量 v 完全由中心化后的数据的协方差矩阵的逆,乘以特征-目标协方差向量得出:
\[ v = \big( \text{Cov}(X, X) \big)^{-1} \text{Cov}(X, y) \]
所以,和但特征一样,带偏置项的最小二乘解,相当于对数据做了一次隐式的中心化预处理(减去均值),再应用无偏置的过原点回归,最后用均值补回截距。
2.6. 多特征有偏置欠约束模型
最后是 \( y=\tilde{X}w \) 且 \( \tilde{X} \) 是行满秩的增广矩阵 \([X, \mathbf{1}]\) ,满足 \( m < n+1 \)
\[ w = \tilde{X}^T(\tilde{X}\tilde{X}^T)^{-1}y \]
这种情况 w 仍然写成 \( \tilde{X} \alpha \), 能得到的额外信息是 \( b= 1^T\alpha = \sum_i^m \alpha_i \)
总的来说和无偏置情况的解释是一样的,从 kernel 角度看, K(x1,x2) 中的样本 x1 和 x2 只不过是新增了一个 1 特征。
3. 关于数据生成过程的假设
当随机变量及其概率分布被引入后,可以假设观测值并不是固定产生的,而是由某个随机机制生成:
\( y=x^Tw+\epsilon, \)
其中 \( \epsilon \) 是具有给定分布(如高斯分布)的随机变量。
这里建模对象发生了变化。我们不再把数据看成一组孤立的几何点,而是某个随机过程的一次观测结果。模型需要描述的不只是数据之间的空间关系,还包括这些数据为什么会以这样的方式出现。
概率模型提供了“一次性”的数据生成的视角,我们可以观察到外部世界中某些数据的产生过程,然后把这个产生过程的信息也近似地映射到数学中去,这比直接观察到静态的空间结构然后映射成几何语言更丰富一些。比如高斯分布是现实中某些问题里经常观测到的结果,那么 数据在和确定性的机制 w 交互之后,最终又叠加上了高斯分布 \( \epsilon \) 就有一定的现实解释力,它拉近的是数学世界和现实世界的距离,而这种解释来自于数据产生的方式是否和一般观测到高斯分布场景的过程类似。
一个类比是,如果只能看到夜空中某一时刻星星的位置,我们最多只能根据空间分布进行分类,例如划分星座,这是一种只有距离而不带其他结构的几何描述。
当持续观测星体的位置变化时,我们开始能够讨论轨道、速度以及周期等运动规律,此时观测数据中出现了一些更高层的稳定几何结构,比如圆,平面,椭圆,可以用这种轨迹结构去做预测,谈论物体接下来会如何运动,比之前孤立的点丰富了很多。
但它仍然没有回答"为什么会出现这种结构?"
等到牛顿提出万有引力定律后,人们开始把这些运动理解为某种普遍规律的结果。虽然引力本身为什么存在仍然未知,但至少不同的天体运动可以统一地解释为同一种作用规律的表现,人们可以用这个规律去谈论行星为什么运动。
概率统计是在牛顿定律层面吗?
并不是,它是在运动轨道的层面构造的一种描述信息生成的语言,而不是描述确定性机制的语言,比如测量行星轨迹的时候,第一天测到 1.001, 第二天 1.002, 第三天 0.997. 概率能给这种不确定性建立一个函数描述,不同的值对应一个生成的概率,但它不会解释为什么会有一个如此稳定的轨道,也不会解释为什么有噪声,这些噪声可能来自各方面,比如抄写误差,设备误差,但它们都被抽象掉变成数据之间信息的规律。
不过,仅仅这一层抽象就已经极大增强了我们描述现实的能力。很多时候,我们并不需要知道世界为何如此运行(这可能永远无法知道,比如引力是什么导致的,量子为什么会有不确定性等,这个为什么链条似乎是无穷尽的),也不需要建立完整的物理机制,只要能够准确描述观测数据之间的统计规律,就足以完成预测、估计甚至决策。例如房价预测、图像识别等问题,它们真正利用的是信息层面的“运动”规律,而不是底层物理机制。
4. 解的弱概率解释
前文对各种情况下解的解释是基于当前有限的观测样本的统计术语(均值,协方差,Gram 矩阵)进行表述的。
但往往描述完了,就结束了,看上去就是用一些复杂的名词进行了包装。
但线性回归不单单是用来描述已有数据特征之间的关系,还会用来进行预测(或者推断),这种需求是面向没有观测到的数据的(从经验风险到结构风险)。
而概率模型的引入是对数据生成机制的一种近似描述,通过这种机制理论可以产生无数随机样本,但这些样本共同遵循着相同的概率属性。
那么在什么样的对数据生成过程的假设下,对数据进行线性回归是可以用来预测未来的?
4.1. 高斯加性噪声下的 MLE 解释
我们先给出最常见的高斯加性噪声的解释(是是强概率解释,因为引入了精确的高斯分布,但它过于经典,因此在此先引入作为后文弱概率解释的对比)。
首先把观测值 y 不再看作确定性的计算结果,而是一个随机变量,给定输入 X 后,它服从某个条件概率分布 \(p(y|X; w)\)。
而这个分布可以用以下更细的公式决定:
\[ y_i = x_i^T w + \epsilon_i, \quad \epsilon_i \sim \mathcal{N}(0, \sigma^2) \]
每一个样本 \( x_i \) 在确定性的由于加法和乘法组成的线性机制 \(x_i^T w\) 的基础上,叠加了一个独立的高斯(正态)噪声 \(\epsilon_i\) ,它不解释噪声来自抄写还是其他类型的误差,只是从信息层面统一描述为围绕均值的随机波动。
\(y_i\) 在给定 \(x_i\) 和参数 w 后,就服从一个以 \(x_i^T w\) 为中心的高斯分布:
\[ p(y_i | x_i; w) = \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left( -\frac{(y_i - x_i^T w)^2}{2\sigma^2} \right) \]
对于全部 \(m\) 个独立观测样本,观测数据出现的联合概率(即似然函数 \(L(w)\))为各点概率的乘积:
\[ L(w) = \prod_{i=1}^{m} p(y_i | x_i; w) = \prod_{i=1}^{m} \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left( -\frac{(y_i - x_i^T w)^2}{2\sigma^2} \right) \]
为了计算方便,取对数得到对数似然:
\[ \ell(w) = \log L(w) = \text{C} - \frac{1}{2\sigma^2} \sum_{i=1}^{m} (y_i - x_i^T w)^2 \]
要最大化观测数据出现的概率,等价于最小化 \(\sum_{i=1}^{m} (y_i - x_i^T w)^2\) ,也就是最小二乘目标函数 \(\|y - Xw\|^2\)。
注意这里 \( \epsilon_i \) 的方差可以是任意的,比如是 \( \lambda \) ,只要保证每个样本上的方差都相同。
因此基于线性确定性规则 xw 叠加高斯噪声 \( \epsilon \),遵循最大似然的原则,可以很好地解释为什么要选择平方损失。
但必须要假设精确的高斯分布,同时假设方差相同如此精确而苛刻的要求吗?现实里数据往往并没有如此完美,那么预测会失效吗?
有许多种缓解假设和现实不匹配的措施,比如正则化,但本文不讨论,接下来介绍的是,我们可以不做这么强的假设,你只需要检查数据的某些更少的属性就确定是否可以用线性回归进行未来预测:
4.2. 弱概率解释:矩条件和矩方法
首先线性和加性噪声的假设还是需要保留:
\[ Y=wX+b+\epsilon \tag{a} \]
直接对两边取期望(称为矩方法): \[ E[Y]=wE[X]+b+E[\epsilon] \tag{b} \]
对 (a) 式两边乘以 X 后再取期望 \[ E[XY]=wE[X^{2}]+bE[X]+E[X\epsilon] \tag{c} \]
对 (b) 式两边乘以 E[X] 以消除 b \[ E[X]E[Y] = wE[X]E[X]+bE[X] + E[\epsilon]E[X] \tag{d} \]
(c) 减去 (d) 得到:
\[ w(E[X^{2}]-E[X]^{2}) + (E[X\epsilon]-E[\epsilon]E[X]) = E[XY] - E[X]E[Y] \]
如果 \( E[X\epsilon]-E[\epsilon]E[X] \) 为 0 (噪音和 X 的协方差为 0),那么有:
\[ w = \frac{E[XY]-E[X]E[Y]}{E[X^{2}]-E[X]^{2}} = \frac{\sigma_{xy}}{\sigma_{x}^{2}} \]
也就是说 a 是理想协方差和 X 的方差的比值,该形式和最小二乘得到的形式基本一致,仅仅是样本(协)方差和总体(协)方差的区别。
所以说,这里并不要求噪声是等方差的高斯分布,而只需要噪音和输入变量 X 的协方差为 0, 这可以包括多种:
- 最严格也是最理想情况:噪音和 X 独立
- 噪音期望 \( E[\epsilon] = 0 \), 且噪音和 X 正交,即 \( E[X\epsilon] = 0 \)
- 噪音是非线性的,只要协方差为 0, 那么噪音就不会影响 X 和 Y 的线性稳定性。
- 各个样本噪音可以不同,只要保持和 X 输入正交(不依赖于 X)
有了这个假设,再加上样本协方差、样本方差的无偏性,由大数定律支撑,当样本量足够多时,通过最小二乘法得到的估计将会非常接近真实的模型。
前文 MLE 需要基于完整的分布假设,矩条件则只需要知道 E[XY], E[X] 等期望(矩),假设比 MLE 方法弱得多,那么它的代价是什么呢?
矩方法是对概率模型 y=f(X)+e 两边取期望,在线性模型 wX+e 下,期望的线性性质使得 \( E[X^2] \) 和参数 w 解耦和, b 和 E[X] 解耦和,最终才能算出 w 的表达式,这是期望的线性性质和模型的线性性质相互匹配而得到的。
但如果模型本身不是线性的是一个一般的 f(X)+e, 就得不到 w 的关于概率模型属性(矩)的封闭解了,因此机器学习里更多采用基于似然或经验风险最小化的统一模型,直接数值优化,而较少从矩条件推导参数。
5. 岭回归的最大后验概率解释
在贝叶斯统计视角下,我们不仅关注数据,还关注参数 w 自身出现的可能性。我们可以给 w 赋予一个先验分布(prior)。假设 w 的每一个分量都独立地服从均值为 0 方差为 1 的高斯分布,w 的联合概率分布就是
\[ p(w) = \prod_{j=1}^{n} \frac{1}{\sqrt{2\pi\tau^2}} \exp\left( -\frac{w_j^2}{2} \right) = \text{C} \cdot \exp\left( -\frac{1}{2} \|w\|^2 \right) \]
且模型为 \( Y=x^TW+\epsilon_{\lambda} \), 这里 \( \epsilon_{\lambda} \) 是方差为 \( \lambda \) ,期望为 0 的高斯分布。
根据贝叶斯定理,看到数据后 w 的后验概率(posterior)为:
\[ p(w | X, y) \propto p(y | X; w) \cdot p(w) \]
取对数后:
\[ \log p(w | X, y) = C - \frac{1}{2\lambda } \|y - Xw\|^2 - \frac{1}{2} \|w\|^2 \]
最大化它就等于最小化 \[ \|y - Xw\|^2 + \lambda \|w\|^2 \]
这就是岭回归的目标函数。
对 w 求偏导然后置 0 : \( -X^T(y-Xw)+\lambda w = 0 \)
得到岭回归版本的正规方程 \( (X^TX+\lambda I)w = X^Ty \)
解为 \( w = (X^TX+\lambda I)^{-1}X^Ty \)
6. 概率解释的灵活性
至此,我们用两个特定的概率假设模型分别覆盖了一般的回归模型和岭回归:
- 假设在线性机制 Xw 上叠加了一个独立的同分布的标准高斯噪声就得到一般回归
- 继续给参数赋予一个先验分布,就得到了岭回归
因此从表达能力上,概率模型可以重新解释前文提到的几何结果,只要稍微一变化,比如你观察到噪声的分布不是平滑的钟型,而有点尖锐,那么可能会选用 Laplace 噪声 \( p(\epsilon) ~ e^{-\mid \epsilon \mid} \), 最大似然概率就变成了最小化 Xw-y 的 L1 范数。