定义#
残差是实际观测值与回归模型预测值之间的差。模型解释不了的那部分,全都落在残差里,所以看残差等于在看模型漏掉了什么。
回归的几个关键假设——线性关系、同方差、误差项独立同分布——都不能直接观察,只能通过残差间接检查。如果残差图上出现明显的形状(比如抛物线),说明真实关系不是直线;如果残差的散布随预测值变大而变宽,说明存在异方差;如果残差前后相关,说明存在自相关。所以每建一个回归模型,至少要画一张残差图。
公式#
其中 是第 个观测的实际值, 是模型对它的预测值, 就是残差。在多元回归 中, 由估计出的系数代入自变量算得。最小二乘法要最小化的正是残差平方和 。
算一笔账#
接着一元回归的例子:市场收益 ,个股收益 (单位:%),拟合出的模型是 。
代入各期 得到预测值:−3.0、−1.3、+0.4、+2.1、+3.8。
用实际值减去预测值,残差依次是 0、+0.3、−0.4、−0.1、+0.2。它们相加正好为 0——这是最小二乘法的性质,带截距项的回归残差总和恒为零,所以「残差和是 0」不能用来证明模型好。
残差平方和 ,这就是模型没能解释掉的那部分波动。
常见问题#
残差和误差项是一回事吗?#
不是。误差项是真实但看不见的随机扰动,残差是我们用估计出的模型算出来的、看得见的近似。残差是误差项的样本对应物,用它来推断误差项的性质,但两者不相等。
残差图应该长什么样?#
理想情况是围绕 0 的一团没有结构的散点:上下对称、宽度均匀、看不出趋势。一旦出现弯曲、喇叭口或者一段一段的波浪,就说明分别对应线性、同方差或独立性假设出了问题。
发现残差有问题该怎么办?#
先定位是哪一类问题。异方差可以试对数变换、Box-Cox 变换,或者直接改用稳健标准误;自相关在时间序列里可以做差分或用 Newey-West 校正;残差有系统形状则说明该换模型形式,而不是继续修补。