跳到主内容
@wquguru
术语时间序列

自相关 Autocorrelation

2026-09-05 更新

定义#

自相关是一个序列与自己滞后若干期之间的相关程度。把序列往后挪 kk 期,再和原序列算相关系数,得到的就是滞后 kk 阶的自相关。它回答的是「今天的值里,有多少能从昨天(或前 kk 天)推出来」。

自相关是 AR(自回归)模型的基础:AR 模型直接把历史值当自变量做回归。它也是一条重要的警报线——很多统计方法默认样本之间独立,一旦存在自相关,方差就会被低估,置信区间画得过窄,看起来显著的结果其实没那么可靠。

公式#

滞后 kk 阶的自相关系数定义为:

ρk=Cov(Xt,Xt+k)Var(Xt)=γkγ0\rho_k = \frac{\mathrm{Cov}(X_t, X_{t+k})}{\mathrm{Var}(X_t)} = \frac{\gamma_k}{\gamma_0}

其中 γk\gamma_k 是间隔 kk 期的自协方差,γ0\gamma_0 就是方差。ρ0\rho_0 恒等于 1,ρk\rho_k 取值在 1-111 之间。

这个定义要成立,序列必须协方差平稳:均值恒定、方差恒定、Cov(Xt,Xt+k)=γk\mathrm{Cov}(X_t, X_{t+k}) = \gamma_k 只与间隔 kk 有关。AR(p) 模型则写成:

Xt=c+φ1Xt1+φ2Xt2++φpXtp+ϵtX_t = c + \varphi_1 X_{t-1} + \varphi_2 X_{t-2} + \cdots + \varphi_p X_{t-p} + \epsilon_t

其中 φi\varphi_i 是自回归系数,ϵt\epsilon_t 是白噪声。滞后阶数 pp 通常靠 PACF 图和 AIC、BIC 信息准则来定。

算一笔账#

取一个 AR(1) 序列 Xt=0.5Xt1+ϵtX_t = 0.5 X_{t-1} + \epsilon_t,看看自相关随滞后阶数怎么衰减。

对 AR(1),ρk=φk\rho_k = \varphi^k。所以 ρ1=0.5\rho_1 = 0.5ρ2=0.52=0.25\rho_2 = 0.5^2 = 0.25ρ3=0.125\rho_3 = 0.125ρ4=0.0625\rho_4 = 0.0625。到第 4 阶已经不足 0.07,几乎看不出来了——记忆是指数级褪色的。

再看这对预测的意义。ρ1=0.5\rho_1 = 0.5 意味着用昨天预测今天,能解释的方差比例是 ρ12=0.25\rho_1^2 = 0.25,也就是 25%,剩下 75% 仍然是噪声。而如果换成股票日收益,实际的一阶自相关往往只有 0.03 左右,0.032=0.00090.03^2 = 0.0009,解释力不到千分之一。这就是为什么日收益的 AR 模型在扣掉交易成本后基本不剩什么。

常见问题#

ACF 和 PACF 有什么区别,看哪个定阶?#

ACF 是总的自相关,里面混着间接影响——Xt2X_{t-2} 通过 Xt1X_{t-1} 传导过来的部分也算进去了。PACF(偏自相关)把中间层剥掉,只看直接影响。所以定 AR 的阶数 pp 主要看 PACF 在第几阶之后截断,ACF 更多用来判断 MA 结构和整体衰减形态。

收益率有自相关,是不是就能预测赚钱?#

先看幅度。自相关的 p 值可能显著,但系数往往小到解释力不足 1%,扣掉双边成本和滑点就没了。而且这类关系很不稳定,样本内成立、样本外消失是常态。显著和可交易是两件事。

有自相关时,为什么说风险会被低估?#

因为标准的方差公式假定样本独立。正自相关意味着涨了还倾向于涨、跌了还倾向于跌,实际的累积波动比独立假设算出来的大。用朴素方差估计出的置信区间会偏窄,回撤和尾部风险也会被系统性低估。

相关术语

出自