跳到主内容
@wquguru
术语统计基础

最大似然估计 Maximum Likelihood Estimation

2026-09-05 更新

定义#

最大似然估计寻找让观测数据最可能出现的那组参数。思路是反过来问问题:手上的这串数据已经发生了,那么在什么参数下它出现的概率最大?那个参数就是估计值。

要分清概率函数和似然函数:概率函数是给定参数、问数据出现的可能性;似然函数是给定数据、问哪个参数更说得通。两者是同一个式子的两种读法。实际计算时通常最大化对数似然,因为对数把连乘变成连加,既好算又数值稳定,而且不改变极值的位置。在金融里,MLE 被用来给收益分布、风险模型和定价模型标定参数。

公式#

对正态分布 N(μ,σ2)N(\mu, \sigma^2),最大似然估计量有闭式解:

μ^=1Tt=1TXt,σ^2=1Tt=1T(Xtμ^)2\hat{\mu} = \frac{1}{T}\sum_{t=1}^{T} X_t,\qquad \hat{\sigma}^2 = \frac{1}{T}\sum_{t=1}^{T}(X_t - \hat{\mu})^2

其中 TT 是样本量,XtX_t 是第 tt 个观测。注意方差的分母是 TT 而不是 T1T-1——MLE 给出的方差估计是有偏的。

对指数分布 f(x;λ)=λeλxf(x;\lambda) = \lambda e^{-\lambda x},估计量是

λ^=1Xˉ\hat{\lambda} = \frac{1}{\bar{X}}

因为指数分布的期望正是 1/λ1/\lambda

算一笔账#

假设 8 个观测:2、4、4、4、5、5、7、9,我们相信它们来自某个正态分布。

均值的 MLE 是样本均值:μ^=40/8=5\hat{\mu} = 40/8 = 5

偏差是 −3、−1、−1、−1、0、0、+2、+4,平方后为 9、1、1、1、0、0、4、16,合计 32。除以 T=8T = 8σ^2=4\hat{\sigma}^2 = 4,标准差估计 σ^=2\hat{\sigma} = 2

再看指数分布的例子:若某类事件的平均间隔是 0.2 天,则 λ^=1/0.2=5\hat{\lambda} = 1/0.2 = 5,即平均每天发生 5 次。

常见问题#

MLE 和直接算平均值有什么区别?#

在正态分布这个特例下没有区别——均值的 MLE 恰好就是样本均值。区别在于 MLE 是一套通用方法:换成指数分布、混合分布或者更复杂的模型,它照样能给出估计,而「算平均值」只对特定情形有效。

样本量小的时候可靠吗?#

不太可靠。MLE 的好性质是渐近的:样本量足够大时它才一致收敛到真实参数、才近似服从正态、才达到理论上的最优效率。样本少时估计的偏差和波动都可能很大,方差估计除以 TT 而非 T1T-1 造成的低估也更明显。

拟合完怎么知道分布选对了?#

要做拟合优度检验,不能只看拟合曲线画出来顺不顺眼。比如用 Jarque-Bera 检验判断正态假设是否成立,p 值很小就说明数据不像正态。金融日收益几乎总会拒绝正态,表现为负偏和厚尾,这时该换分布而不是硬套。

相关术语

出自