定义#
最大似然估计寻找让观测数据最可能出现的那组参数。思路是反过来问问题:手上的这串数据已经发生了,那么在什么参数下它出现的概率最大?那个参数就是估计值。
要分清概率函数和似然函数:概率函数是给定参数、问数据出现的可能性;似然函数是给定数据、问哪个参数更说得通。两者是同一个式子的两种读法。实际计算时通常最大化对数似然,因为对数把连乘变成连加,既好算又数值稳定,而且不改变极值的位置。在金融里,MLE 被用来给收益分布、风险模型和定价模型标定参数。
公式#
对正态分布 ,最大似然估计量有闭式解:
其中 是样本量, 是第 个观测。注意方差的分母是 而不是 ——MLE 给出的方差估计是有偏的。
对指数分布 ,估计量是
因为指数分布的期望正是 。
算一笔账#
假设 8 个观测:2、4、4、4、5、5、7、9,我们相信它们来自某个正态分布。
均值的 MLE 是样本均值:。
偏差是 −3、−1、−1、−1、0、0、+2、+4,平方后为 9、1、1、1、0、0、4、16,合计 32。除以 得 ,标准差估计 。
再看指数分布的例子:若某类事件的平均间隔是 0.2 天,则 ,即平均每天发生 5 次。
常见问题#
MLE 和直接算平均值有什么区别?#
在正态分布这个特例下没有区别——均值的 MLE 恰好就是样本均值。区别在于 MLE 是一套通用方法:换成指数分布、混合分布或者更复杂的模型,它照样能给出估计,而「算平均值」只对特定情形有效。
样本量小的时候可靠吗?#
不太可靠。MLE 的好性质是渐近的:样本量足够大时它才一致收敛到真实参数、才近似服从正态、才达到理论上的最优效率。样本少时估计的偏差和波动都可能很大,方差估计除以 而非 造成的低估也更明显。
拟合完怎么知道分布选对了?#
要做拟合优度检验,不能只看拟合曲线画出来顺不顺眼。比如用 Jarque-Bera 检验判断正态假设是否成立,p 值很小就说明数据不像正态。金融日收益几乎总会拒绝正态,表现为负偏和厚尾,这时该换分布而不是硬套。