定义#
因子模型把资产收益拆成若干共同因子的贡献加特异部分。市值、市盈率、市净率、动量这些可观测的特征各自对应一个因子,资产收益被写成这些因子收益的线性组合,剩下解释不了的算作这只股票自己的特异风险。
估计因子收益有两条常见路线。一是组合构建法:按特征分组做多空组合,用组合收益直接代表因子收益,Fama-French 的 SMB(小市值减大市值)、HML(高市净率减低市净率)就是这么造出来的。二是因子标准化法:把当期特征做截面标准化,再用横截面回归估出因子收益。前者需要完整历史数据、抗噪更强,后者只要当日数据、计算便宜。
公式#
其中 是资产 的收益率, 是它对第 个因子的暴露度, 是因子收益率, 是超额收益, 是特异性风险。截面标准化的做法是:
是原始因子值, 和 是同一时点全市场的截面均值和标准差。
算一笔账#
某只股票经回归得到三个暴露:市场因子 1.0,SMB 因子 0.6,HML 因子 −0.3。这个月三个因子的收益分别是 2.0%、1.0%、−0.5%。
模型解释的收益 。
这只股票实际涨了 3.20%,差额 0.45% 是因子解释不了的部分,落在 里。单月的 0.45% 说明不了任何问题——要判断它是真 alpha 还是噪声,得看这个差额在长时间里是否稳定为正。
常见问题#
因子越多越好吗?#
不是。因子之间往往高度相关,硬塞进回归会造成多重共线性,系数变得不稳定甚至符号翻转。常见处理是先做主成分分析或正交化,或者用逐步回归、加正则化项筛选。风险模型可以容纳较多因子,但收益预测模型加因子必须付出过拟合的代价。
怎么知道一个因子失效了?#
三个预警信号:信息系数持续下降;因子收益的波动率异常放大;分组收益的单调性被破坏——本该收益最高的那一组不再最高。这些都需要滚动跟踪,只看全样本平均值会把已经失效的因子掩盖过去。
用财务数据做因子要注意什么?#
最容易踩的坑是时点问题。财报有发布延迟,回测时若用当期财报去解释当期收益,等于用了当时还拿不到的信息,结果必然虚高。正确做法是严格按实际可得时间对齐数据,并对极端值做缩尾处理后再标准化。