定义#
p 值是原假设成立时出现当前或更极端结果的概率。它回答的是「如果这个策略其实什么用都没有,我还有多大机会看到这么好的历史表现」——概率越小,纯属运气的解释就越勉强。
使用方式是先定好显著性水平 (常取 0.05 或 0.01),再和 p 值比较:p 值小于 就拒绝原假设,大于等于 就无法拒绝原假设。注意顺序, 必须在看到结果之前定好,否则就成了看着数据挑标准。
公式#
对单样本均值检验,先算检验统计量。样本量大或总体标准差已知时用 Z 统计量,样本量小且总体标准差未知时用 t 检验的 t 统计量:
其中 是样本均值, 是原假设中的值, 或 是标准差, 是样本量。p 值就是在原假设分布下、统计量落在比观测值更极端区域的概率;双尾检验要把两边都算上,单尾只算一边。
算一笔账#
某策略跑了 100 个交易日,日均收益 0.05%,日收益标准差 1%。原假设是「日均收益为 0」,做双尾检验。
标准误 。
统计量 。
标准正态分布下, 的概率约为 0.62,也就是 p 值 ≈ 0.62,远大于 0.05。结论是无法拒绝原假设:这 100 天的正收益完全可能只是波动,样本还不足以说明策略真的赚钱。
对照一下课程里的另一个例子:广告点击率样本比例 0.125、原假设 0.1、,算出 ,双尾 p 值约 0.238,同样无法拒绝原假设。
常见问题#
p 值小于 0.05 就代表策略有效吗?#
不代表。p 值只说明「假如策略无效,出现这个结果的可能性不大」,它既不是「策略有效的概率」,也不衡量效应有多大。样本量足够大时,一个小到没有实际意义的收益也能做出很小的 p 值,所以要同时看效应量、置信区间和是否有经济逻辑支撑。
p 值等于 0.06,是不是接近显著、可以放宽一点?#
不可以。 一旦事先定为 0.05,0.06 的结论就是无法拒绝原假设。事后调门槛、换检验方式、多试几个时间窗口直到 p 值变小,就是 p 值挖掘,得到的显著性没有意义。
p 值很大,是不是就证明策略没用?#
检验从来不能证明原假设为真,只能说证据不够推翻它。样本太少、噪声太大,都会让人无法拒绝一个其实是错的原假设——这叫第二类错误。所以结论只能写成「无法拒绝原假设」,而不是断言策略无效。