跳到主内容
@wquguru
术语统计基础

p 值 p-value

2026-09-05 更新

定义#

p 值是原假设成立时出现当前或更极端结果的概率。它回答的是「如果这个策略其实什么用都没有,我还有多大机会看到这么好的历史表现」——概率越小,纯属运气的解释就越勉强。

使用方式是先定好显著性水平 α\alpha(常取 0.05 或 0.01),再和 p 值比较:p 值小于 α\alpha 就拒绝原假设,大于等于 α\alpha 就无法拒绝原假设。注意顺序,α\alpha 必须在看到结果之前定好,否则就成了看着数据挑标准。

公式#

对单样本均值检验,先算检验统计量。样本量大或总体标准差已知时用 Z 统计量,样本量小且总体标准差未知时用 t 检验的 t 统计量:

Z=xˉμ0σ/n,t=xˉμ0s/nZ = \frac{\bar{x} - \mu_0}{\sigma/\sqrt{n}},\qquad t = \frac{\bar{x} - \mu_0}{s/\sqrt{n}}

其中 xˉ\bar{x} 是样本均值,μ0\mu_0 是原假设中的值,σ\sigmass 是标准差,nn 是样本量。p 值就是在原假设分布下、统计量落在比观测值更极端区域的概率;双尾检验要把两边都算上,单尾只算一边。

算一笔账#

某策略跑了 100 个交易日,日均收益 0.05%,日收益标准差 1%。原假设是「日均收益为 0」,做双尾检验。

标准误 =1%/100=0.1%= 1\% / \sqrt{100} = 0.1\%

统计量 =(0.05%0)/0.1%=0.5= (0.05\% - 0) / 0.1\% = 0.5

标准正态分布下,Z>0.5|Z| > 0.5 的概率约为 0.62,也就是 p 值 ≈ 0.62,远大于 0.05。结论是无法拒绝原假设:这 100 天的正收益完全可能只是波动,样本还不足以说明策略真的赚钱。

对照一下课程里的另一个例子:广告点击率样本比例 0.125、原假设 0.1、n=200n = 200,算出 Z1.18Z \approx 1.18,双尾 p 值约 0.238,同样无法拒绝原假设。

常见问题#

p 值小于 0.05 就代表策略有效吗?#

不代表。p 值只说明「假如策略无效,出现这个结果的可能性不大」,它既不是「策略有效的概率」,也不衡量效应有多大。样本量足够大时,一个小到没有实际意义的收益也能做出很小的 p 值,所以要同时看效应量、置信区间和是否有经济逻辑支撑。

p 值等于 0.06,是不是接近显著、可以放宽一点?#

不可以。α\alpha 一旦事先定为 0.05,0.06 的结论就是无法拒绝原假设。事后调门槛、换检验方式、多试几个时间窗口直到 p 值变小,就是 p 值挖掘,得到的显著性没有意义。

p 值很大,是不是就证明策略没用?#

检验从来不能证明原假设为真,只能说证据不够推翻它。样本太少、噪声太大,都会让人无法拒绝一个其实是错的原假设——这叫第二类错误。所以结论只能写成「无法拒绝原假设」,而不是断言策略无效。

相关术语

出自