基础概念#
从点估计到区间估计#
设独立同分布随机变量服从均值为、方差为的分布:
- 样本均值 (Sample Mean):
- 样本方差 (Sample Variance):
- 标准误 (Standard Error, SE):
点估计通过给出估计范围,但无法量化置信程度。区间估计通过构建置信区间 (Confidence Interval) 解决这一缺陷。
核心思想#
置信区间满足:
其中:
-
为区间端点
-
为置信水平 (Confidence Level)
-
为显著性水平 (Significance Level)
正态分布下的置信区间#
标准正态分位数#
设,定义上尾分位数 (Upper-tail Quantile) 满足:
特别地:
-
(中位数)
-
(对称区间概率)
置信区间构建#
当满足以下条件之一时:
-
总体服从正态分布(任意样本量)
-
大样本情况(中心极限定理适用)
95%置信区间公式:
具体推导:
常用分位数值#
| 置信水平 | ||
|---|---|---|
| 90% | 0.10 | 1.645 |
| 95% | 0.05 | 1.960 |
| 99% | 0.01 | 2.576 |
实际应用案例#
股票收益率估计#
某股票30日收益率数据:
-
样本均值
-
样本标准差
计算95%置信区间:
解读:有95%的置信度认为该股票的真实日均收益率在-0.094%到1.694%之间。
学习建议#
-
重点掌握:
-
置信区间的概率解释(不是参数落在区间的概率)
-
标准误与标准差的区别
-
-
典型错误:
-
将"95%置信度"理解为"参数有95%概率在区间内"
-
忽略样本量对区间宽度的影响
-
-
实践练习:
code
# 使用正态近似计算总体均值的置信区间
import math
import random
import statistics
random.seed(42)
data = [random.gauss(mu=5, sigma=2) for _ in range(100)]
confidence = 0.95
sample_mean = statistics.fmean(data)
standard_error = statistics.stdev(data) / math.sqrt(len(data))
critical_value = statistics.NormalDist().inv_cdf(
1 - (1 - confidence) / 2
)
margin_of_error = critical_value * standard_error
ci = (
sample_mean - margin_of_error,
sample_mean + margin_of_error,
)
print(f"样本均值:{sample_mean:.3f}")
print(f"{confidence:.0%} 置信区间:({ci[0]:.3f}, {ci[1]:.3f})")