← 返回《数据科学的统计基础》
📑 查看全课大纲(第 17 / 41 节)

大样本置信区间

约 27 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

大样本置信区间

小象实战讲义 · 数据科学的统计基础

在数据科学实践中,我们经常面对样本量较大的数据集。本节将介绍当枢轴量难以寻找或计算复杂时,如何利用大样本理论构造参数的近似置信区间。学完本节,你将掌握两种核心方法:基于极大似然估计(MLE)的渐近正态性,以及基于中心极限定理(CLT)的近似区间构造,并能判断何时可以放心地使用这些近似方法。

💡 核心导读

本节你将学到:

  1. 精确与近似区间:理解精确置信区间(枢轴量法)与近似置信区间的适用场景与区别。
  2. MLE近似区间:掌握利用极大似然估计的相合渐近正态性构造近似置信区间的原理与步骤。
  3. CLT近似区间:掌握基于中心极限定理构造总体均值(或比例)近似置信区间的方法。
  4. 大样本准则:了解“样本量多大算大”的经验法则,并能在实例中比较精确与近似区间的差异。
  5. 实战应用:通过Python代码模拟验证大样本理论,并计算实际问题中的近似置信区间。

精确置信区间与近似置信区间

在第三章的前面章节中,我们系统学习了枢轴量法。这是一种构造精确置信区间的方法。所谓“精确”,是指在给定的置信水平 1α1-\alpha 下,通过枢轴量法得到的置信区间,其置信系数恰好等于 1α1-\alpha

枢轴量法通常适用于小样本场合,尤其是当总体分布为正态分布时,我们可以找到精确的枢轴量(如 tt 统计量、χ2\chi^2 统计量)。当然,在大样本场合下,精确方法依然适用。

然而,当样本量 nn 比较大时,我们往往有更简便的替代方案来构造置信区间,即构造近似的置信区间。这主要基于以下两个原因:

  1. 在某些场合(如非正态总体),寻找一个分布已知且不依赖于未知参数的枢轴量非常困难。
  2. 当样本量足够大时,一些统计量会呈现出良好的渐近性质,使得我们可以利用这些性质构造出精度足够高的近似区间。

常见的构造近似置信区间的方法有两种:

  1. 基于极大似然估计(MLE)的近似置信区间
  2. 基于中心极限定理(CLT)的近似置信区间

基于极大似然估计(MLE)的近似置信区间

理论基础:MLE的相合渐近正态性

这种方法的理论依据是我们在第二章点估计中学过的极大似然估计的相合渐近正态性

定理(MLE的渐近正态性):设总体分布 f(x;θ)f(x; \theta) 的参数空间 Θ\Theta 是一个开区间,且密度函数满足一定的正则性条件(如对 θ\theta 的可微性、Fisher信息量的存在性等)。记 θ^n\hat{\theta}_n 为基于样本 X1,,XnX_1, \ldots, X_n 的极大似然估计。则有: nI(θ0)(θ^nθ0)dN(0,1),当 n.\sqrt{n I(\theta_0)} (\hat{\theta}_n - \theta_0) \stackrel{d}{\longrightarrow} N(0, 1), \quad \text{当 } n \to \infty. 其中,θ0\theta_0 是参数的真实值,I(θ)I(\theta)单个观测的Fisher信息量I(θ0)I(\theta_0) 是其在真实参数处的值。

这个定理告诉我们,在大样本下,经过适当标准化的MLE估计误差 θ^nθ0\hat{\theta}_n - \theta_0 依分布收敛于标准正态分布。这个标准化后的量: θ^nθ0[nI(θ0)]1=nI(θ0)(θ^nθ0)\frac{\hat{\theta}_n - \theta_0}{\sqrt{[n I(\theta_0)]^{-1}}} = \sqrt{n I(\theta_0)} (\hat{\theta}_n - \theta_0) 其渐近分布不依赖于未知参数 θ0\theta_0,这使其具备了成为“近似枢轴量”的潜质。

构造步骤:用估计量替代未知参数

然而,上式中的渐近方差 [nI(θ0)]1[n I(\theta_0)]^{-1} 仍然依赖于未知的真实参数 θ0\theta_0。为了得到一个完全可计算的统计量,我们采用一个常用技巧:用 θ\theta 的相合估计量(通常就是 θ^n\hat{\theta}_n 本身)去替代 θ0\theta_0

可以证明,在同样的正则性条件下,有: θ^nθ[nI(θ^n)]1=nI(θ^n)(θ^nθ)dN(0,1),当 n.\frac{\hat{\theta}_n - \theta}{\sqrt{[n I(\hat{\theta}_n)]^{-1}}} = \sqrt{n I(\hat{\theta}_n)} (\hat{\theta}_n - \theta) \stackrel{d}{\longrightarrow} N(0, 1), \quad \text{当 } n \to \infty. 这里 I(θ^n)I(\hat{\theta}_n) 是将Fisher信息量表达式中的 θ\theta 替换为 θ^n\hat{\theta}_n 后计算得到的值。

于是,对于给定的置信水平 1α1-\alpha,我们有: P(z1α/2nI(θ^n)(θ^nθ)z1α/2)1α.P\left( -z_{1-\alpha/2} \le \sqrt{n I(\hat{\theta}n)} (\hat{\theta}n - \theta) \le z{1-\alpha/2} \right) \approx 1-\alpha. 其中 z1α/2z{1-\alpha/2} 是标准正态分布的 1α/21-\alpha/2 分位数(即上侧 α/2\alpha/2 分位数,亦即上一节记号中的 uα/2u_{\alpha/2})。

对上式中的不等式进行等价变形,即可解得参数 θ\theta近似 1α1-\alpha 等尾置信区间[θ^nz1α/21nI(θ^n),θ^n+z1α/21nI(θ^n)].\left[ \hat{\theta}n - z{1-\alpha/2} \cdot \frac{1}{\sqrt{n I(\hat{\theta}_n)}}, \quad \hat{\theta}n + z{1-\alpha/2} \cdot \frac{1}{\sqrt{n I(\hat{\theta}_n)}} \right].

实例分析:指数分布参数 θ\theta 的区间估计

X1,,Xni.i.d.Exp(θ)X_1, \ldots, X_n \stackrel{\text{i.i.d.}}{\sim} \text{Exp}(\theta),其密度函数为 f(x;θ)=1θex/θ,x>0,θ>0f(x;\theta) = \frac{1}{\theta} e^{-x/\theta}, x>0, \theta>0。求 θ\theta 的置信水平为 1α1-\alpha 的近似置信区间。

步骤1:求MLE 指数分布的均值 E(X)=θE(X) = \theta。样本均值 Xˉ=1ni=1nXi\bar{X} = \frac{1}{n}\sum_{i=1}^n X_iθ\theta 的极大似然估计,即 θ^n=Xˉ\hat{\theta}_n = \bar{X}

步骤2:计算Fisher信息量 首先写出单个观测的对数似然函数:l(θ;x)=lnθx/θl(\theta; x) = -\ln\theta - x/\theta。 求二阶导数: 2lθ2=1θ22xθ3.\frac{\partial^2 l}{\partial \theta^2} = \frac{1}{\theta^2} - \frac{2x}{\theta^3}. 计算Fisher信息量(单个观测): I(θ)=E[2lθ2]=E[1θ22Xθ3]=(1θ22E(X)θ3)=(1θ22θθ3)=1θ2.I(\theta) = -E\left[ \frac{\partial^2 l}{\partial \theta^2} \right] = -E\left[ \frac{1}{\theta^2} - \frac{2X}{\theta^3} \right] = -\left( \frac{1}{\theta^2} - \frac{2E(X)}{\theta^3} \right) = -\left( \frac{1}{\theta^2} - \frac{2\theta}{\theta^3} \right) = \frac{1}{\theta^2}. 因此,nn 个样本的Fisher信息量为 nI(θ)=n/θ2n I(\theta) = n / \theta^2

步骤3:构造近似区间 根据公式,θ\theta 的近似 1α1-\alpha 置信区间为: [Xˉz1α/2Xˉn,Xˉ+z1α/2Xˉn].\left[ \bar{X} - z_{1-\alpha/2} \cdot \frac{\bar{X}}{\sqrt{n}}, \quad \bar{X} + z_{1-\alpha/2} \cdot \frac{\bar{X}}{\sqrt{n}} \right]. 这里用 θ^n=Xˉ\hat{\theta}_n = \bar{X} 替代了 I(θ^n)1/2=θ^nI(\hat{\theta}_n)^{-1/2} = \hat{\theta}_n

步骤4:与精确区间比较 回忆指数分布参数 θ\theta 的精确置信区间(枢轴量法):利用 2nXˉ/θχ2(2n)2n\bar{X}/\theta \sim \chi^2(2n),可得 θ\theta 的精确 1α1-\alpha 置信区间为: [2nXˉχα/22(2n),2nXˉχ1α/22(2n)].\left[ \frac{2n\bar{X}}{\chi^2_{\alpha/2}(2n)}, \quad \frac{2n\bar{X}}{\chi^2_{1-\alpha/2}(2n)} \right].

下面我们通过一个具体例子和Python模拟来观察两种方法的差异。

import numpy as np
from scipy import stats

# 设定参数和样本量
np.random.seed(321)  # 固定随机种子,确保结果可复现
theta_true = 750     # 真实平均寿命(小时)
n = 60               # 样本量
alpha = 0.10         # 显著性水平,对应90%置信度
confidence_level = 1 - alpha

# 模拟生成指数分布寿命数据
data = stats.expon(scale=theta_true).rvs(size=n)
x_bar = data.mean()  # 样本均值,即theta的MLE
print(f"样本均值 (MLE估计) θ_hat = {x_bar:.2f}")

# --- 方法1:基于MLE的近似置信区间 (大样本方法) ---
z_critical = stats.norm.ppf(1 - alpha/2)
margin_error_approx = z_critical * x_bar / np.sqrt(n)
ci_approx_lower = x_bar - margin_error_approx
ci_approx_upper = x_bar + margin_error_approx
print(f"\n【基于MLE的近似置信区间 (90%)】")
print(f"  下限: {ci_approx_lower:.2f}")
print(f"  上限: {ci_approx_upper:.2f}")
print(f"  区间宽度: {ci_approx_upper - ci_approx_lower:.2f}")

# --- 方法2:精确置信区间 (枢轴量法) ---
chi2_lower = stats.chi2.ppf(alpha/2, df=2*n)
chi2_upper = stats.chi2.ppf(1 - alpha/2, df=2*n)
ci_exact_lower = 2 * n * x_bar / chi2_upper
ci_exact_upper = 2 * n * x_bar / chi2_lower
print(f"\n【精确置信区间 (90%)】")
print(f"  下限: {ci_exact_lower:.2f}")
print(f"  上限: {ci_exact_upper:.2f}")
print(f"  区间宽度: {ci_exact_upper - ci_exact_lower:.2f}")

# 比较区间中心
center_approx = (ci_approx_lower + ci_approx_upper) / 2
center_exact = (ci_exact_lower + ci_exact_upper) / 2
print(f"\n区间中心比较:")
print(f"  近似区间中心: {center_approx:.2f}")
print(f"  精确区间中心: {center_exact:.2f}")
print(f"  真实参数值 θ: {theta_true:.2f}")

运行上述代码,我们可以看到当 n=60n=60 时,两种方法得到的置信区间非常接近,但并非完全相同。当样本量 nn 较小时(例如 n<10n<10),两种方法的差异会变得明显。在统计学中,一个常见的经验法则是:当 n30n \ge 30 时,可以认为样本量足够大,可以使用基于MLE或CLT的大样本近似方法。

基于中心极限定理(CLT)的近似置信区间

理论基础:林德伯格-莱维中心极限定理

中心极限定理是概率论中连接概率与统计的桥梁。林德伯格-莱维中心极限定理指出: 设 X1,,XnX_1, \ldots, X_n 是独立同分布的随机变量序列,且 E(Xi)=μE(X_i) = \muVar(Xi)=σ2<\text{Var}(X_i) = \sigma^2 < \infty。则对于标准化后的样本和,有: Xˉμσ/ndN(0,1),当 n.\frac{\bar{X} - \mu}{\sigma / \sqrt{n}} \stackrel{d}{\longrightarrow} N(0, 1), \quad \text{当 } n \to \infty. 其中 Xˉ=1ni=1nXi\bar{X} = \frac{1}{n}\sum_{i=1}^n X_i 为样本均值。

这意味着,无论总体分布是什么(只要方差有限),样本均值 Xˉ\bar{X} 的标准化形式在大样本下都近似服从标准正态分布。这为我们构造总体均值 μ\mu 的置信区间提供了强大的工具。

构造总体均值 μ\mu 的近似置信区间

由CLT,当 nn 充分大时,有: P(z1α/2Xˉμσ/nz1α/2)1α.P\left( -z_{1-\alpha/2} \le \frac{\bar{X} - \mu}{\sigma / \sqrt{n}} \le z_{1-\alpha/2} \right) \approx 1-\alpha. 由此可解得 μ\mu 的近似 1α1-\alpha 置信区间: [Xˉz1α/2σn,Xˉ+z1α/2σn].\left[ \bar{X} - z_{1-\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}, \quad \bar{X} + z_{1-\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \right].

这里需要分两种情况讨论:

  1. σ\sigma 已知:直接代入上述公式。
  2. σ\sigma 未知:用样本标准差 SS(或其它 σ\sigma 的相合估计,如修正的样本标准差)替代 σ\sigma。因为 SPσS \stackrel{P}{\longrightarrow} \sigma,由斯拉茨基定理,替换后上述渐近性质依然成立。此时区间为: [Xˉz1α/2Sn,Xˉ+z1α/2Sn].\left[ \bar{X} - z_{1-\alpha/2} \cdot \frac{S}{\sqrt{n}}, \quad \bar{X} + z_{1-\alpha/2} \cdot \frac{S}{\sqrt{n}} \right].

实例分析:伯努利分布参数 pp 的区间估计

X1,,Xni.i.d.Bernoulli(p)X_1, \ldots, X_n \stackrel{\text{i.i.d.}}{\sim} \text{Bernoulli}(p),即 P(Xi=1)=p,P(Xi=0)=1pP(X_i=1)=p, P(X_i=0)=1-p。求成功概率 pp 的置信水平为 1α1-\alpha 的近似置信区间。

对于伯努利分布,E(Xi)=pE(X_i)=pVar(Xi)=p(1p)\text{Var}(X_i)=p(1-p)。其样本和 XiBinomial(n,p)\sum X_i \sim \text{Binomial}(n, p)。虽然我们知道其精确分布,但该分布依赖于 pp,难以直接构造出精确的、不依赖于 pp 的枢轴量。因此,我们转向大样本方法。

步骤1:应用CLT 由CLT,当 nn 充分大时: Xˉpp(1p)/ndN(0,1).\frac{\bar{X} - p}{\sqrt{p(1-p)/n}} \stackrel{d}{\longrightarrow} N(0, 1). 这里 Xˉ=1nXi\bar{X} = \frac{1}{n}\sum X_i 是样本比例,也是 pp 的MLE。

步骤2:处理未知标准差 标准差 p(1p)\sqrt{p(1-p)} 依赖于未知参数 pp。我们同样用其相合估计 Xˉ(1Xˉ)\sqrt{\bar{X}(1-\bar{X})} 替代。于是有: XˉpXˉ(1Xˉ)/ndN(0,1).\frac{\bar{X} - p}{\sqrt{\bar{X}(1-\bar{X})/n}} \stackrel{d}{\longrightarrow} N(0, 1).

步骤3:构造近似区间(简化版) 由此可得 pp 的一个常用近似置信区间(Wald区间): [Xˉz1α/2Xˉ(1Xˉ)n,Xˉ+z1α/2Xˉ(1Xˉ)n].\left[ \bar{X} - z_{1-\alpha/2} \sqrt{\frac{\bar{X}(1-\bar{X})}{n}}, \quad \bar{X} + z_{1-\alpha/2} \sqrt{\frac{\bar{X}(1-\bar{X})}{n}} \right].

步骤4:更精确的区间(得分区间) 上述Wald区间在 pp 接近0或1,或样本量较小时表现不佳。一个更稳健的构造方法是直接求解关于 pp 的不等式: z1α/2Xˉpp(1p)/nz1α/2.-z_{1-\alpha/2} \le \frac{\bar{X} - p}{\sqrt{p(1-p)/n}} \le z_{1-\alpha/2}. 将不等式平方并整理,得到关于 pp 的二次不等式。解此不等式得到的两个根 pLp_LpUp_U 即为置信区间的上下限,这称为得分置信区间(或Wilson区间): pL,U=Xˉ+z1α/222n±z1α/2Xˉ(1Xˉ)n+z1α/224n21+z1α/22n.p_{L,U} = \frac{\bar{X} + \frac{z_{1-\alpha/2}^2}{2n} \pm z_{1-\alpha/2} \sqrt{\frac{\bar{X}(1-\bar{X})}{n} + \frac{z_{1-\alpha/2}^2}{4n^2}}}{1 + \frac{z_{1-\alpha/2}^2}{n}}.nn 很大时,z2/(2n)z^2/(2n)z2/(4n2)z^2/(4n^2) 项很小,得分区间会退化为Wald区间。

# 实例:电视收视率调查
np.random.seed(321)
n_survey = 400
x_sum = 100  # 收看人数
p_hat = x_sum / n_survey
alpha = 0.05  # 对应95%置信度
z = stats.norm.ppf(1 - alpha/2)

print(f"调查样本量: n = {n_survey}")
print(f"收看人数: ∑X = {x_sum}")
print(f"样本比例 (点估计): p_hat = {p_hat:.4f}")

# 方法1: Wald区间 (简化近似)
margin_wald = z * np.sqrt(p_hat * (1 - p_hat) / n_survey)
ci_wald_lower = p_hat - margin_wald
ci_wald_upper = p_hat + margin_wald
print(f"\n【Wald近似置信区间 (95%)】")
print(f"  下限: {ci_wald_lower:.4f}")
print(f"  上限: {ci_wald_upper:.4f}")

# 方法2: 得分区间 (更精确的近似)
z2_n = z**2 / n_survey
center = (p_hat + z**2/(2*n_survey)) / (1 + z2_n)
adjustment = z * np.sqrt(p_hat*(1-p_hat)/n_survey + z**2/(4*n_survey**2)) / (1 + z2_n)
ci_score_lower = center - adjustment
ci_score_upper = center + adjustment
print(f"\n【得分置信区间 (95%)】")
print(f"  下限: {ci_score_lower:.4f}")
print(f"  上限: {ci_score_upper:.4f}")

# 验证:模拟抽样,观察覆盖率
n_sim = 10000
p_true = 0.25
cover_wald = 0
cover_score = 0

for _ in range(n_sim):
    # 从真实伯努利总体中抽样
    sample = np.random.binomial(1, p_true, size=n_survey)
    p_sim = sample.mean()
    # 计算Wald区间
    se_wald = np.sqrt(p_sim*(1-p_sim)/n_survey)
    ci_l_w = p_sim - z * se_wald
    ci_u_w = p_sim + z * se_wald
    if ci_l_w <= p_true <= ci_u_w:
        cover_wald += 1
    # 计算得分区间
    center_s = (p_sim + z**2/(2*n_survey)) / (1 + z2_n)
    adj_s = z * np.sqrt(p_sim*(1-p_sim)/n_survey + z**2/(4*n_survey**2)) / (1 + z2_n)
    ci_l_s = center_s - adj_s
    ci_u_s = center_s + adj_s
    if ci_l_s <= p_true <= ci_u_s:
        cover_score += 1

print(f"\n【模拟验证 (n={n_survey}, p={p_true})】")
print(f"  Wald区间经验覆盖率: {cover_wald/n_sim:.4f} (目标: {1-alpha:.3f})")
print(f"  得分区间经验覆盖率: {cover_score/n_sim:.4f} (目标: {1-alpha:.3f})")

从模拟结果可以看出,在大样本下(n=400n=400),两种近似区间都能提供接近名义水平(95%)的覆盖率,且得分区间通常更稳健、更接近目标覆盖率。

📝 动手练一练

  1. 产品质量抽检:某工厂生产一种精密零件,其长度 XX(单位:mm)服从正态分布 N(μ,0.52)N(\mu, 0.5^2),其中方差已知。现随机抽取36个零件,测得平均长度为 xˉ=20.1\bar{x} = 20.1 mm。请分别使用精确方法(枢轴量法)和大样本近似方法(CLT),构造该零件平均长度 μ\mu 的95%置信区间,并比较结果。
  2. 用户满意度调查:一款App进行用户满意度调研,随机访问了900名用户,其中有630名表示“满意”。请使用基于中心极限定理的两种近似方法(Wald区间和得分区间),构造用户总体满意率 pp 的99%置信区间。

参考答案:

  1. 精确区间:由于总体正态且方差已知,精确枢轴量为 Z=Xˉμσ/nN(0,1)Z = \frac{\bar{X}-\mu}{\sigma/\sqrt{n}} \sim N(0,1)。95%置信区间为 xˉ±z0.975σn=20.1±1.96×0.56[19.94,20.26]\bar{x} \pm z_{0.975} \cdot \frac{\sigma}{\sqrt{n}} = 20.1 \pm 1.96 \times \frac{0.5}{6} \approx [19.94, 20.26]大样本近似区间:公式与精确区间完全相同。这是因为总体本身为正态且方差已知,枢轴量 ZZ 精确服从 N(0,1)N(0,1)(无需借助CLT),大样本近似公式在此恰好退化为精确结果,两者无差异。
  2. Wald区间p^=630/900=0.7\hat{p}=630/900=0.7z0.9952.576z_{0.995} \approx 2.576。区间为 0.7±2.576×0.7×0.3/900[0.661,0.739]0.7 \pm 2.576 \times \sqrt{0.7 \times 0.3 / 900} \approx [0.661, 0.739]得分区间:代入公式计算得 pL0.659p_L \approx 0.659pU0.738p_U \approx 0.738。两者非常接近,因为样本量很大。

本章小结

本节深入探讨了当样本量较大时,构造参数近似置信区间的两种核心方法。

要点回顾

  • 动机:当寻找精确枢轴量困难或计算复杂时,大样本理论提供了有效的近似解决方案。
  • MLE方法:基于极大似然估计的相合渐近正态性。关键在于用MLE估计量 θ^n\hat{\theta}_n 替代Fisher信息量 I(θ)I(\theta) 中的未知参数 θ\theta,从而构造出近似枢轴量 nI(θ^n)(θ^nθ)\sqrt{n I(\hat{\theta}_n)} (\hat{\theta}_n - \theta),其渐近分布为标准正态。
  • CLT方法:基于林德伯格-莱维中心极限定理。无论总体分布如何,样本均值的标准化形式在大样本下近似服从标准正态分布,可用于构造总体均值 μ\mu(或比例 pp)的近似区间。当总体方差未知时,用样本方差替代。
  • 适用条件:两种方法都要求样本量 nn 足够大。一个广泛使用的经验法则是 n30n \ge 30。对于比例估计,还需注意 p^\hat{p} 不能太接近0或1。
  • 比较与选择:精确区间(若存在)在小样本时更可靠。大样本近似区间在大样本下与精确区间差异很小,且计算往往更简便。对于比例 pp,得分区间通常比Wald区间更稳健。

行动清单

  1. 判断场景:面对一个区间估计问题,首先判断是否有现成的精确枢轴量可用(如正态总体下的 ttχ2\chi^2)。如果没有,且样本量较大(n30n \ge 30),则考虑使用大样本近似方法。
  2. 选择方法:若待估参数是某个分布的参数(如指数分布的 θ\theta),可尝试基于MLE的近似区间。若待估参数是总体均值或比例,则优先使用基于CLT的近似区间。
  3. 代码验证:对于重要的分析,可以像本节示例一样,用Python进行简单的模拟,验证近似区间的覆盖率是否接近名义置信水平,特别是在样本量边界或参数极端值时。

— 小象教研组

配套学习资源与课件
  • 第3章课件:区间估计(PDF · 3.3MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问