← 返回《数据科学的统计基础》
📑 查看全课大纲(第 15 / 41 节)

置信区间

约 61 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

置信区间

小象实战讲义 · 数据科学的统计基础

在上一章,我们学习了如何用一个具体的数值(点估计)来猜测未知的总体参数。然而,点估计无法告诉我们这个猜测的精确程度和可靠程度。本节课,我们将引入区间估计的概念,它通过构造一个随机区间来估计参数,并同时给出该区间包含真实参数的概率(置信水平)。学完本节,你将能够理解置信区间的核心思想,掌握评价区间估计好坏的标准,并学会使用枢轴量法这一构造置信区间的通用方法。

💡 核心导读

  • 从点到区间:理解点估计的局限性,以及为何需要引入能同时提供“精度”与“可靠性”信息的区间估计。
  • 置信区间定义:掌握区间估计、置信系数、置信度、置信区间(双侧与单侧)的严格数学定义。
  • 评价标准:学习评价区间估计好坏的两个核心准则:置信度越大越好,区间平均长度越短越好,并理解二者间的权衡关系(奈曼准则)。
  • 构造方法:掌握构造置信区间的核心方法——枢轴量法,理解其四步流程,并通过正态总体均值的例子进行实践。

从点估计到区间估计

在第二章的点估计中,对于未知参数 θ\theta,我们构造了一个估计量 θ^\hat{\theta}。当获得一组具体样本观测值后,代入估计量便得到一个具体的估计值。这个值要么等于真实参数 θ\theta,要么不等于,没有其他可能。因此,点估计无法提供关于估计精度(与真实值相差多远)和可靠性(有多大把握相信这个估计)的信息

为了弥补这一不足,统计学家提出了区间估计。它不再给出一个单一的点,而是给出一个由两个统计量构成的随机区间 [θ^L,θ^U][\hat{\theta}_L, \hat{\theta}_U],并宣称该区间以一定的概率包含真实的参数 θ\theta

一个生活中的例子是食盐包装上的净含量标识。如果只写“500克”,这是一个点估计。如果写“500±5克”,并说明“置信度95%”,这就是一个区间估计。它告诉我们,有95%的把握认为这包盐的真实重量在495克到505克之间。这个信息显然比单纯的“500克”要丰富得多。

区间估计的基本概念

区间估计的定义

X1,X2,,XnX_1, X_2, \ldots, X_n 是来自分布族 {F(x;θ),θΘ}{F(x; \theta), \theta \in \Theta} 的简单随机样本,其中 θ\theta 是未知参数。若存在两个统计量 θ^L=θ^L(X1,,Xn)\hat{\theta}_L = \hat{\theta}_L(X_1, \ldots, X_n)θ^U=θ^U(X1,,Xn)\hat{\theta}_U = \hat{\theta}_U(X_1, \ldots, X_n),且满足 θ^Lθ^U\hat{\theta}_L \leq \hat{\theta}_U,则称随机区间 [θ^L,θ^U][\hat{\theta}_L, \hat{\theta}_U] 为参数 θ\theta 的一个区间估计

由于区间的上下界 θ^L\hat{\theta}_Lθ^U\hat{\theta}_U 都是样本的函数(统计量),因此 [θ^L,θ^U][\hat{\theta}_L, \hat{\theta}_U] 是一个随机区间。对于不同的样本观测值,计算出的区间也不同。

置信系数与置信度

对于一个区间估计 [θ^L,θ^U][\hat{\theta}L, \hat{\theta}U],我们关心它包含真实参数 θ\theta 的概率。为此,定义其置信系数为: infθΘPθ(θ^Lθθ^U)\inf{\theta \in \Theta} P\theta(\hat{\theta}_L \leq \theta \leq \hat{\theta}_U) 即所有可能的 θ\theta 取值下,区间覆盖概率的下确界。

如果这个置信系数不依赖于未知参数 θ\theta,则称该置信系数为置信度。在实际应用中,我们通常直接指定或计算一个不依赖于 θ\theta 的置信水平。

评价区间估计的准则

对于一个参数,可能存在许多不同的区间估计。如何评价其优劣?常用的标准有两个:

  1. 置信度(或置信系数)越大越好:这意味着区间估计覆盖未知参数的概率越大,我们越放心。
  2. 随机区间的平均长度越短越好:平均长度 Eθ(θ^Uθ^L)E_\theta(\hat{\theta}_U - \hat{\theta}_L) 越短,表示估计的精度越高。

然而,在样本量固定的情况下,这两个标准通常是矛盾的。置信度越高,往往需要更长的区间来保证覆盖概率;反之,区间越短,置信度就会降低。 例如,估计全校男生平均身高 θ\theta,区间 [150,180][150, 180] 厘米的置信度显然低于区间 [1,300][1, 300] 厘米的置信度(后者几乎是100%)。

为了解决这个矛盾,统计学家奈曼(J. Neyman)提出了一个实用准则:在控制置信度达到一个可接受水平(如95%)的前提下,寻找平均长度尽可能短的区间估计。由此引出了“置信区间”的严格定义。

置信区间

[θ^L,θ^U][\hat{\theta}_L, \hat{\theta}U] 是参数 θ\theta 的一个区间估计。若对于给定的 α(0,1)\alpha \in (0, 1),有 Pθ(θ^Lθθ^U)1α,θΘP\theta(\hat{\theta}_L \leq \theta \leq \hat{\theta}_U) \geq 1-\alpha, \quad \forall \theta \in \Theta 则称 [θ^L,θ^U][\hat{\theta}_L, \hat{\theta}_U]θ\theta置信水平1α1-\alpha置信区间θ^L\hat{\theta}_Lθ^U\hat{\theta}_U 分别称为置信下限置信上限

在实际中,为了获得最短的区间,我们通常取等号,即 Pθ(θ^Lθθ^U)=1αP_\theta(\hat{\theta}_L \leq \theta \leq \hat{\theta}_U) = 1-\alpha,这时的置信区间称为同等置信区间

单侧置信限

有时我们只关心参数的上界或下界。例如,对于灯泡寿命,我们更关心其“至少能使用多久”。

  • 若统计量 θ^L\hat{\theta}L 满足 Pθ(θ^Lθ)1αP\theta(\hat{\theta}_L \leq \theta) \geq 1-\alpha,则称 θ^L\hat{\theta}_Lθ\theta 的置信水平为 1α1-\alpha单侧置信下限
  • 若统计量 θ^U\hat{\theta}U 满足 Pθ(θθ^U)1αP\theta(\theta \leq \hat{\theta}_U) \geq 1-\alpha,则称 θ^U\hat{\theta}_Uθ\theta 的置信水平为 1α1-\alpha单侧置信上限

单侧置信限与双侧置信区间有密切关系。若 θ^L\hat{\theta}_Lθ^U\hat{\theta}_U 分别是置信水平为 1α11-\alpha_11α21-\alpha_2 的单侧置信下限和上限,且 θ^Lθ^U\hat{\theta}_L \leq \hat{\theta}_U,则 [θ^L,θ^U][\hat{\theta}_L, \hat{\theta}_U] 构成 θ\theta 的一个置信水平为 1(α1+α2)1-(\alpha_1+\alpha_2) 的双侧置信区间。

构造置信区间的核心方法:枢轴量法

如何系统性地构造一个参数的置信区间?枢轴量法是最常用、最核心的方法。

枢轴量的定义与思想

枢轴量是一个包含待估参数 θ\theta 和样本的随机变量 S(X;θ)S(\mathbf{X}; \theta),并且其概率分布完全已知,且不依赖于任何未知参数

构造置信区间的核心思想是:

  1. 找到一个好的点估计 TT(如 Xˉ\bar{X} 估计 μ\mu)。
  2. 利用 TTθ\theta 构造一个枢轴量 S(T,θ)S(T, \theta),其分布已知。
  3. 根据该已知分布,找到一个区间 (c,d)(c, d),使得 P(cS(T,θ)d)=1αP(c \leq S(T, \theta) \leq d) = 1-\alpha
  4. 将上述不等式等价变形为关于 θ\theta 的不等式 P(θ^Lθθ^U)=1αP(\hat{\theta}_L \leq \theta \leq \hat{\theta}_U) = 1-\alpha,从而得到置信区间。

枢轴量法四步流程

  1. 找点估计:针对待估参数 g(θ)g(\theta),找一个好的点估计统计量 TT
  2. 构造枢轴量:构造一个包含 TTg(θ)g(\theta) 的函数 S(T,g(θ))S(T, g(\theta)),要求 SS 的分布完全已知且与 θ\theta 无关,并且 SS 关于 g(θ)g(\theta) 是单调函数。
  3. 定概率区间:对于给定的置信水平 1α1-\alpha,根据 SS 的分布,选取常数 c,dc, d,使得 P(cS(T,g(θ))d)=1αP(c \leq S(T, g(\theta)) \leq d) = 1-\alpha。通常选取 ccdd 为该分布的 α/2\alpha/21α/21-\alpha/2 分位数,以使得区间长度最短(对于对称分布)。
  4. 解出置信区间:将步骤3中的不等式等价变形为关于 g(θ)g(\theta) 的不等式 P(θ^Lg(θ)θ^U)=1αP(\hat{\theta}_L \leq g(\theta) \leq \hat{\theta}_U) = 1-\alpha,则 [θ^L,θ^U][\hat{\theta}_L, \hat{\theta}_U] 即为所求的置信区间。

应用示例:正态总体均值 μ\mu 的置信区间

情况一:方差 σ2\sigma^2 已知X1,,Xni.i.d.N(μ,σ2)X_1, \ldots, X_n \stackrel{\text{i.i.d.}}{\sim} N(\mu, \sigma^2)σ2\sigma^2 已知,求 μ\mu1α1-\alpha 置信区间。

  1. 点估计:Xˉ\bar{X}μ\mu 的良好估计。
  2. 构造枢轴量:已知 Xˉμσ/nN(0,1)\frac{\bar{X} - \mu}{\sigma / \sqrt{n}} \sim N(0, 1)。该量包含 μ\mu 和样本,且分布为标准正态,与任何未知参数无关,故为枢轴量。
  3. 定概率区间:对于标准正态分布 ZN(0,1)Z \sim N(0,1),有 P(z1α/2Zz1α/2)=1αP(-z_{1-\alpha/2} \leq Z \leq z_{1-\alpha/2}) = 1-\alpha,其中 z1α/2z_{1-\alpha/2} 是标准正态分布的 1α/21-\alpha/2 分位数。
  4. 解出置信区间: P(z1α/2Xˉμσ/nz1α/2)=1αP(Xˉz1α/2σnμXˉ+z1α/2σn)=1α\begin{aligned} & P\left(-z_{1-\alpha/2} \leq \frac{\bar{X} - \mu}{\sigma / \sqrt{n}} \leq z_{1-\alpha/2}\right) = 1-\alpha \ \Leftrightarrow & P\left(\bar{X} - z_{1-\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \leq \mu \leq \bar{X} + z_{1-\alpha/2} \cdot \frac{\sigma}{\sqrt{n}}\right) = 1-\alpha \end{aligned} 因此,μ\mu1α1-\alpha 置信区间为: [Xˉz1α/2σn,Xˉ+z1α/2σn]\left[ \bar{X} - z_{1-\alpha/2} \cdot \frac{\sigma}{\sqrt{n}},\quad \bar{X} + z_{1-\alpha/2} \cdot \frac{\sigma}{\sqrt{n}} \right]

情况二:方差 σ2\sigma^2 未知σ2\sigma^2 未知时,上述枢轴量不再适用,因为其中包含了未知的 σ\sigma。我们需要一个新的枢轴量。

  1. 点估计:仍用 Xˉ\bar{X} 估计 μ\mu,用样本方差 S2=1n1i=1n(XiXˉ)2S^2 = \frac{1}{n-1}\sum_{i=1}^n (X_i - \bar{X})^2 估计 σ2\sigma^2
  2. 构造枢轴量:根据抽样分布定理,有 XˉμS/nt(n1)\frac{\bar{X} - \mu}{S / \sqrt{n}} \sim t(n-1),即服从自由度为 n1n-1tt 分布。该量分布已知且与任何未知参数无关,是枢轴量。
  3. 定概率区间:对于 tt(n1)t \sim t(n-1),有 P(t1α/2(n1)tt1α/2(n1))=1αP(-t_{1-\alpha/2}(n-1) \leq t \leq t_{1-\alpha/2}(n-1)) = 1-\alpha
  4. 解出置信区间: P(t1α/2(n1)XˉμS/nt1α/2(n1))=1αP(Xˉt1α/2(n1)SnμXˉ+t1α/2(n1)Sn)=1α\begin{aligned} & P\left(-t_{1-\alpha/2}(n-1) \leq \frac{\bar{X} - \mu}{S / \sqrt{n}} \leq t_{1-\alpha/2}(n-1)\right) = 1-\alpha \ \Leftrightarrow & P\left(\bar{X} - t_{1-\alpha/2}(n-1) \cdot \frac{S}{\sqrt{n}} \leq \mu \leq \bar{X} + t_{1-\alpha/2}(n-1) \cdot \frac{S}{\sqrt{n}}\right) = 1-\alpha \end{aligned} 因此,μ\mu1α1-\alpha 置信区间为: [Xˉt1α/2(n1)Sn,Xˉ+t1α/2(n1)Sn]\left[ \bar{X} - t_{1-\alpha/2}(n-1) \cdot \frac{S}{\sqrt{n}},\quad \bar{X} + t_{1-\alpha/2}(n-1) \cdot \frac{S}{\sqrt{n}} \right]

下面的代码演示了如何使用 scipy.stats 计算这两种情况下的置信区间。

import numpy as np
import scipy.stats as stats

# 设置随机种子,确保结果可复现
np.random.seed(321)

# 模拟数据:假设真实均值 mu=100,标准差 sigma=15,样本量 n=30
mu_true, sigma_true = 100, 15
n = 30
sample = np.random.normal(loc=mu_true, scale=sigma_true, size=n)

# 计算样本统计量
x_bar = np.mean(sample)
s = np.std(sample, ddof=1)  # 样本标准差,ddof=1 表示除以 n-1
print(f"样本均值 x_bar = {x_bar:.4f}")
print(f"样本标准差 s = {s:.4f}")

# 设定置信水平
confidence_level = 0.95
alpha = 1 - confidence_level

# 情况一:假设 sigma 已知 (sigma_known = 15)
sigma_known = 15
z_critical = stats.norm.ppf(1 - alpha/2)
margin_of_error_z = z_critical * (sigma_known / np.sqrt(n))
ci_z_known = (x_bar - margin_of_error_z, x_bar + margin_of_error_z)
print(f"\n【情况一:方差已知】")
print(f"  标准正态分位数 z_(1-α/2) = {z_critical:.4f}")
print(f"  95% 置信区间: [{ci_z_known[0]:.4f}, {ci_z_known[1]:.4f}]")
print(f"  区间宽度: {ci_z_known[1] - ci_z_known[0]:.4f}")

# 情况二:sigma 未知,使用 t 分布
t_critical = stats.t.ppf(1 - alpha/2, df=n-1)
margin_of_error_t = t_critical * (s / np.sqrt(n))
ci_t_unknown = (x_bar - margin_of_error_t, x_bar + margin_of_error_t)
print(f"\n【情况二:方差未知】")
print(f"  t分布分位数 t_(1-α/2)({n-1}) = {t_critical:.4f}")
print(f"  95% 置信区间: [{ci_t_unknown[0]:.4f}, {ci_t_unknown[1]:.4f}]")
print(f"  区间宽度: {ci_t_unknown[1] - ci_t_unknown[0]:.4f}")

# 验证:由于 sigma_known > s,使用 z 分布的区间通常比使用 t 分布的区间更宽(因为使用了更大的标准差估计)
# 同时,t 分布的临界值 t_critical > z_critical,因为 t 分布尾部更厚,需要更宽的区间来达到相同的置信水平。

枢轴量的广泛存在性

一个自然的问题是:枢轴量总是存在吗?对于一大类分布,答案是肯定的。设总体分布函数为 F(x;θ)F(x; \theta),且 F(x;θ)F(x; \theta) 关于 xx 连续、关于 θ\theta 严格单调。可以证明,统计量 S=2i=1nlnF(Xi;θ)S = -2\sum_{i=1}^{n} \ln F(X_i; \theta) 服从自由度为 2n2n 的卡方分布 χ2(2n)\chi^2(2n),且其分布与 θ\theta 无关。因此,SS 可以作为一个枢轴量来构造 θ\theta 的置信区间。这说明了枢轴量法的普适性。

📝 动手练一练

  1. 单侧置信下限:从一批灯泡中随机抽取5个测试寿命(小时),得到数据:1501, 1051, 1120, 1250, 1280。假设灯泡寿命服从正态分布 N(μ,σ2)N(\mu, \sigma^2),其中 μ,σ2\mu, \sigma^2 均未知。试求该批灯泡平均寿命 μ\mu 的置信水平为95%的单侧置信下限。 提示:利用枢轴量 XˉμS/nt(n1)\frac{\bar{X}-\mu}{S/\sqrt{n}} \sim t(n-1),构造 P(μ?)=0.95P(\mu \geq ?) = 0.95

  2. 理解区间宽度:在方差 σ2\sigma^2 未知的正态总体中,比较样本量 n=10n=10n=100n=100 时,μ\mu 的95%置信区间的平均宽度。假设样本标准差 SS 大致相同,请定性说明样本量如何影响估计精度。 提示:区间宽度公式为 2×t1α/2(n1)×Sn2 \times t_{1-\alpha/2}(n-1) \times \frac{S}{\sqrt{n}}

参考答案:

  1. 计算得样本均值 xˉ=1240.4\bar{x} = 1240.4,样本标准差 s173.2s \approx 173.2t0.05(4)2.132t_{0.05}(4) \approx 2.132。单侧置信下限为 xˉt0.05(4)s51240.42.132×173.251240.4165.11075.3\bar{x} - t_{0.05}(4) \cdot \frac{s}{\sqrt{5}} \approx 1240.4 - 2.132 \times \frac{173.2}{\sqrt{5}} \approx 1240.4 - 165.1 \approx 1075.3。因此,有95%的把握认为该批灯泡的平均寿命至少为1075.3小时。
  2. 区间宽度与 1n\frac{1}{\sqrt{n}} 成正比。当样本量 nn 从10增加到100时,n\sqrt{n} 从约3.16增加到10,因此区间宽度大约会缩小为原来的 1100.316\frac{1}{\sqrt{10}} \approx 0.316 倍。样本量越大,估计精度越高,置信区间越窄。

本章小结

本节我们建立了区间估计的理论框架,它是连接点估计与假设检验的重要桥梁。

要点回顾:

  • 区间估计弥补了点估计无法提供精度和可靠性信息的缺陷,它用一个随机区间来估计参数。
  • 置信水平 1α1-\alpha 是随机区间包含真实参数的概率。置信区间是在给定置信水平下,对参数的一个区间估计。
  • 评价区间估计好坏需权衡置信度区间平均长度。奈曼准则主张在固定置信水平下,寻找最短的区间。
  • 枢轴量法是构造置信区间的系统性方法,其核心是找到一个分布已知且不依赖未知参数的样本与参数的函数。
  • 对于正态总体均值 μ\mu,方差已知时用 z 区间(基于标准正态分布),方差未知时用 t 区间(基于 t 分布)。

行动清单:

  1. 理解概念:尝试用自己的话向他人解释“95%置信区间”的含义,注意避免“参数有95%概率落在这个区间”这类错误表述(参数是固定的,区间是随机的)。
  2. 掌握推导:亲手推导一遍正态总体均值 μ\mu 在方差已知和未知情况下的置信区间公式,理解每一步变换的统计依据。
  3. 代码实践:运行讲义中的Python代码,并尝试修改参数(如 confidence_level, n, sigma_true),观察置信区间宽度和位置的变化规律,加深直观理解。

— 小象教研组

配套学习资源与课件
  • 第3章课件:区间估计(PDF · 3.3MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问