← 返回《数据科学的统计基础》
📑 查看全课大纲(第 5 / 41 节)

充分统计量与完备统计量

约 36 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

充分统计量与完备统计量

小象实战讲义 · 数据科学的统计基础

在数据科学实践中,我们通过抽样从总体中获取样本,并基于样本信息对总体进行推断。然而,原始样本数据往往杂乱无章,我们需要对其进行“信息压缩”,提炼出简洁有效的统计量。本节将探讨一个核心问题:我们构造的统计量是否“充分”地保留了样本中关于总体参数的全部信息?我们将学习充分统计量的定义、直观理解,以及一个极其重要的实用工具——因子分解定理。最后,我们将简要介绍完备统计量的概念,为后续学习一致最小方差无偏估计(UMVUE)打下基础。

💡 核心导读

本节你将掌握:

  1. 充分统计量的直观思想:理解统计推断中“信息压缩”的过程,以及如何衡量一个统计量是否“充分”提取了参数信息。
  2. 充分统计量的严格定义:掌握基于条件分布的定义方式,理解其核心是“给定统计量后,样本的条件分布与参数无关”。
  3. 因子分解定理(Fisher-Neyman准则):学习判断充分统计量的核心定理,它将复杂的条件分布判断转化为对样本联合分布的因子分解。
  4. 充分统计量的应用与不唯一性:通过泊松分布的例子掌握因子分解定理的应用,并理解充分统计量不唯一,但好的充分统计量应能有效压缩信息。
  5. 完备统计量的概念:初步了解分布族的完备性定义,以及完备统计量在后续估计理论中的重要作用。

统计推断中的信息压缩

统计学的基本流程可以概括为:从具有未知参数 θ\theta 的总体中,抽取一个简单随机样本 X1,X2,,XnX_1, X_2, \dots, X_n;样本蕴含了总体的信息,但信息是零散、琐碎的;因此,我们需要对信息进行压缩,将样本构造为一个个统计量,例如样本均值 Xˉ\bar{X}、样本方差 S2S^2 等;最终,我们基于这些统计量对总体参数 θ\theta 进行统计推断。

这个过程引出一个核心问题:我们构造的统计量,其信息压缩得是否“充分”?或者说,这个统计量是否提取了样本中关于参数 θ\theta 的全部信息?这就是充分统计量所要回答的问题。

我们可以将样本 X=(X1,,Xn)X = (X_1, \dots, X_n) 中包含的关于 θ\theta 的信息,在概念上分解为两部分:

  1. 统计量 T=T(X)T = T(X) 中所含有的关于 θ\theta 的信息。
  2. 在已知统计量 T=tT = t 的条件下,样本 XX额外含有的关于 θ\theta 的信息。

最理想的情况是第二部分信息为零。这意味着,一旦知道了统计量 TT 的值,样本 XX 中就不再包含任何关于 θ\theta信息。此时,统计量 TT 就“充分”地提取了所有信息。如何定量描述“没有新信息”?这需要借助条件概率条件分布的概念。

充分统计量的定义与直观理解

定义

设总体 ξ\xi 的分布函数为 F(x;θ)F(x; \theta),其中 θ\theta 是未知参数。设 X1,X2,,XnX_1, X_2, \dots, X_n 是来自该总体的一个简单随机样本(子样),T=T(X1,,Xn)T = T(X_1, \dots, X_n) 是关于 θ\theta 的一个统计量。

如果在给定统计量 T=tT = t 的条件下,样本 X1,,XnX_1, \dots, X_n条件分布与参数 θ\theta 无关,则称 TT 为参数 θ\theta充分统计量(或充分估计量)。

注解

  1. 统计量 TT 可以是标量,也可以是向量。
  2. 样本本身 (X1,,Xn)(X_1, \dots, X_n) 显然是一个充分统计量(给定样本,其条件分布是退化的),但它没有起到任何信息压缩的作用,因此在统计推断中没有实用价值。
  3. TTθ\theta 的充分统计量,g()g(\cdot) 是一个单值可逆函数,则 g(T)g(T) 也是 θ\theta 的充分统计量。

直观示例:伯努利分布

假设 X1,,Xni.i.d.Bernoulli(p)X_1, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} \text{Bernoulli}(p),其中 p(0,1)p \in (0, 1)n>2n > 2。考虑两个统计量:

  • T1=i=1nXiT_1 = \sum_{i=1}^{n} X_i (样本中“成功”的次数)
  • T2=X1+X2T_2 = X_1 + X_2 (仅前两次试验的“成功”次数)

对于 T1T_1: 样本的联合分布为: P(X1=x1,,Xn=xn;p)=pxi(1p)nxi,xi{0,1}.P(X_1=x_1, \dots, X_n=x_n; p) = p^{\sum x_i} (1-p)^{n-\sum x_i}, \quad x_i \in {0,1}. T1T_1 服从二项分布:P(T1=t;p)=(nt)pt(1p)ntP(T_1 = t; p) = \binom{n}{t} p^t (1-p)^{n-t}。 可以计算在 T1=tT_1 = t 给定下,样本的条件分布: P(X1=x1,,Xn=xnT1=t;p)=P(X1=x1,,Xn=xn,T1=t;p)P(T1=t;p).P(X_1=x_1, \dots, X_n=x_n \mid T_1=t; p) = \frac{P(X_1=x_1, \dots, X_n=x_n, T_1=t; p)}{P(T_1=t; p)}.xi=t\sum x_i = t 时,分子为 pt(1p)ntp^t (1-p)^{n-t};分母为 (nt)pt(1p)nt\binom{n}{t} p^t (1-p)^{n-t}。因此, P(X1=x1,,Xn=xnT1=t;p)=1(nt).P(X_1=x_1, \dots, X_n=x_n \mid T_1=t; p) = \frac{1}{\binom{n}{t}}. 该条件分布与参数 pp 无关。这意味着,一旦知道了 T1T_1(总成功次数),样本的细节 (x1,,xn)(x_1, \dots, x_n) 如何排列不再提供任何关于 pp 的新信息。因此,T1T_1pp 的充分统计量。

对于 T2T_2: 可以验证,在 T2=tT_2 = t 给定下,样本的条件分布仍然依赖于参数 pp。这说明关于 pp 的信息并未完全包含在 T2T_2 中。直观上,T1T_1 使用了全部 nn 个样本的信息,而 T2T_2 只用了两个样本的信息,前者自然更“充分”。

因子分解定理:判断充分性的实用准则

虽然充分统计量的定义很清晰,但直接通过计算条件分布来判断通常很繁琐。因子分解定理(Fisher-Neyman因子分解准则)提供了一个非常实用的充要条件。

定理内容

设总体 ξ\xi 的密度函数(或分布律)为 f(x;θ)f(x; \theta)X1,,XnX_1, \dots, X_n 是来自该总体的简单随机样本。

连续型情形:样本的联合密度函数为 i=1nf(xi;θ)\prod_{i=1}^{n} f(x_i; \theta)离散型情形:样本的联合分布律为 i=1nP(Xi=xi;θ)\prod_{i=1}^{n} P(X_i = x_i; \theta)

则统计量 T=T(X1,,Xn)T = T(X_1, \dots, X_n)θ\theta 的充分统计量的充要条件是:样本的联合密度(或分布律)可以分解为如下形式: i=1nf(xi;θ)=g(t,θ)h(x1,,xn)\prod_{i=1}^{n} f(x_i; \theta) = g(t, \theta) \cdot h(x_1, \dots, x_n) 其中:

  1. g(t,θ)g(t, \theta) 是通过统计量 TT 的取值 t=T(x1,,xn)t = T(x_1, \dots, x_n) 依赖于样本,且与参数 θ\theta 有关的非负函数。
  2. h(x1,,xn)h(x_1, \dots, x_n) 是仅依赖于样本 (x1,,xn)(x_1, \dots, x_n),而与参数 θ\theta 无关的非负函数。

核心思想:如果联合分布中所有与 θ\theta 有关的部分都能通过统计量 TT 来概括(即被吸收进 g(t,θ)g(t, \theta) 中),那么 TT 就是充分的。

定理应用:泊松分布

假设 X1,,Xni.i.d.Poisson(λ)X_1, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} \text{Poisson}(\lambda),求参数 λ\lambda 的充分统计量。

  1. 写出样本联合分布律P(X1=x1,,Xn=xn;λ)=i=1nλxieλxi!=λi=1nxienλ1i=1nxi!.\begin{aligned} P(X_1=x_1, \dots, X_n=x_n; \lambda) &= \prod_{i=1}^{n} \frac{\lambda^{x_i} e^{-\lambda}}{x_i!} \ &= \lambda^{\sum_{i=1}^{n} x_i} e^{-n\lambda} \cdot \frac{1}{\prod_{i=1}^{n} x_i!}. \end{aligned}

  2. 进行因子分解: 令 t=i=1nxit = \sum_{i=1}^{n} x_i,则上式可写为: P(X1=x1,,Xn=xn;λ)=λtenλg(t,λ)1i=1nxi!h(x1,,xn).P(X_1=x_1, \dots, X_n=x_n; \lambda) = \underbrace{\lambda^{t} e^{-n\lambda}}{g(t, \lambda)} \cdot \underbrace{\frac{1}{\prod{i=1}^{n} x_i!}}_{h(x_1, \dots, x_n)}.

    • g(t,λ)=λtenλg(t, \lambda) = \lambda^{t} e^{-n\lambda} 仅通过 tt 依赖于样本,且与 λ\lambda 有关。
    • h(x1,,xn)=1/xi!h(x_1, \dots, x_n) = 1 / \prod x_i! 仅依赖于样本,与 λ\lambda 无关。
  3. 得出结论: 根据因子分解定理,统计量 T=i=1nXiT = \sum_{i=1}^{n} X_i 是参数 λ\lambda 的一个充分统计量。显然,样本均值 Xˉ=T/n\bar{X} = T/n 也是一个充分统计量(因为存在可逆变换关系)。

充分统计量的不唯一性:此例中,T=XiT=\sum X_iXˉ\bar{X} 都是充分统计量。事实上,任何与充分统计量有一一对应关系的统计量都是充分的。但我们需要寻找那些能有效压缩信息且便于处理的充分统计量。

import numpy as np
from scipy import stats
import matplotlib.pyplot as plt

# 设置随机种子,确保结果可复现
np.random.seed(2025)

# 模拟:验证泊松分布充分统计量的直观含义
lambda_true = 3.0  # 真实参数
n = 100  # 样本量
n_simulations = 10000  # 模拟次数

# 存储每次模拟的样本和与样本均值
sample_sums = []
sample_means = []

for _ in range(n_simulations):
    # 从泊松分布中抽取一个样本量为 n 的样本
    sample = stats.poisson.rvs(mu=lambda_true, size=n)
    sample_sums.append(sample.sum())
    sample_means.append(sample.mean())

# 计算样本和的均值和方差(理论值:E(T)=nλ, Var(T)=nλ)
print(f"真实参数 λ = {lambda_true}")
print(f"样本量 n = {n}")
print(f"模拟次数 = {n_simulations}")
print("-" * 40)
print(f"样本和 T 的模拟均值: {np.mean(sample_sums):.4f}")
print(f"样本和 T 的理论均值 (nλ): {n * lambda_true:.4f}")
print(f"样本和 T 的模拟方差: {np.var(sample_sums):.4f}")
print(f"样本和 T 的理论方差 (nλ): {n * lambda_true:.4f}")
print("-" * 40)
print(f"样本均值 X̄ 的模拟均值: {np.mean(sample_means):.4f}")
print(f"样本均值 X̄ 的理论均值 (λ): {lambda_true:.4f}")
print(f"样本均值 X̄ 的模拟方差: {np.var(sample_means):.4f}")
print(f"样本均值 X̄ 的理论方差 (λ/n): {lambda_true / n:.4f}")

# 可视化:样本和的分布(近似正态)
plt.figure(figsize=(12, 5))

plt.subplot(1, 2, 1)
plt.hist(sample_sums, bins=50, density=True, alpha=0.7, color='skyblue', edgecolor='black')
# 绘制理论正态分布曲线
x = np.linspace(min(sample_sums), max(sample_sums), 1000)
pdf_normal = stats.norm.pdf(x, loc=n*lambda_true, scale=np.sqrt(n*lambda_true))
plt.plot(x, pdf_normal, 'r-', lw=2, label=f'N({n*lambda_true:.1f}, {n*lambda_true:.1f})')
plt.xlabel('样本和 T')
plt.ylabel('密度')
plt.title('样本和 T 的抽样分布(模拟 vs 理论正态)')
plt.legend()
plt.grid(True, alpha=0.3)

plt.subplot(1, 2, 2)
plt.hist(sample_means, bins=50, density=True, alpha=0.7, color='lightgreen', edgecolor='black')
# 绘制理论正态分布曲线
x_bar = np.linspace(min(sample_means), max(sample_means), 1000)
pdf_normal_bar = stats.norm.pdf(x_bar, loc=lambda_true, scale=np.sqrt(lambda_true/n))
plt.plot(x_bar, pdf_normal_bar, 'r-', lw=2, label=f'N({lambda_true:.1f}, {lambda_true/n:.3f})')
plt.xlabel('样本均值 X̄')
plt.ylabel('密度')
plt.title('样本均值 X̄ 的抽样分布(模拟 vs 理论正态)')
plt.legend()
plt.grid(True, alpha=0.3)

plt.tight_layout()
plt.show()

完备统计量简介

完备性是比充分性更强的性质,它在寻找一致最小方差无偏估计(UMVUE) 时起到关键作用。我们先从分布族的完备性谈起。

分布族的完备性

设总体 ξ\xi 的分布族为 {F(x;θ):θΘ}{F(x; \theta): \theta \in \Theta}。如果对于任意满足以下条件的可测函数 g()g(\cdot)Eθ[g(ξ)]=0,对一切 θΘE_{\theta}[g(\xi)] = 0, \quad \text{对一切 } \theta \in \Theta 都能推出: Pθ(g(ξ)=0)=1,对一切 θΘP_{\theta}(g(\xi) = 0) = 1, \quad \text{对一切 } \theta \in \Theta 则称该分布族是完备的

直观理解:如果除了零函数(以概率1为零)以外,不存在其他函数的期望恒为零,那么这个分布族就是完备的。这类似于函数空间中的“完备正交基”概念——不存在与所有“基函数”都正交的非零函数。

完备统计量

X1,,XnX_1, \dots, X_n 是来自总体分布族 {F(x;θ)}{F(x; \theta)} 的样本,T=T(X1,,Xn)T = T(X_1, \dots, X_n) 是一个统计量。如果 TT 的诱导分布族 {FT(t;θ):θΘ}{F_T(t; \theta): \theta \in \Theta} 是完备的,则称 TT 是一个完备统计量

如果一个统计量既是充分的又是完备的,则称为充分完备统计量。在点估计理论中,我们将看到:对于指数族分布,充分完备统计量是构造UMVUE的基石。

📝 动手练一练

  1. 判断充分统计量:设 X1,X2,,Xni.i.d.N(μ,σ2)X_1, X_2, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} N(\mu, \sigma^2),其中 σ2\sigma^2 已知。利用因子分解定理证明,样本均值 Xˉ=1ni=1nXi\bar{X} = \frac{1}{n}\sum_{i=1}^n X_i 是参数 μ\mu 的充分统计量。

  2. 理解完备性:设 X1,X2,,Xni.i.d.Bernoulli(p)X_1, X_2, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} \text{Bernoulli}(p)p(0,1)p \in (0,1)。已知 T=i=1nXiT = \sum_{i=1}^n X_i 服从二项分布 Binomial(n,p)\text{Binomial}(n, p)。请思考:如果存在一个函数 g(T)g(T),使得对所有的 p(0,1)p \in (0,1) 都有 Ep[g(T)]=0E_p[g(T)] = 0,根据二项分布的性质,你能得出什么关于 g(T)g(T) 的结论?这说明了二项分布族的什么性质?

参考答案

  1. 证明:样本联合密度为 f(x1,,xn;μ)=i=1n12πσ2exp((xiμ)22σ2)=(2πσ2)n/2exp(12σ2i=1n(xiμ)2).\begin{aligned} f(x_1,\dots,x_n; \mu) &= \prod_{i=1}^n \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left(-\frac{(x_i-\mu)^2}{2\sigma^2}\right) \ &= (2\pi\sigma^2)^{-n/2} \exp\left(-\frac{1}{2\sigma^2} \sum_{i=1}^n (x_i-\mu)^2\right). \end{aligned} 展开平方和:(xiμ)2=(xixˉ+xˉμ)2=(xixˉ)2+n(xˉμ)2\sum (x_i-\mu)^2 = \sum (x_i - \bar{x} + \bar{x} - \mu)^2 = \sum (x_i-\bar{x})^2 + n(\bar{x}-\mu)^2。 代入得: f(x1,,xn;μ)=exp(n(xˉμ)22σ2)g(xˉ,μ)(2πσ2)n/2exp(12σ2(xixˉ)2)h(x1,,xn).f(x_1,\dots,x_n; \mu) = \underbrace{\exp\left(-\frac{n(\bar{x}-\mu)^2}{2\sigma^2}\right)}{g(\bar{x}, \mu)} \cdot \underbrace{(2\pi\sigma^2)^{-n/2} \exp\left(-\frac{1}{2\sigma^2}\sum (x_i-\bar{x})^2\right)}{h(x_1,\dots,x_n)}. 其中 gg 仅通过 xˉ\bar{x} 依赖于样本,且与 μ\mu 有关;hhμ\mu 无关。由因子分解定理,Xˉ\bar{X}μ\mu 的充分统计量。

  2. 思考提示Ep[g(T)]=t=0ng(t)(nt)pt(1p)nt=0E_p[g(T)] = \sum_{t=0}^n g(t) \binom{n}{t} p^t (1-p)^{n-t} = 0 对所有 p(0,1)p\in(0,1) 成立。左边是关于 pp 的多项式(乘以 (1p)n(1-p)^n 后是 ppnn 次多项式)。一个 nn 次多项式在无穷多个点(区间(0,1)(0,1))上为零,其所有系数必须为零。由此可推出 g(0)=g(1)==g(n)=0g(0)=g(1)=\dots=g(n)=0,即 Pp(g(T)=0)=1P_p(g(T)=0)=1。这说明二项分布族 {Binomial(n,p):p(0,1)}{\text{Binomial}(n,p): p\in(0,1)} 是完备的,从而统计量 TT 是完备统计量。

本章小结

本节我们深入探讨了统计推断中两个核心概念:充分统计量与完备统计量。

要点回顾

  • 充分统计量的核心思想是“信息压缩无损失”。其严格定义为:给定统计量后,样本的条件分布不再依赖于未知参数。判断充分性最实用的工具是因子分解定理
  • 因子分解定理将充分性的判断转化为对样本联合密度/分布律的因子分解。若能分解为 g(T(x),θ)h(x)g(T(x), \theta) \cdot h(x) 的形式,则 TT 充分。
  • 充分统计量不唯一,但有效的充分统计量应在保留全部参数信息的同时,尽可能地压缩数据。
  • 完备统计量基于分布族的完备性定义。如果一个分布族中,期望恒为零的函数必为零函数,则该族完备。统计量若诱导出完备分布族,则为完备统计量。
  • 充分完备统计量是寻找最优估计(UMVUE)的关键,我们将在点估计章节深入应用。

行动清单

  1. 掌握判断方法:面对一个新的分布(如指数分布、均匀分布),尝试用因子分解定理找出其参数的充分统计量。
  2. 代码验证:运行讲义中的Python代码,理解充分统计量(如泊松分布的和)的抽样分布性质,并通过模拟加深对“信息充分性”的直观感受。
  3. 联想后续:带着“充分性”和“完备性”这两个概念进入下一章“点估计”的学习,特别关注它们在证明UMVUE的存在性与唯一性时所起的作用。

— 小象教研组

配套学习资源与课件
  • 第1章课件:统计量与抽样分布(PPT · 6.0MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问