📑 查看全课大纲(第 5 / 41 节)
- 1.数理统计中的基本概念
- 2.统计量与抽样分布(一)
- 3.统计量与抽样分布(二)
- 4.次序统计量
- 5.充分统计量与完备统计量
- 6.统计中常用分布族(一)
- 7.统计中常用分布族(二)
- 8.矩估计
- 9.极大似然估计
- 10.无偏估计与一致最小方差无偏估计(一)
- 11.无偏估计与一致最小方差无偏估计(二)
- 12.完备统计量
- 13.CR不等式及有效估计
- 14.相合估计
- 15.置信区间
- 16.正态总体参数的置信区间
- 17.大样本置信区间
- 18.Fisher显著性检验
- 19.正态总体参数的假设检验(一)
- 20.正态总体参数的假设检验(二)
- 21.似然比检验
- 22.Neyman-Pearson基本引理
- 23.一致最优势检验
- 24.无偏检验与一致最优势无偏检验
- 25.正态概率纸检验
- 26.拟合优度检验
- 27.列联表的独立性检验
- 28.Kolmogorov检验
- 29.正态性检验
- 30.Bayes统计
- 31.先验分布的确定
- 32.Bayes统计推断
- 33.统计判决理论
- 34.Minimax准则
- 35.非参数统计
- 36.符号检验
- 37.Wilcoxon符号秩检验
- 38.抽样调查
- 39.简单随机抽样
- 40.分层随机抽样
- 41.整群随机抽样
充分统计量与完备统计量
约 36 分钟
充分统计量与完备统计量
小象实战讲义 · 数据科学的统计基础
在数据科学实践中,我们通过抽样从总体中获取样本,并基于样本信息对总体进行推断。然而,原始样本数据往往杂乱无章,我们需要对其进行“信息压缩”,提炼出简洁有效的统计量。本节将探讨一个核心问题:我们构造的统计量是否“充分”地保留了样本中关于总体参数的全部信息?我们将学习充分统计量的定义、直观理解,以及一个极其重要的实用工具——因子分解定理。最后,我们将简要介绍完备统计量的概念,为后续学习一致最小方差无偏估计(UMVUE)打下基础。
💡 核心导读
本节你将掌握:
- 充分统计量的直观思想:理解统计推断中“信息压缩”的过程,以及如何衡量一个统计量是否“充分”提取了参数信息。
- 充分统计量的严格定义:掌握基于条件分布的定义方式,理解其核心是“给定统计量后,样本的条件分布与参数无关”。
- 因子分解定理(Fisher-Neyman准则):学习判断充分统计量的核心定理,它将复杂的条件分布判断转化为对样本联合分布的因子分解。
- 充分统计量的应用与不唯一性:通过泊松分布的例子掌握因子分解定理的应用,并理解充分统计量不唯一,但好的充分统计量应能有效压缩信息。
- 完备统计量的概念:初步了解分布族的完备性定义,以及完备统计量在后续估计理论中的重要作用。
统计推断中的信息压缩
统计学的基本流程可以概括为:从具有未知参数 的总体中,抽取一个简单随机样本 ;样本蕴含了总体的信息,但信息是零散、琐碎的;因此,我们需要对信息进行压缩,将样本构造为一个个统计量,例如样本均值 、样本方差 等;最终,我们基于这些统计量对总体参数 进行统计推断。
这个过程引出一个核心问题:我们构造的统计量,其信息压缩得是否“充分”?或者说,这个统计量是否提取了样本中关于参数 的全部信息?这就是充分统计量所要回答的问题。
我们可以将样本 中包含的关于 的信息,在概念上分解为两部分:
- 统计量 中所含有的关于 的信息。
- 在已知统计量 的条件下,样本 中额外含有的关于 的信息。
最理想的情况是第二部分信息为零。这意味着,一旦知道了统计量 的值,样本 中就不再包含任何关于 的新信息。此时,统计量 就“充分”地提取了所有信息。如何定量描述“没有新信息”?这需要借助条件概率或条件分布的概念。
充分统计量的定义与直观理解
定义
设总体 的分布函数为 ,其中 是未知参数。设 是来自该总体的一个简单随机样本(子样), 是关于 的一个统计量。
如果在给定统计量 的条件下,样本 的条件分布与参数 无关,则称 为参数 的充分统计量(或充分估计量)。
注解:
- 统计量 可以是标量,也可以是向量。
- 样本本身 显然是一个充分统计量(给定样本,其条件分布是退化的),但它没有起到任何信息压缩的作用,因此在统计推断中没有实用价值。
- 若 是 的充分统计量, 是一个单值可逆函数,则 也是 的充分统计量。
直观示例:伯努利分布
假设 ,其中 ,。考虑两个统计量:
- (样本中“成功”的次数)
- (仅前两次试验的“成功”次数)
对于 : 样本的联合分布为: 服从二项分布:。 可以计算在 给定下,样本的条件分布: 当 时,分子为 ;分母为 。因此, 该条件分布与参数 无关。这意味着,一旦知道了 (总成功次数),样本的细节 如何排列不再提供任何关于 的新信息。因此, 是 的充分统计量。
对于 : 可以验证,在 给定下,样本的条件分布仍然依赖于参数 。这说明关于 的信息并未完全包含在 中。直观上, 使用了全部 个样本的信息,而 只用了两个样本的信息,前者自然更“充分”。
因子分解定理:判断充分性的实用准则
虽然充分统计量的定义很清晰,但直接通过计算条件分布来判断通常很繁琐。因子分解定理(Fisher-Neyman因子分解准则)提供了一个非常实用的充要条件。
定理内容
设总体 的密度函数(或分布律)为 , 是来自该总体的简单随机样本。
连续型情形:样本的联合密度函数为 。 离散型情形:样本的联合分布律为 。
则统计量 是 的充分统计量的充要条件是:样本的联合密度(或分布律)可以分解为如下形式: 其中:
- 是通过统计量 的取值 依赖于样本,且与参数 有关的非负函数。
- 是仅依赖于样本 ,而与参数 无关的非负函数。
核心思想:如果联合分布中所有与 有关的部分都能通过统计量 来概括(即被吸收进 中),那么 就是充分的。
定理应用:泊松分布
假设 ,求参数 的充分统计量。
写出样本联合分布律:
进行因子分解: 令 ,则上式可写为: {g(t, \lambda)} \cdot \underbrace{\frac{1}{\prod{i=1}^{n} x_i!}}_{h(x_1, \dots, x_n)}.
- 仅通过 依赖于样本,且与 有关。
- 仅依赖于样本,与 无关。
得出结论: 根据因子分解定理,统计量 是参数 的一个充分统计量。显然,样本均值 也是一个充分统计量(因为存在可逆变换关系)。
充分统计量的不唯一性:此例中, 和 都是充分统计量。事实上,任何与充分统计量有一一对应关系的统计量都是充分的。但我们需要寻找那些能有效压缩信息且便于处理的充分统计量。
import numpy as np
from scipy import stats
import matplotlib.pyplot as plt
# 设置随机种子,确保结果可复现
np.random.seed(2025)
# 模拟:验证泊松分布充分统计量的直观含义
lambda_true = 3.0 # 真实参数
n = 100 # 样本量
n_simulations = 10000 # 模拟次数
# 存储每次模拟的样本和与样本均值
sample_sums = []
sample_means = []
for _ in range(n_simulations):
# 从泊松分布中抽取一个样本量为 n 的样本
sample = stats.poisson.rvs(mu=lambda_true, size=n)
sample_sums.append(sample.sum())
sample_means.append(sample.mean())
# 计算样本和的均值和方差(理论值:E(T)=nλ, Var(T)=nλ)
print(f"真实参数 λ = {lambda_true}")
print(f"样本量 n = {n}")
print(f"模拟次数 = {n_simulations}")
print("-" * 40)
print(f"样本和 T 的模拟均值: {np.mean(sample_sums):.4f}")
print(f"样本和 T 的理论均值 (nλ): {n * lambda_true:.4f}")
print(f"样本和 T 的模拟方差: {np.var(sample_sums):.4f}")
print(f"样本和 T 的理论方差 (nλ): {n * lambda_true:.4f}")
print("-" * 40)
print(f"样本均值 X̄ 的模拟均值: {np.mean(sample_means):.4f}")
print(f"样本均值 X̄ 的理论均值 (λ): {lambda_true:.4f}")
print(f"样本均值 X̄ 的模拟方差: {np.var(sample_means):.4f}")
print(f"样本均值 X̄ 的理论方差 (λ/n): {lambda_true / n:.4f}")
# 可视化:样本和的分布(近似正态)
plt.figure(figsize=(12, 5))
plt.subplot(1, 2, 1)
plt.hist(sample_sums, bins=50, density=True, alpha=0.7, color='skyblue', edgecolor='black')
# 绘制理论正态分布曲线
x = np.linspace(min(sample_sums), max(sample_sums), 1000)
pdf_normal = stats.norm.pdf(x, loc=n*lambda_true, scale=np.sqrt(n*lambda_true))
plt.plot(x, pdf_normal, 'r-', lw=2, label=f'N({n*lambda_true:.1f}, {n*lambda_true:.1f})')
plt.xlabel('样本和 T')
plt.ylabel('密度')
plt.title('样本和 T 的抽样分布(模拟 vs 理论正态)')
plt.legend()
plt.grid(True, alpha=0.3)
plt.subplot(1, 2, 2)
plt.hist(sample_means, bins=50, density=True, alpha=0.7, color='lightgreen', edgecolor='black')
# 绘制理论正态分布曲线
x_bar = np.linspace(min(sample_means), max(sample_means), 1000)
pdf_normal_bar = stats.norm.pdf(x_bar, loc=lambda_true, scale=np.sqrt(lambda_true/n))
plt.plot(x_bar, pdf_normal_bar, 'r-', lw=2, label=f'N({lambda_true:.1f}, {lambda_true/n:.3f})')
plt.xlabel('样本均值 X̄')
plt.ylabel('密度')
plt.title('样本均值 X̄ 的抽样分布(模拟 vs 理论正态)')
plt.legend()
plt.grid(True, alpha=0.3)
plt.tight_layout()
plt.show()完备统计量简介
完备性是比充分性更强的性质,它在寻找一致最小方差无偏估计(UMVUE) 时起到关键作用。我们先从分布族的完备性谈起。
分布族的完备性
设总体 的分布族为 。如果对于任意满足以下条件的可测函数 : 都能推出: 则称该分布族是完备的。
直观理解:如果除了零函数(以概率1为零)以外,不存在其他函数的期望恒为零,那么这个分布族就是完备的。这类似于函数空间中的“完备正交基”概念——不存在与所有“基函数”都正交的非零函数。
完备统计量
设 是来自总体分布族 的样本, 是一个统计量。如果 的诱导分布族 是完备的,则称 是一个完备统计量。
如果一个统计量既是充分的又是完备的,则称为充分完备统计量。在点估计理论中,我们将看到:对于指数族分布,充分完备统计量是构造UMVUE的基石。
📝 动手练一练
判断充分统计量:设 ,其中 已知。利用因子分解定理证明,样本均值 是参数 的充分统计量。
理解完备性:设 ,。已知 服从二项分布 。请思考:如果存在一个函数 ,使得对所有的 都有 ,根据二项分布的性质,你能得出什么关于 的结论?这说明了二项分布族的什么性质?
参考答案:
证明:样本联合密度为 展开平方和:。 代入得: {g(\bar{x}, \mu)} \cdot \underbrace{(2\pi\sigma^2)^{-n/2} \exp\left(-\frac{1}{2\sigma^2}\sum (x_i-\bar{x})^2\right)}{h(x_1,\dots,x_n)}. 其中 仅通过 依赖于样本,且与 有关; 与 无关。由因子分解定理, 是 的充分统计量。
思考提示: 对所有 成立。左边是关于 的多项式(乘以 后是 的 次多项式)。一个 次多项式在无穷多个点(区间)上为零,其所有系数必须为零。由此可推出 ,即 。这说明二项分布族 是完备的,从而统计量 是完备统计量。
本章小结
本节我们深入探讨了统计推断中两个核心概念:充分统计量与完备统计量。
要点回顾:
- 充分统计量的核心思想是“信息压缩无损失”。其严格定义为:给定统计量后,样本的条件分布不再依赖于未知参数。判断充分性最实用的工具是因子分解定理。
- 因子分解定理将充分性的判断转化为对样本联合密度/分布律的因子分解。若能分解为 的形式,则 充分。
- 充分统计量不唯一,但有效的充分统计量应在保留全部参数信息的同时,尽可能地压缩数据。
- 完备统计量基于分布族的完备性定义。如果一个分布族中,期望恒为零的函数必为零函数,则该族完备。统计量若诱导出完备分布族,则为完备统计量。
- 充分完备统计量是寻找最优估计(UMVUE)的关键,我们将在点估计章节深入应用。
行动清单:
- 掌握判断方法:面对一个新的分布(如指数分布、均匀分布),尝试用因子分解定理找出其参数的充分统计量。
- 代码验证:运行讲义中的Python代码,理解充分统计量(如泊松分布的和)的抽样分布性质,并通过模拟加深对“信息充分性”的直观感受。
- 联想后续:带着“充分性”和“完备性”这两个概念进入下一章“点估计”的学习,特别关注它们在证明UMVUE的存在性与唯一性时所起的作用。
— 小象教研组
- 第1章课件:统计量与抽样分布(PPT · 6.0MB)下载
领取《小象 11GB VIP 课件资料包与大厂真题手册》
包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。
- ✔完整 Python / 数据分析 Jupyter 实战源码
- ✔大厂真实业务数据集与练习题
- ✔微信扫码添加课程顾问,免费获取网盘下载链接
微信扫码添加顾问