📑 查看全课大纲(第 6 / 41 节)
- 1.数理统计中的基本概念
- 2.统计量与抽样分布(一)
- 3.统计量与抽样分布(二)
- 4.次序统计量
- 5.充分统计量与完备统计量
- 6.统计中常用分布族(一)
- 7.统计中常用分布族(二)
- 8.矩估计
- 9.极大似然估计
- 10.无偏估计与一致最小方差无偏估计(一)
- 11.无偏估计与一致最小方差无偏估计(二)
- 12.完备统计量
- 13.CR不等式及有效估计
- 14.相合估计
- 15.置信区间
- 16.正态总体参数的置信区间
- 17.大样本置信区间
- 18.Fisher显著性检验
- 19.正态总体参数的假设检验(一)
- 20.正态总体参数的假设检验(二)
- 21.似然比检验
- 22.Neyman-Pearson基本引理
- 23.一致最优势检验
- 24.无偏检验与一致最优势无偏检验
- 25.正态概率纸检验
- 26.拟合优度检验
- 27.列联表的独立性检验
- 28.Kolmogorov检验
- 29.正态性检验
- 30.Bayes统计
- 31.先验分布的确定
- 32.Bayes统计推断
- 33.统计判决理论
- 34.Minimax准则
- 35.非参数统计
- 36.符号检验
- 37.Wilcoxon符号秩检验
- 38.抽样调查
- 39.简单随机抽样
- 40.分层随机抽样
- 41.整群随机抽样
统计中常用分布族(一)
约 40 分钟
统计中常用的分布族(一)
小象实战讲义 · 数据科学的统计基础
在数据科学中,我们不仅需要理解单个的概率分布,更需要掌握由参数空间定义的一族分布,以及那些在统计推断中扮演核心角色的抽样分布。本节将系统介绍数理统计的“三大分布”——卡方分布、t分布和F分布,它们构成了后续假设检验和区间估计的理论基石。同时,我们还将引入一个强大的分布族——伽马分布族,它统一了指数分布、卡方分布等常用模型,展现了分布理论的内在联系。学完本节,你将能够理解这些关键分布的构造、性质及其在统计推断中的核心作用。
💡 核心导读
- 数理统计三大分布:掌握卡方分布、t分布和F分布的定义、构造方式(作为抽样分布)及其基本性质(如可加性、期望方差)。
- 分位数的意义:理解上、下α分位点的定义及其在后续假设检验中作为决策临界值的重要性。
- 分布族的概念:明确分布族是“分布形式+参数空间”的集合,例如二项分布族、泊松分布族。
- 伽马分布族:学习伽马分布的密度函数、形状与尺度参数,理解其作为指数分布和卡方分布的一般形式。
- 性质与联系:重点掌握伽马分布的可加性及其证明思路(特征函数法),并理解其与卡方分布可加性的关系。
数理统计中的三大分布
在概率论中,正态分布、泊松分布和二项分布因其在自然界广泛存在且理论意义重大,被称为“三大分布”。在数理统计中,同样有三个至关重要的分布:卡方分布、t分布和F分布。它们均由其他基本分布(主要是正态分布)诱导而来,是统计量的抽样分布,在参数估计和假设检验中应用极其广泛。
卡方分布
定义:设 是来自标准正态总体 的简单随机样本(即独立同分布),则称统计量 所服从的分布为自由度为 的卡方分布,记为 。
性质:
- 可加性:若 , ,且 与 相互独立,则 。
- 数字特征:若 ,则其期望和方差为:
- 图形特征:卡方分布是右偏分布。其概率密度曲线位于第一象限。自由度 越小,曲线越陡峭、右偏越明显; 越大,曲线越趋于对称和平坦。
分位数:对于给定的概率 (),满足 的点 称为 分布的上 分位数(或上侧临界值)。满足 的点 称为下 分位数。分位数是假设检验中判断是否拒绝原假设的决策依据。
t分布(学生氏分布)
定义:设 , ,且 与 相互独立,则称随机变量 所服从的分布为自由度为 的 t 分布,记为 。
性质:
- 图形特征:t分布是关于 对称的尖峰厚尾分布。其密度曲线形状类似标准正态分布,但尾部更厚,即极端值出现的概率高于正态分布。
- 极限性质:当自由度 时,t分布 收敛于标准正态分布 。因此,当 较大时(如 ),常用正态分布近似t分布。
- 与F分布的关系:若 ,则 。
分位数:由于t分布对称,其上 分位数 满足 。由对称性可知,。
F分布
定义:设 , ,且 与 相互独立,则称随机变量 所服从的分布为第一自由度为 、第二自由度为 的 F 分布,记为 。
性质:
- 倒数性质:若 ,则 。
- 分位数关系:由倒数性质可推导出分位数关系:。
- 与其他分布的联系:
- 若 ,则 。
- 若 ,则 (见下文伽马分布)。
应用:F分布在方差分析(ANOVA)、两正态总体方差比的假设检验中起到核心作用。
三大分布的抽样分布定理回顾
三大分布常出现在以下经典抽样分布定理中,这些定理是统计推断的直接工具:
- 单正态总体:设 ,样本均值 ,样本方差 ,则
- 。
- 。
- 两独立正态总体:设 , ,且两组样本独立。
- 方差比:若 ,则 。
- 均值差(方差相等时):,其中 。
分布族与伽马分布族
分布族的概念
一个分布族是由一个确定的分布形式及其参数空间构成的集合。它描述了一类具有相同数学形式、但参数不同的概率分布。
- 二项分布族:。对于固定的 ,不同的成功概率 构成了一个分布族。
- 泊松分布族:。
- 正态分布族:。
伽马分布族
伽马分布族是一个非常重要的连续分布族,它包含指数分布和卡方分布作为其特例,在贝叶斯统计、可靠性理论中有广泛应用。
定义:若随机变量 的概率密度函数为 其中 为形状参数, 为率参数(rate 参数,越大密度衰减越快; 才是尺度参数), 是伽马函数 ,则称 服从参数为 的伽马分布,记为 。
特例:
- 指数分布:当形状参数 时, 即为参数为 的指数分布 。
- 卡方分布:当形状参数 ,率参数 时, 即为自由度为 的卡方分布 。
数字特征:若 ,则 其 阶原点矩为 。
可加性:伽马分布具有非常重要的可加性。设 , ,且 与 相互独立,则 证明思路(特征函数法): 伽马分布 的特征函数为 。 由于 与 独立,其和的特征函数为两者特征函数之积: 这正是 分布的特征函数。由特征函数与分布的一一对应关系,即证得可加性。
推论:卡方分布的可加性是其直接推论。因为 , ,由伽马分布可加性立得 。
尺度变换:若 ,则对任意常数 ,有 。这体现了尺度参数 对分布“伸缩”的影响。
📝 动手练一练
计算与验证:设 。令 。
- (a) 根据定义, 服从什么分布?其自由度为多少?
- (b) 计算 和 的近似值。(提示:查阅卡方分布表或使用统计软件)
- (c) 使用 Python 模拟生成10000个 的观测值,计算其样本均值和样本方差,并与卡方分布的理论期望、方差进行比较。
性质理解:已知 。
- (a) 利用 t 分布与 F 分布的关系,判断 服从什么分布?写出其自由度。
- (b) 若已知 ,利用对称性求 的值。
- (c) 求 的概率。
参考答案:
- (a) 。 (b) , 。(此为 的上、下0.05分位数) (c) 模拟代码及结果见下。
- (a) 。 (b) 。 (c) 。
import numpy as np
from scipy import stats
import matplotlib.pyplot as plt
# 设置随机种子,保证结果可复现
np.random.seed(321)
# 1.(c) 模拟验证卡方分布的性质
n_sim = 10000
n = 3 # 自由度
# 生成标准正态随机样本 (n_sim x n 的矩阵)
X = np.random.randn(n_sim, n)
# 计算每个样本的 Y = sum(X_i^2)
Y_sim = np.sum(X**2, axis=1)
# 计算样本均值和方差
sample_mean = np.mean(Y_sim)
sample_var = np.var(Y_sim, ddof=1) # 无偏样本方差
# 理论值
theory_mean = n # E(Y) = n
theory_var = 2 * n # Var(Y) = 2n
print(f"模拟结果(自由度 n={n}, 模拟次数 {n_sim}):")
print(f"样本均值: {sample_mean:.4f}, 理论期望: {theory_mean}")
print(f"样本方差: {sample_var:.4f}, 理论方差: {theory_var}")
print(f"均值绝对误差: {abs(sample_mean - theory_mean):.4f}")
print(f"方差绝对误差: {abs(sample_var - theory_var):.4f}")
# 可视化:比较模拟数据的直方图与理论密度曲线
fig, ax = plt.subplots(1, 1, figsize=(8, 5))
# 绘制模拟数据直方图
ax.hist(Y_sim, bins=50, density=True, alpha=0.6, color='skyblue', edgecolor='black', label='模拟数据直方图')
# 绘制理论密度曲线
x = np.linspace(stats.chi2.ppf(0.001, n), stats.chi2.ppf(0.999, n), 1000)
ax.plot(x, stats.chi2.pdf(x, n), 'r-', lw=2, label=f'理论密度 χ²({n})')
ax.set_xlabel('Y')
ax.set_ylabel('概率密度')
ax.set_title(f'卡方分布 χ²({n}) 的模拟验证')
ax.legend()
ax.grid(True, linestyle='--', alpha=0.5)
plt.tight_layout()
plt.show()
# 2.(c) 计算概率验证
t_critical = 1.812
df_t = 10
# 计算 P(T^2 > (1.812)^2) = P(|T| > 1.812)
prob_tail = 2 * (1 - stats.t.cdf(t_critical, df_t)) # 双侧概率
print(f"\n对于 t(10) 分布:")
print(f"P(T > {t_critical}) = {1 - stats.t.cdf(t_critical, df_t):.4f}")
print(f"P(|T| > {t_critical}) = P(T^2 > {t_critical**2:.4f}) = {prob_tail:.4f}")
# 使用F分布验证
prob_f = 1 - stats.f.cdf(t_critical**2, 1, df_t)
print(f"使用 F(1,10) 分布计算: P(F > {t_critical**2:.4f}) = {prob_f:.4f}")
print(f"两种方法结果一致: {np.isclose(prob_tail, prob_f)}")本章小结
本节深入探讨了数理统计的核心分布理论与分布族概念。
要点回顾:
- 三大抽样分布:卡方分布、t分布和F分布是统计推断的支柱。它们均由正态分布样本构造而来,其定义、性质(如可加性、对称性、尖峰厚尾)和分位数必须熟练掌握。
- 分布族:理解分布族是“分布+参数空间”的集合,它让我们能以统一的视角看待一类统计模型。
- 伽马分布族:这是一个强大的统一框架。其密度函数由形状参数 和尺度参数 决定。指数分布 () 和卡方分布 () 是其特例。伽马分布的可加性是其核心性质,常用特征函数法证明,并直接导出卡方分布的可加性。
行动清单:
- 动手推导:根据t分布和F分布的定义,自行推导 这一重要关系。
- 软件实操:使用
scipy.stats模块中的chi2,t,f,gamma等函数,熟练计算这些分布的概率密度、累积概率、分位数,并像示例代码一样进行抽样模拟验证。 - 建立联系:画一张思维导图,将正态分布、标准正态分布、卡方分布、t分布、F分布、伽马分布、指数分布之间的包含与诱导关系清晰地呈现出来,深化对分布体系的理解。
— 小象教研组
- 第1章课件:统计量与抽样分布(PPT · 6.0MB)下载
领取《小象 11GB VIP 课件资料包与大厂真题手册》
包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。
- ✔完整 Python / 数据分析 Jupyter 实战源码
- ✔大厂真实业务数据集与练习题
- ✔微信扫码添加课程顾问,免费获取网盘下载链接
微信扫码添加顾问