← 返回《数据科学的统计基础》
📑 查看全课大纲(第 6 / 41 节)

统计中常用分布族(一)

约 40 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

统计中常用的分布族(一)

小象实战讲义 · 数据科学的统计基础

在数据科学中,我们不仅需要理解单个的概率分布,更需要掌握由参数空间定义的一族分布,以及那些在统计推断中扮演核心角色的抽样分布。本节将系统介绍数理统计的“三大分布”——卡方分布、t分布和F分布,它们构成了后续假设检验和区间估计的理论基石。同时,我们还将引入一个强大的分布族——伽马分布族,它统一了指数分布、卡方分布等常用模型,展现了分布理论的内在联系。学完本节,你将能够理解这些关键分布的构造、性质及其在统计推断中的核心作用。

💡 核心导读

  • 数理统计三大分布:掌握卡方分布、t分布和F分布的定义、构造方式(作为抽样分布)及其基本性质(如可加性、期望方差)。
  • 分位数的意义:理解上、下α分位点的定义及其在后续假设检验中作为决策临界值的重要性。
  • 分布族的概念:明确分布族是“分布形式+参数空间”的集合,例如二项分布族、泊松分布族。
  • 伽马分布族:学习伽马分布的密度函数、形状与尺度参数,理解其作为指数分布和卡方分布的一般形式。
  • 性质与联系:重点掌握伽马分布的可加性及其证明思路(特征函数法),并理解其与卡方分布可加性的关系。

数理统计中的三大分布

在概率论中,正态分布、泊松分布和二项分布因其在自然界广泛存在且理论意义重大,被称为“三大分布”。在数理统计中,同样有三个至关重要的分布:卡方分布t分布F分布。它们均由其他基本分布(主要是正态分布)诱导而来,是统计量的抽样分布,在参数估计和假设检验中应用极其广泛。

卡方分布

定义:设 X1,X2,,XnX_1, X_2, \ldots, X_n 是来自标准正态总体 N(0,1)N(0,1) 的简单随机样本(即独立同分布),则称统计量 Y=i=1nXi2Y = \sum_{i=1}^{n} X_i^2 所服从的分布为自由度为 nn 的卡方分布,记为 Yχ2(n)Y \sim \chi^2(n)

性质

  1. 可加性:若 Y1χ2(m)Y_1 \sim \chi^2(m)Y2χ2(n)Y_2 \sim \chi^2(n),且 Y1Y_1Y2Y_2 相互独立,则 Y1+Y2χ2(m+n)Y_1 + Y_2 \sim \chi^2(m+n)
  2. 数字特征:若 Yχ2(n)Y \sim \chi^2(n),则其期望和方差为: E(Y)=n,Var(Y)=2n.E(Y) = n, \quad Var(Y) = 2n.
  3. 图形特征:卡方分布是右偏分布。其概率密度曲线位于第一象限。自由度 nn 越小,曲线越陡峭、右偏越明显;nn 越大,曲线越趋于对称和平坦。

分位数:对于给定的概率 α\alpha0<α<10 < \alpha < 1),满足 P(Y>χα2(n))=αP(Y > \chi^2_{\alpha}(n)) = \alpha 的点 χα2(n)\chi^2_{\alpha}(n) 称为 χ2(n)\chi^2(n) 分布的α\alpha 分位数(或上侧临界值)。满足 P(Yχ1α2(n))=αP(Y \le \chi^2_{1-\alpha}(n)) = \alpha 的点 χ1α2(n)\chi^2_{1-\alpha}(n) 称为α\alpha 分位数。分位数是假设检验中判断是否拒绝原假设的决策依据。

t分布(学生氏分布)

定义:设 XN(0,1)X \sim N(0,1)Yχ2(n)Y \sim \chi^2(n),且 XXYY 相互独立,则称随机变量 T=XY/nT = \frac{X}{\sqrt{Y/n}} 所服从的分布为自由度为 nn 的 t 分布,记为 Tt(n)T \sim t(n)

性质

  1. 图形特征:t分布是关于 t=0t=0 对称的尖峰厚尾分布。其密度曲线形状类似标准正态分布,但尾部更厚,即极端值出现的概率高于正态分布。
  2. 极限性质:当自由度 nn \to \infty 时,t分布 t(n)t(n) 收敛于标准正态分布 N(0,1)N(0,1)。因此,当 nn 较大时(如 n>30n > 30),常用正态分布近似t分布。
  3. 与F分布的关系:若 Tt(n)T \sim t(n),则 T2F(1,n)T^2 \sim F(1, n)

分位数:由于t分布对称,其上 α\alpha 分位数 tα(n)t_{\alpha}(n) 满足 P(T>tα(n))=αP(T > t_{\alpha}(n)) = \alpha。由对称性可知,t1α(n)=tα(n)t_{1-\alpha}(n) = -t_{\alpha}(n)

F分布

定义:设 Xχ2(m)X \sim \chi^2(m)Yχ2(n)Y \sim \chi^2(n),且 XXYY 相互独立,则称随机变量 F=X/mY/nF = \frac{X/m}{Y/n} 所服从的分布为第一自由度为 mm、第二自由度为 nn 的 F 分布,记为 FF(m,n)F \sim F(m, n)

性质

  1. 倒数性质:若 FF(m,n)F \sim F(m, n),则 1FF(n,m)\frac{1}{F} \sim F(n, m)
  2. 分位数关系:由倒数性质可推导出分位数关系:F1α(m,n)=1Fα(n,m)F_{1-\alpha}(m, n) = \frac{1}{F_{\alpha}(n, m)}
  3. 与其他分布的联系
    • Tt(n)T \sim t(n),则 T2F(1,n)T^2 \sim F(1, n)
    • Xχ2(n)X \sim \chi^2(n),则 XΓ(n2,12)X \sim \Gamma(\frac{n}{2}, \frac{1}{2})(见下文伽马分布)。

应用:F分布在方差分析(ANOVA)、两正态总体方差比的假设检验中起到核心作用。

三大分布的抽样分布定理回顾

三大分布常出现在以下经典抽样分布定理中,这些定理是统计推断的直接工具:

  1. 单正态总体:设 X1,,Xni.i.d.N(μ,σ2)X_1, \ldots, X_n \stackrel{\text{i.i.d.}}{\sim} N(\mu, \sigma^2),样本均值 Xˉ=1nXi\bar{X} = \frac{1}{n}\sum X_i,样本方差 S2=1n1(XiXˉ)2S^2 = \frac{1}{n-1}\sum (X_i - \bar{X})^2,则
    • (n1)S2σ2χ2(n1)\frac{(n-1)S^2}{\sigma^2} \sim \chi^2(n-1)
    • XˉμS/nt(n1)\frac{\bar{X} - \mu}{S/\sqrt{n}} \sim t(n-1)
  2. 两独立正态总体:设 X1,,Xmi.i.d.N(μ1,σ12)X_1, \ldots, X_m \stackrel{\text{i.i.d.}}{\sim} N(\mu_1, \sigma_1^2)Y1,,Yni.i.d.N(μ2,σ22)Y_1, \ldots, Y_n \stackrel{\text{i.i.d.}}{\sim} N(\mu_2, \sigma_2^2),且两组样本独立。
    • 方差比:若 σ12=σ22\sigma_1^2 = \sigma_2^2,则 S12S22F(m1,n1)\frac{S_1^2}{S_2^2} \sim F(m-1, n-1)
    • 均值差(方差相等时):(XˉYˉ)(μ1μ2)Sw1m+1nt(m+n2)\frac{(\bar{X} - \bar{Y}) - (\mu_1 - \mu_2)}{S_w \sqrt{\frac{1}{m} + \frac{1}{n}}} \sim t(m+n-2),其中 Sw2=(m1)S12+(n1)S22m+n2S_w^2 = \frac{(m-1)S_1^2 + (n-1)S_2^2}{m+n-2}

分布族与伽马分布族

分布族的概念

一个分布族是由一个确定的分布形式及其参数空间构成的集合。它描述了一类具有相同数学形式、但参数不同的概率分布。

  • 二项分布族{B(n,p):0<p<1}{B(n, p): 0 < p < 1}。对于固定的 nn,不同的成功概率 pp 构成了一个分布族。
  • 泊松分布族{P(λ):λ>0}{P(\lambda): \lambda > 0}
  • 正态分布族{N(μ,σ2):μR,σ2>0}{N(\mu, \sigma^2): \mu \in \mathbb{R}, \sigma^2 > 0}

伽马分布族

伽马分布族是一个非常重要的连续分布族,它包含指数分布和卡方分布作为其特例,在贝叶斯统计、可靠性理论中有广泛应用。

定义:若随机变量 XX 的概率密度函数为 f(x;α,λ)=λαΓ(α)xα1eλx,x>0f(x; \alpha, \lambda) = \frac{\lambda^{\alpha}}{\Gamma(\alpha)} x^{\alpha-1} e^{-\lambda x}, \quad x > 0 其中 α>0\alpha > 0形状参数λ>0\lambda > 0率参数(rate 参数,越大密度衰减越快;1/λ1/\lambda 才是尺度参数), Γ(α)\Gamma(\alpha) 是伽马函数 Γ(α)=0tα1etdt\Gamma(\alpha) = \int_0^{\infty} t^{\alpha-1} e^{-t} dt,则称 XX 服从参数为 (α,λ)(\alpha, \lambda) 的伽马分布,记为 XΓ(α,λ)X \sim \Gamma(\alpha, \lambda)

特例

  1. 指数分布:当形状参数 α=1\alpha = 1 时,Γ(1,λ)\Gamma(1, \lambda) 即为参数为 λ\lambda 的指数分布 Exp(λ)Exp(\lambda)
  2. 卡方分布:当形状参数 α=n/2\alpha = n/2,率参数 λ=1/2\lambda = 1/2 时,Γ(n/2,1/2)\Gamma(n/2, 1/2) 即为自由度为 nn 的卡方分布 χ2(n)\chi^2(n)

数字特征:若 XΓ(α,λ)X \sim \Gamma(\alpha, \lambda),则 E(X)=αλ,Var(X)=αλ2.E(X) = \frac{\alpha}{\lambda}, \quad Var(X) = \frac{\alpha}{\lambda^2}.kk 阶原点矩为 E(Xk)=Γ(α+k)λkΓ(α)E(X^k) = \frac{\Gamma(\alpha+k)}{\lambda^k \Gamma(\alpha)}

可加性:伽马分布具有非常重要的可加性。设 XΓ(α1,λ)X \sim \Gamma(\alpha_1, \lambda)YΓ(α2,λ)Y \sim \Gamma(\alpha_2, \lambda),且 XXYY 相互独立,则 X+YΓ(α1+α2,λ).X + Y \sim \Gamma(\alpha_1 + \alpha_2, \lambda). 证明思路(特征函数法): 伽马分布 Γ(α,λ)\Gamma(\alpha, \lambda) 的特征函数为 ϕ(t)=(1itλ)α\phi(t) = (1 - \frac{it}{\lambda})^{-\alpha}。 由于 XXYY 独立,其和的特征函数为两者特征函数之积: ϕX+Y(t)=ϕX(t)ϕY(t)=(1itλ)α1(1itλ)α2=(1itλ)(α1+α2).\phi_{X+Y}(t) = \phi_X(t) \phi_Y(t) = (1 - \frac{it}{\lambda})^{-\alpha_1} \cdot (1 - \frac{it}{\lambda})^{-\alpha_2} = (1 - \frac{it}{\lambda})^{-(\alpha_1+\alpha_2)}. 这正是 Γ(α1+α2,λ)\Gamma(\alpha_1+\alpha_2, \lambda) 分布的特征函数。由特征函数与分布的一一对应关系,即证得可加性。

推论:卡方分布的可加性是其直接推论。因为 χ2(m)Γ(m/2,1/2)\chi^2(m) \sim \Gamma(m/2, 1/2)χ2(n)Γ(n/2,1/2)\chi^2(n) \sim \Gamma(n/2, 1/2),由伽马分布可加性立得 χ2(m)+χ2(n)χ2(m+n)\chi^2(m) + \chi^2(n) \sim \chi^2(m+n)

尺度变换:若 XΓ(α,λ)X \sim \Gamma(\alpha, \lambda),则对任意常数 c>0c > 0,有 cXΓ(α,λ/c)cX \sim \Gamma(\alpha, \lambda/c)。这体现了尺度参数 λ\lambda 对分布“伸缩”的影响。

📝 动手练一练

  1. 计算与验证:设 X1,X2,X3i.i.d.N(0,1)X_1, X_2, X_3 \stackrel{\text{i.i.d.}}{\sim} N(0, 1)。令 Y=X12+X22+X32Y = X_1^2 + X_2^2 + X_3^2

    • (a) 根据定义,YY 服从什么分布?其自由度为多少?
    • (b) 计算 P(Y>7.815)P(Y > 7.815)P(Y<0.352)P(Y < 0.352) 的近似值。(提示:查阅卡方分布表或使用统计软件)
    • (c) 使用 Python 模拟生成10000个 YY 的观测值,计算其样本均值和样本方差,并与卡方分布的理论期望、方差进行比较。
  2. 性质理解:已知 Tt(10)T \sim t(10)

    • (a) 利用 t 分布与 F 分布的关系,判断 T2T^2 服从什么分布?写出其自由度。
    • (b) 若已知 t0.05(10)=1.812t_{0.05}(10) = 1.812,利用对称性求 t0.95(10)t_{0.95}(10) 的值。
    • (c) 求 P(T2>(1.812)2)P(T^2 > (1.812)^2) 的概率。

参考答案

  1. (a) Yχ2(3)Y \sim \chi^2(3)。 (b) P(Y>7.815)0.05P(Y > 7.815) \approx 0.05P(Y<0.352)0.05P(Y < 0.352) \approx 0.05。(此为 χ2(3)\chi^2(3) 的上、下0.05分位数) (c) 模拟代码及结果见下。
  2. (a) T2F(1,10)T^2 \sim F(1, 10)。 (b) t0.95(10)=t0.05(10)=1.812t_{0.95}(10) = -t_{0.05}(10) = -1.812。 (c) P(T2>(1.812)2)=P(T>1.812)+P(T<1.812)=0.05+0.05=0.1P(T^2 > (1.812)^2) = P(T > 1.812) + P(T < -1.812) = 0.05 + 0.05 = 0.1
import numpy as np
from scipy import stats
import matplotlib.pyplot as plt

# 设置随机种子,保证结果可复现
np.random.seed(321)

# 1.(c) 模拟验证卡方分布的性质
n_sim = 10000
n = 3  # 自由度
# 生成标准正态随机样本 (n_sim x n 的矩阵)
X = np.random.randn(n_sim, n)
# 计算每个样本的 Y = sum(X_i^2)
Y_sim = np.sum(X**2, axis=1)

# 计算样本均值和方差
sample_mean = np.mean(Y_sim)
sample_var = np.var(Y_sim, ddof=1)  # 无偏样本方差

# 理论值
theory_mean = n  # E(Y) = n
theory_var = 2 * n  # Var(Y) = 2n

print(f"模拟结果(自由度 n={n}, 模拟次数 {n_sim}):")
print(f"样本均值: {sample_mean:.4f}, 理论期望: {theory_mean}")
print(f"样本方差: {sample_var:.4f}, 理论方差: {theory_var}")
print(f"均值绝对误差: {abs(sample_mean - theory_mean):.4f}")
print(f"方差绝对误差: {abs(sample_var - theory_var):.4f}")

# 可视化:比较模拟数据的直方图与理论密度曲线
fig, ax = plt.subplots(1, 1, figsize=(8, 5))
# 绘制模拟数据直方图
ax.hist(Y_sim, bins=50, density=True, alpha=0.6, color='skyblue', edgecolor='black', label='模拟数据直方图')
# 绘制理论密度曲线
x = np.linspace(stats.chi2.ppf(0.001, n), stats.chi2.ppf(0.999, n), 1000)
ax.plot(x, stats.chi2.pdf(x, n), 'r-', lw=2, label=f'理论密度 χ²({n})')
ax.set_xlabel('Y')
ax.set_ylabel('概率密度')
ax.set_title(f'卡方分布 χ²({n}) 的模拟验证')
ax.legend()
ax.grid(True, linestyle='--', alpha=0.5)
plt.tight_layout()
plt.show()

# 2.(c) 计算概率验证
t_critical = 1.812
df_t = 10
# 计算 P(T^2 > (1.812)^2) = P(|T| > 1.812)
prob_tail = 2 * (1 - stats.t.cdf(t_critical, df_t))  # 双侧概率
print(f"\n对于 t(10) 分布:")
print(f"P(T > {t_critical}) = {1 - stats.t.cdf(t_critical, df_t):.4f}")
print(f"P(|T| > {t_critical}) = P(T^2 > {t_critical**2:.4f}) = {prob_tail:.4f}")
# 使用F分布验证
prob_f = 1 - stats.f.cdf(t_critical**2, 1, df_t)
print(f"使用 F(1,10) 分布计算: P(F > {t_critical**2:.4f}) = {prob_f:.4f}")
print(f"两种方法结果一致: {np.isclose(prob_tail, prob_f)}")

本章小结

本节深入探讨了数理统计的核心分布理论与分布族概念。

要点回顾

  1. 三大抽样分布:卡方分布、t分布和F分布是统计推断的支柱。它们均由正态分布样本构造而来,其定义、性质(如可加性、对称性、尖峰厚尾)和分位数必须熟练掌握。
  2. 分布族:理解分布族是“分布+参数空间”的集合,它让我们能以统一的视角看待一类统计模型。
  3. 伽马分布族:这是一个强大的统一框架。其密度函数由形状参数 α\alpha 和尺度参数 λ\lambda 决定。指数分布 (α=1\alpha=1) 和卡方分布 (α=n/2,λ=1/2\alpha=n/2, \lambda=1/2) 是其特例。伽马分布的可加性是其核心性质,常用特征函数法证明,并直接导出卡方分布的可加性。

行动清单

  1. 动手推导:根据t分布和F分布的定义,自行推导 T2F(1,n)T^2 \sim F(1, n) 这一重要关系。
  2. 软件实操:使用 scipy.stats 模块中的 chi2, t, f, gamma 等函数,熟练计算这些分布的概率密度、累积概率、分位数,并像示例代码一样进行抽样模拟验证。
  3. 建立联系:画一张思维导图,将正态分布、标准正态分布、卡方分布、t分布、F分布、伽马分布、指数分布之间的包含与诱导关系清晰地呈现出来,深化对分布体系的理解。

— 小象教研组

配套学习资源与课件
  • 第1章课件:统计量与抽样分布(PPT · 6.0MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问