← 返回《数据科学的统计基础》
📑 查看全课大纲(第 7 / 41 节)

统计中常用分布族(二)

约 8 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

贝塔分布与指数型分布族

小象实战讲义 · 数据科学的统计基础

在掌握了伽马分布等常用分布族后,本节将介绍另外两个在统计推断中扮演重要角色的分布族:贝塔分布族和指数型分布族。贝塔分布是定义在(0,1)区间上的重要分布,常用于描述比例或概率的随机性。指数型分布族则是一个庞大的分布类别,它包含了正态分布、二项分布、泊松分布等众多常见分布。理解指数型分布族的统一结构,将为后续学习参数估计中的充分完备统计量、一致最小方差无偏估计等高级理论奠定坚实基础。

💡 核心导读

  • 贝塔分布:掌握其定义在(0,1)区间上的密度函数形式,理解其形状参数α和β如何影响分布形态,并能计算其期望与方差。
  • 次序统计量与贝塔分布:理解均匀分布样本的次序统计量服从贝塔分布,并能利用此性质快速计算次序统计量的期望。
  • 指数型分布族:掌握其统一的密度函数/分布列形式,理解其构成要素(自然参数、充分统计量、基准测度、对数配分函数)。
  • 常见分布的归属:能够验证正态分布、二项分布等常见分布属于指数型分布族,并写出其对应的自然参数和充分统计量。
  • 指数族的重要性:了解指数型分布族在统计推断中的核心优势——便于寻找充分完备统计量,进而构建最优估计。

贝塔分布族

贝塔分布族是定义在区间(0,1)上的连续概率分布族,它由两个正实数参数α和β(常写作aabb)控制,在贝叶斯统计、顺序统计量和可靠性分析中应用广泛。

定义与密度函数

若随机变量XX的概率密度函数具有如下形式: f(x;α,β)=Γ(α+β)Γ(α)Γ(β)xα1(1x)β1,0<x<1f(x; \alpha, \beta) = \frac{\Gamma(\alpha+\beta)}{\Gamma(\alpha)\Gamma(\beta)} x^{\alpha-1} (1-x)^{\beta-1}, \quad 0 < x < 1 其中α>0,β>0\alpha > 0, \beta > 0为形状参数,Γ()\Gamma(\cdot)是伽马函数,则称XX服从参数为(α,β)(\alpha, \beta)的贝塔分布,记为XBeta(α,β)X \sim \text{Beta}(\alpha, \beta)

密度函数中的归一化常数由贝塔函数B(α,β)B(\alpha, \beta)给出: B(α,β)=Γ(α)Γ(β)Γ(α+β)=01tα1(1t)β1dtB(\alpha, \beta) = \frac{\Gamma(\alpha)\Gamma(\beta)}{\Gamma(\alpha+\beta)} = \int_0^1 t^{\alpha-1}(1-t)^{\beta-1} dt 因此,密度函数也可写作f(x;α,β)=1B(α,β)xα1(1x)β1f(x; \alpha, \beta) = \frac{1}{B(\alpha, \beta)} x^{\alpha-1} (1-x)^{\beta-1}

特例、期望与方差

一个重要的特例是当α=β=1\alpha = \beta = 1时: f(x;1,1)=Γ(2)Γ(1)Γ(1)x0(1x)0=1,0<x<1f(x; 1, 1) = \frac{\Gamma(2)}{\Gamma(1)\Gamma(1)} x^{0} (1-x)^{0} = 1, \quad 0 < x < 1 此时贝塔分布退化为(0,1)区间上的均匀分布。

贝塔分布的期望和方差公式如下(虽不要求强记,但需理解其推导源于密度函数的积分性质): E(X)=αα+βVar(X)=αβ(α+β)2(α+β+1)\begin{aligned} E(X) &= \frac{\alpha}{\alpha + \beta} \[4pt] \text{Var}(X) &= \frac{\alpha\beta}{(\alpha+\beta)^2(\alpha+\beta+1)} \end{aligned}

贝塔分布与次序统计量

贝塔分布与均匀分布的次序统计量有紧密联系。设X1,X2,,XnX_1, X_2, \dots, X_n是来自总体U(0,1)U(0,1)的简单随机样本,X(k)X_{(k)}表示第kk个次序统计量(即第kk小的观测值)。在次序统计量的学习中我们已知,X(k)X_{(k)}的密度函数为: fX(k)(x)=n!(k1)!(nk)!xk1(1x)nk,0<x<1f_{X_{(k)}}(x) = \frac{n!}{(k-1)!(n-k)!} x^{k-1} (1-x)^{n-k}, \quad 0 < x < 1

对比贝塔分布的密度函数形式,我们可以发现: fX(k)(x)=1B(k,nk+1)xk1(1x)(nk+1)1f_{X_{(k)}}(x) = \frac{1}{B(k, n-k+1)} x^{k-1} (1-x)^{(n-k+1)-1} 这恰好是参数为α=k,β=nk+1\alpha = k, \beta = n-k+1的贝塔分布密度函数。因此,X(k)Beta(k,nk+1)X_{(k)} \sim \text{Beta}(k, n-k+1)

利用贝塔分布的期望公式,我们可以立即得到第kk个次序统计量的期望: E(X(k))=αα+β=kk+(nk+1)=kn+1E(X_{(k)}) = \frac{\alpha}{\alpha+\beta} = \frac{k}{k + (n-k+1)} = \frac{k}{n+1} 这个结论在之前学习次序统计量时是通过积分推导得出的,现在通过贝塔分布的性质可以更简洁地获得。

import numpy as np
from scipy import stats
import matplotlib.pyplot as plt

# 验证均匀分布次序统计量的期望公式
np.random.seed(42)
n = 10
k = 3
n_simulations = 10000

# 模拟:重复抽取n个均匀分布样本,取第k个次序统计量
order_stats_k = []
for _ in range(n_simulations):
    sample = np.random.uniform(0, 1, n)
    sample_sorted = np.sort(sample)
    order_stats_k.append(sample_sorted[k-1]) # 索引从0开始,第k个对应索引k-1

# 计算模拟的样本均值
simulated_mean = np.mean(order_stats_k)
# 理论期望
theoretical_mean = k / (n + 1)

print(f"模拟的 E(X_({k})): {simulated_mean:.4f}")
print(f"理论的 E(X_({k})): {theoretical_mean:.4f}")
print(f"绝对误差: {abs(simulated_mean - theoretical_mean):.6f}")

# 可视化:绘制第k个次序统计量的经验分布与理论Beta分布密度曲线
plt.figure(figsize=(10, 6))
# 经验直方图
plt.hist(order_stats_k, bins=50, density=True, alpha=0.6, color='skyblue', edgecolor='black', label=f'经验分布 (n_sim={n_simulations})')
# 理论Beta分布密度曲线
x_vals = np.linspace(0, 1, 200)
beta_pdf = stats.beta.pdf(x_vals, k, n-k+1)
plt.plot(x_vals, beta_pdf, 'r-', linewidth=2, label=f'理论 Beta({k}, {n-k+1})')
plt.title(f'U(0,1)样本的第{k}个次序统计量分布 (n={n})')
plt.xlabel('x')
plt.ylabel('概率密度')
plt.legend()
plt.grid(True, alpha=0.3)
plt.show()

指数型分布族

指数型分布族是数理统计中一个极其重要的概念,它并非指某个具体的分布,而是指一大类具有特定数学形式的概率分布所构成的集合。许多常见的参数分布都属于这个族。

定义与一般形式

考虑一个参数分布族{Pθ:θΘ}{P_\theta: \theta \in \Theta},其中ΘRk\Theta \subseteq \mathbb{R}^k是参数空间。如果分布的概率密度函数(连续情形)或概率质量函数(离散情形)可以写成如下形式: p(x;θ)=h(x)exp{i=1kηi(θ)Ti(x)A(θ)}p(x; \theta) = h(x) \exp\left{ \sum_{i=1}^{k} \eta_i(\theta) T_i(x) - A(\theta) \right} 则称该分布族为指数型分布族

其中:

  • h(x)0h(x) \ge 0:称为基准测度,仅与样本xx有关。
  • T(x)=(T1(x),,Tk(x))T(x) = (T_1(x), \dots, T_k(x)):称为充分统计量,是样本xx的函数。
  • η(θ)=(η1(θ),,ηk(θ))\eta(\theta) = (\eta_1(\theta), \dots, \eta_k(\theta)):称为自然参数典范参数,是模型参数θ\theta的函数。
  • A(θ)A(\theta):称为对数配分函数累积量生成函数,用于确保概率密度积分为1,即A(θ)=logh(x)exp{i=1kηi(θ)Ti(x)}dxA(\theta) = \log \int h(x) \exp{\sum_{i=1}^k \eta_i(\theta) T_i(x)} dx

有时也写作等价形式: p(x;θ)=c(θ)h(x)exp{i=1kηi(θ)Ti(x)}p(x; \theta) = c(\theta) h(x) \exp\left{ \sum_{i=1}^{k} \eta_i(\theta) T_i(x) \right} 其中c(θ)=exp{A(θ)}c(\theta) = \exp{-A(\theta)}

关键要求:自然参数ηi(θ)\eta_i(\theta)和充分统计量Ti(x)T_i(x)需满足T1(x),,Tk(x)T_1(x), \dots, T_k(x)是线性无关的(即不存在不全为零的常数使得它们的线性组合为常数)。

为什么重要:统计推断的便利性

指数型分布族在理论统计推断中具有核心地位,主要因为以下性质:

  1. 充分统计量易于获得:由定义可知,T(X)=(T1(X),,Tk(X))T(X) = (T_1(X), \dots, T_k(X))就是该分布族的一个充分统计量。
  2. 完备性:在许多正则条件下,指数型分布族的充分统计量T(X)T(X)也是完备的。
  3. 最优估计:结合充分性与完备性,我们可以利用Lehmann-Scheffé定理方便地找到参数的一致最小方差无偏估计。
  4. 广义线性模型的基础:指数型分布族是构建逻辑回归、泊松回归等广义线性模型的理论框架。

常见分布的例子

1. 正态分布族

XN(μ,σ2)X \sim N(\mu, \sigma^2),其密度函数为: f(x;μ,σ2)=12πσ2exp{(xμ)22σ2}f(x; \mu, \sigma^2) = \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left{ -\frac{(x-\mu)^2}{2\sigma^2} \right}

将其改写为指数族形式: f(x;μ,σ2)=exp{x22σ2+μxσ2μ22σ212log(2πσ2)}=1h(x)exp{(12σ2)η1x2T1(x)+(μσ2)η2xT2(x)(μ22σ2+12log(2πσ2))A(μ,σ2)}\begin{aligned} f(x; \mu, \sigma^2) &= \exp\left{ -\frac{x^2}{2\sigma^2} + \frac{\mu x}{\sigma^2} - \frac{\mu^2}{2\sigma^2} - \frac{1}{2}\log(2\pi\sigma^2) \right} \ &= \underbrace{1}{h(x)} \exp\left{ \underbrace{\left(-\frac{1}{2\sigma^2}\right)}{\eta_1} \underbrace{x^2}{T_1(x)} + \underbrace{\left(\frac{\mu}{\sigma^2}\right)}{\eta_2} \underbrace{x}{T_2(x)} - \underbrace{\left( \frac{\mu^2}{2\sigma^2} + \frac{1}{2}\log(2\pi\sigma^2) \right)}{A(\mu, \sigma^2)} \right} \end{aligned}

这里,自然参数为η=(12σ2,μσ2)\eta = (-\frac{1}{2\sigma^2}, \frac{\mu}{\sigma^2}),充分统计量为T(x)=(x2,x)T(x) = (x^2, x)。因此,正态分布属于指数型分布族。

2. 二项分布族

XBinomial(n,p)X \sim \text{Binomial}(n, p),其分布律为: P(X=x)=(nx)px(1p)nx,x=0,1,,nP(X=x) = \binom{n}{x} p^x (1-p)^{n-x}, \quad x=0,1,\dots,n

改写为指数族形式: P(X=x)=(nx)exp{xlogp+(nx)log(1p)}=(nx)h(x)exp{log(p1p)ηxT(x)+nlog(1p)A(p)}\begin{aligned} P(X=x) &= \binom{n}{x} \exp\left{ x \log p + (n-x) \log(1-p) \right} \ &= \underbrace{\binom{n}{x}}{h(x)} \exp\left{ \underbrace{\log\left( \frac{p}{1-p} \right)}{\eta} \underbrace{x}{T(x)} + \underbrace{n \log(1-p)}{-A(p)} \right} \end{aligned}

这里,自然参数为η=log(p1p)\eta = \log\left( \frac{p}{1-p} \right)(即logit函数),充分统计量为T(x)=xT(x)=x,对数配分函数A(p)=nlog(1p)A(p) = -n \log(1-p)。因此,二项分布也属于指数型分布族(参数nn已知)。

类似地,泊松分布、伽马分布、多项分布等众多常见分布都属于指数型分布族。这一统一的框架使得我们可以用一套通用的方法论来处理这些分布的统计推断问题。

import numpy as np
from scipy import stats
import matplotlib.pyplot as plt

# 演示:不同分布的指数族参数表示
def print_exponential_family_info(dist_name, params, sample_size=1000):
    """
    生成指定分布的样本,并验证其充分统计量的性质(通过模拟计算条件期望)。
    这里以二项分布为例,展示其充分统计量T(X)=X包含了所有关于参数p的信息。
    """
    np.random.seed(123)
    
    if dist_name == 'Binomial':
        n, p = params['n'], params['p']
        # 生成样本
        samples = np.random.binomial(n, p, sample_size)
        # 充分统计量 T(X) = X
        T = samples
        # 给定T(X)=t,样本的联合分布应与参数无关(充分性的思想验证)
        # 我们检查:对于固定的t,所有产生该t的样本序列是否等概率(在给定p下)
        t_value = int(np.median(T)) # 取一个典型的t值
        indices = np.where(T == t_value)[0]
        print(f"分布: {dist_name}(n={n}, p={p:.2f})")
        print(f"充分统计量 T(X) = X")
        print(f"观察到 T(X) = {t_value} 的样本有 {len(indices)} 个")
        if len(indices) > 0:
            # 理论上,给定T(X)=t,任何具体的样本序列(x1,...,x_n)概率都相同(与p无关)
            # 这里简单显示前几个样本值(实际上每个样本是一个标量)
            print(f"前几个使得T(X)={t_value}的样本值: {samples[indices[:5]]}")
        print("-" * 50)
        
    elif dist_name == 'Normal':
        mu, sigma = params['mu'], params['sigma']
        samples = np.random.normal(mu, sigma, sample_size)
        # 充分统计量 T(X) = (sum X_i, sum X_i^2) 或等价地 (mean, variance)
        T1 = np.sum(samples)
        T2 = np.sum(samples**2)
        print(f"分布: {dist_name}(μ={mu}, σ={sigma:.2f})")
        print(f"充分统计量 T(X) = (ΣX_i, ΣX_i^2) = ({T1:.2f}, {T2:.2f})")
        print("-" * 50)

# 演示二项分布
print_exponential_family_info('Binomial', {'n': 10, 'p': 0.3})
# 演示正态分布
print_exponential_family_info('Normal', {'mu': 5, 'sigma': 2})

# 可视化:不同自然参数下指数族分布的形状(以二项分布为例,改变p即改变自然参数η)
plt.figure(figsize=(12, 5))
n = 10
p_values = [0.2, 0.5, 0.8]
x = np.arange(0, n+1)

for i, p in enumerate(p_values):
    plt.subplot(1, 3, i+1)
    pmf = stats.binom.pmf(x, n, p)
    plt.bar(x, pmf, alpha=0.7, edgecolor='black')
    eta = np.log(p/(1-p)) # 自然参数
    plt.title(f'Bin({n}, {p}), η={eta:.2f}')
    plt.xlabel('x')
    plt.ylabel('P(X=x)')
    plt.grid(True, alpha=0.3)

plt.suptitle('二项分布:不同自然参数η(即不同p)对应的分布形态')
plt.tight_layout()
plt.show()

📝 动手练一练

  1. 贝塔分布的性质:设随机变量XBeta(α,β)X \sim \text{Beta}(\alpha, \beta)

    • a) 若α=2,β=5\alpha=2, \beta=5,计算E(X)E(X)Var(X)\text{Var}(X)
    • b) 证明:若XBeta(α,β)X \sim \text{Beta}(\alpha, \beta),则1XBeta(β,α)1-X \sim \text{Beta}(\beta, \alpha)
  2. 验证指数族:证明泊松分布P(X=x)=λxeλx!,x=0,1,2,P(X=x) = \frac{\lambda^x e^{-\lambda}}{x!}, x=0,1,2,\dots属于指数型分布族,并写出其自然参数η(λ)\eta(\lambda)、充分统计量T(x)T(x)和对数配分函数A(λ)A(\lambda)

参考答案

  1. a) E(X)=22+5=270.2857E(X) = \frac{2}{2+5} = \frac{2}{7} \approx 0.2857Var(X)=2×5(2+5)2(2+5+1)=1049×8=10392=51960.0255\text{Var}(X) = \frac{2 \times 5}{(2+5)^2(2+5+1)} = \frac{10}{49 \times 8} = \frac{10}{392} = \frac{5}{196} \approx 0.0255。 b) 令Y=1XY=1-X,则0<y<10<y<1。由变量变换公式,fY(y)=fX(1y)dxdy=1B(α,β)(1y)α1yβ11=1B(β,α)yβ1(1y)α1f_Y(y) = f_X(1-y) \left| \frac{dx}{dy} \right| = \frac{1}{B(\alpha, \beta)} (1-y)^{\alpha-1} y^{\beta-1} \cdot 1 = \frac{1}{B(\beta, \alpha)} y^{\beta-1} (1-y)^{\alpha-1},这正是Beta(β,α)\text{Beta}(\beta, \alpha)的密度函数。

  2. 泊松分布可写为:P(X=x)=1x!exp{xlogλλ}P(X=x) = \frac{1}{x!} \exp{ x \log \lambda - \lambda }。因此:

    • h(x)=1x!h(x) = \frac{1}{x!}
    • 自然参数η(λ)=logλ\eta(\lambda) = \log \lambda
    • 充分统计量T(x)=xT(x) = x
    • 对数配分函数A(λ)=λA(\lambda) = \lambda(注意:P(X=x)=h(x)exp{ηT(x)A(λ)}P(X=x) = h(x) \exp{\eta T(x) - A(\lambda)},这里A(λ)=λ-A(\lambda)=-\lambda,所以A(λ)=λA(\lambda)=\lambda

本章小结

本节深入探讨了统计推断中两个关键的分布族概念。

要点回顾

  • 贝塔分布:定义于(0,1)区间,由形状参数α和β控制,是描述比例、概率不确定性的自然选择。它与均匀分布的次序统计量有直接对应关系,这一联系简化了相关计算。
  • 指数型分布族:一个包含众多常见分布的抽象框架。其统一形式p(x;θ)=h(x)exp{η(θ)TT(x)A(θ)}p(x;\theta) = h(x)\exp{\eta(\theta)^T T(x) - A(\theta)}揭示了分布的内在结构,将自然参数、充分统计量和对数配分函数清晰地分离出来。
  • 理论与应用意义:识别一个分布属于指数族,意味着我们可以立即获得其充分统计量,并有望进一步证明其完备性。这为后续寻找一致最小方差无偏估计等最优统计决策提供了强大的理论工具。正态分布、二项分布、泊松分布等都是指数族的成员。

行动清单

  1. 动手验证:使用Python的scipy.stats模块,分别生成贝塔分布和均匀分布次序统计量的样本,验证它们的分布一致性。
  2. 形式改写练习:任选一个已知分布(如指数分布Exp(λ)Exp(\lambda)),尝试将其概率密度函数改写成指数型分布族的标准形式,并指出各组成部分。
  3. 建立联系:回顾充分统计量的因子分解定理,思考指数型分布族的形式如何天然地满足了该定理的条件,从而理解T(X)T(X)为什么是充分的。

— 小象教研组

配套学习资源与课件
  • 第1章课件:统计量与抽样分布(PPT · 6.0MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问