← 返回《数据科学的统计基础》
📑 查看全课大纲(第 13 / 41 节)

CR不等式及有效估计

约 46 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

CR 不等式与有效估计

小象实战讲义 · 数据科学的统计基础

在点估计中,我们追求“好”的估计量。上一节我们学习了如何通过充分完备统计量构造一致最小方差无偏估计(UMVUE)。然而,这种方法有时计算复杂。本节将介绍另一种强大的工具——CR不等式(Cramér-Rao不等式),它为无偏估计的方差设定了一个理论下界。掌握它,我们不仅能判断一个无偏估计是否“足够好”,还能在特定条件下直接验证其是否为UMVUE,并理解估计效率的量化标准。

💡 核心导读

  • CR不等式:在正则分布族的条件下,它为参数任意无偏估计的方差提供了一个明确的下界,这个下界由样本量、Fisher信息量和待估函数的变化率共同决定。
  • Fisher信息量:一个衡量总体分布本身所含参数信息多少的核心概念,是CR下界的关键组成部分。
  • 有效估计:如果一个无偏估计的方差恰好达到CR下界,则称其为有效估计,它必然是UMVUE。
  • 应用与验证:我们将学习如何利用CR不等式验证常见分布(如泊松分布、指数分布)中估计量的有效性,并理解其前提条件(正则分布族)的重要性。

正则分布族与Fisher信息量

在介绍CR不等式之前,我们必须明确其成立的前提条件——正则分布族。这是一个满足一系列“良好”性质的分布族,使得我们可以对密度函数进行求导、积分交换等操作。许多常见分布,如正态分布、泊松分布、指数分布等,都属于正则分布族。

定义(正则分布族):设单参数分布族 F={f(x;θ):θΘ}\mathscr{F} = { f(x; \theta): \theta \in \Theta },若满足以下五个条件,则称其为Cramér-Rao正则分布族

  1. 参数空间 Θ\Theta 是直线上的一个开区间。
  2. 密度函数 f(x;θ)f(x; \theta) 关于 θ\theta 的偏导数 f(x;θ)θ\frac{\partial f(x; \theta)}{\partial \theta} 存在。
  3. 分布的支撑集 {x:f(x;θ)>0}{x: f(x; \theta) > 0} 与参数 θ\theta 无关。
  4. 对密度函数的积分与对 θ\theta 的求导运算可交换次序,即: θf(x;θ)dx=f(x;θ)θdx.\frac{\partial}{\partial \theta} \int f(x; \theta) dx = \int \frac{\partial f(x; \theta)}{\partial \theta} dx.
  5. Fisher信息量 I(θ)I(\theta) 存在且有限。

其中,Fisher信息量 I(θ)I(\theta) 是衡量总体分布所含参数信息多少的核心指标,其定义为: I(θ)=Eθ[(lnf(X;θ)θ)2].I(\theta) = E_{\theta} \left[ \left( \frac{\partial \ln f(X; \theta)}{\partial \theta} \right)^2 \right]. 这里,lnf(X;θ)θ\frac{\partial \ln f(X; \theta)}{\partial \theta} 称为得分函数。可以证明,在正则条件下,得分函数的期望为0,即 Eθ[lnf(X;θ)θ]=0E_{\theta} \left[ \frac{\partial \ln f(X; \theta)}{\partial \theta} \right] = 0。因此,Fisher信息量 I(θ)I(\theta) 也等于得分函数的方差。

Fisher信息量还有另一个等价的计算公式,有时更为方便: I(θ)=Eθ[2lnf(X;θ)θ2].I(\theta) = -E_{\theta} \left[ \frac{\partial^2 \ln f(X; \theta)}{\partial \theta^2} \right]. 直观上,I(θ)I(\theta) 越大,意味着总体分布中包含的关于 θ\theta 的信息越多,我们理论上就能做出更精确(方差更小)的估计。

Cramér-Rao不等式(信息不等式)

现在,我们给出点估计理论中一个里程碑式的结果。

定理(Cramér-Rao不等式):设 X1,X2,,XnX_1, X_2, \dots, X_n 是来自正则分布族 F={f(x;θ):θΘ}\mathscr{F} = { f(x; \theta): \theta \in \Theta } 的独立同分布样本。g(θ)g(\theta)θ\theta 的可微函数。T=T(X1,,Xn)T = T(X_1, \dots, X_n)g(θ)g(\theta) 的一个无偏估计,即 Eθ(T)=g(θ)E_{\theta}(T) = g(\theta),且 TT 满足积分与求导可交换的条件。则 TT 的方差满足: Varθ(T)[g(θ)]2nI(θ).\operatorname{Var}_{\theta}(T) \ge \frac{[g’(\theta)]^2}{n I(\theta)}. 其中,g(θ)g’(\theta)g(θ)g(\theta) 关于 θ\theta 的导数,I(θ)I(\theta) 是单个观测的Fisher信息量。不等式右端 [g(θ)]2nI(θ)\frac{[g’(\theta)]^2}{n I(\theta)} 称为 Cramér-Rao下界(CR下界)

证明思路

  1. 定义样本的联合得分函数 S(X;θ)=θlni=1nf(Xi;θ)=i=1nlnf(Xi;θ)θS(\mathbf{X}; \theta) = \frac{\partial}{\partial \theta} \ln \prod_{i=1}^n f(X_i; \theta) = \sum_{i=1}^n \frac{\partial \ln f(X_i; \theta)}{\partial \theta}
  2. 利用正则条件,可证 Eθ[S]=0E_{\theta}[S] = 0,且 Varθ(S)=nI(θ)\operatorname{Var}_{\theta}(S) = n I(\theta)
  3. 计算 TTSS 的协方差:Covθ(T,S)=Eθ[(Tg(θ))S]=g(θ)\operatorname{Cov}{\theta}(T, S) = E{\theta}[(T - g(\theta))S] = g’(\theta)
  4. 由柯西-施瓦茨不等式 [Cov(T,S)]2Var(T)Var(S)[\operatorname{Cov}(T, S)]^2 \le \operatorname{Var}(T) \cdot \operatorname{Var}(S),代入即得: [g(θ)]2Varθ(T)nI(θ).[g’(\theta)]^2 \le \operatorname{Var}_{\theta}(T) \cdot n I(\theta).
  5. 整理不等式,即得 Varθ(T)[g(θ)]2nI(θ)\operatorname{Var}_{\theta}(T) \ge \frac{[g’(\theta)]^2}{n I(\theta)}

定理的启示

  • 方差下界:它告诉我们,在正则条件下,无论你构造多么精巧的无偏估计,其方差都不可能低于CR下界。
  • 影响因素:下界与样本量 nn 成反比(样本越多,下界越小),与Fisher信息量 I(θ)I(\theta) 成反比(分布信息越多,下界越小),与待估函数的变化率 [g(θ)]2[g’(\theta)]^2 成正比(函数变化越剧烈,越难估计准)。
  • 达到下界的条件:当且仅当存在非零常数 k(θ)k(\theta),使得 Tg(θ)=k(θ)ST - g(\theta) = k(\theta) \cdot S 以概率1成立时,等号成立。此时 TT 的方差恰好达到CR下界。

CR不等式的应用与有效估计

CR不等式为我们提供了一种寻找或验证UMVUE的实用方法。

定义(有效估计):设 TTg(θ)g(\theta) 的一个无偏估计。定义其效率为: e(T)=CR下界Varθ(T)=[g(θ)]2nI(θ)Varθ(T).e(T) = \frac{\text{CR下界}}{\operatorname{Var}{\theta}(T)} = \frac{[g’(\theta)]^2}{n I(\theta) \operatorname{Var}{\theta}(T)}. 由于 Varθ(T)CR下界\operatorname{Var}_{\theta}(T) \ge \text{CR下界},故总有 e(T)1e(T) \le 1

  • e(T)=1e(T) = 1 对一切 θΘ\theta \in \Theta 成立,则称 TTg(θ)g(\theta)有效估计
  • limne(T)=1\lim_{n \to \infty} e(T) = 1,则称 TTg(θ)g(\theta)渐近有效估计

重要结论:若一个无偏估计 TT 是有效估计(即方差达到CR下界),则它一定是 g(θ)g(\theta) 的UMVUE。

下面我们通过两个例子来应用这个结论。

例1:泊松分布参数的估计X1,,Xni.i.d.Poisson(λ)X_1, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} \text{Poisson}(\lambda)λ>0\lambda > 0。泊松分布是正则分布族。

  1. 计算Fisher信息量:泊松分布的概率函数为 P(X=k)=eλλk/k!P(X=k) = e^{-\lambda} \lambda^k / k!,故 lnf(x;λ)=λ+xlnλln(x!)\ln f(x; \lambda) = -\lambda + x \ln \lambda - \ln(x!)lnf(x;λ)λ=1+xλ.\frac{\partial \ln f(x; \lambda)}{\partial \lambda} = -1 + \frac{x}{\lambda}. 利用公式 I(λ)=E[2lnf(X;λ)λ2]I(\lambda) = -E\left[ \frac{\partial^2 \ln f(X; \lambda)}{\partial \lambda^2} \right],有 2lnf(x;λ)λ2=xλ2\frac{\partial^2 \ln f(x; \lambda)}{\partial \lambda^2} = -\frac{x}{\lambda^2},故 I(λ)=E[Xλ2]=E[X]λ2=λλ2=1λ.I(\lambda) = -E\left[ -\frac{X}{\lambda^2} \right] = \frac{E[X]}{\lambda^2} = \frac{\lambda}{\lambda^2} = \frac{1}{\lambda}.
  2. 考虑估计 g(λ)=λg(\lambda) = \lambda。其导数为 g(λ)=1g’(\lambda)=1。CR下界为 [g(λ)]2nI(λ)=1n(1/λ)=λn\frac{[g’(\lambda)]^2}{n I(\lambda)} = \frac{1}{n \cdot (1/\lambda)} = \frac{\lambda}{n}
  3. 样本均值 Xˉ=1ni=1nXi\bar{X} = \frac{1}{n}\sum_{i=1}^n X_iλ\lambda 的无偏估计,且其方差 Var(Xˉ)=λn\operatorname{Var}(\bar{X}) = \frac{\lambda}{n}
  4. 由于 Var(Xˉ)\operatorname{Var}(\bar{X}) 恰好等于CR下界 λn\frac{\lambda}{n},因此 Xˉ\bar{X}λ\lambda 的有效估计,从而也是 λ\lambda 的UMVUE。

例2:指数分布尺度参数倒数的估计X1,,Xni.i.d.Exp(λ)X_1, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} \text{Exp}(\lambda),密度为 f(x;λ)=λeλx,x>0f(x;\lambda) = \lambda e^{-\lambda x}, x>0。指数分布是正则分布族。

  1. 考虑估计 g(λ)=1/λg(\lambda) = 1/\lambda(即分布的均值)。
  2. 计算Fisher信息量:lnf(x;λ)=lnλλx\ln f(x; \lambda) = \ln \lambda - \lambda xlnf(x;λ)λ=1λx,2lnf(x;λ)λ2=1λ2.\frac{\partial \ln f(x; \lambda)}{\partial \lambda} = \frac{1}{\lambda} - x, \quad \frac{\partial^2 \ln f(x; \lambda)}{\partial \lambda^2} = -\frac{1}{\lambda^2}.I(λ)=E[1λ2]=1λ2I(\lambda) = -E\left[ -\frac{1}{\lambda^2} \right] = \frac{1}{\lambda^2}
  3. g(λ)=1/λ2g’(\lambda) = -1/\lambda^2,CR下界为 [g(λ)]2nI(λ)=(1/λ4)n(1/λ2)=1nλ2\frac{[g’(\lambda)]^2}{n I(\lambda)} = \frac{(1/\lambda^4)}{n \cdot (1/\lambda^2)} = \frac{1}{n \lambda^2}
  4. 样本均值 Xˉ\bar{X}1/λ1/\lambda 的无偏估计。由于 i=1nXiGamma(n,λ)\sum_{i=1}^n X_i \sim \text{Gamma}(n, \lambda),故 Var(Xˉ)=Var(X1)/n=(1/λ2)/n=1nλ2\operatorname{Var}(\bar{X}) = \operatorname{Var}(X_1)/n = (1/\lambda^2)/n = \frac{1}{n \lambda^2}
  5. Var(Xˉ)\operatorname{Var}(\bar{X}) 等于CR下界,因此 Xˉ\bar{X}1/λ1/\lambda 的有效估计,也是其UMVUE。

⚠️ 重要提醒:正则条件必须满足 CR不等式的应用前提是总体属于正则分布族。如果前提不满足,盲目套用公式可能导致错误结论。 一个典型的反例是均匀分布 U(0,θ)U(0, \theta)。其支撑集 {x:0<x<θ}{x: 0 < x < \theta} 依赖于参数 θ\theta,不满足正则条件3。如果强行计算,会得到CR下界为 θ2/n\theta^2/n,而 θ\theta 的UMVUE(如 (n+1)X(n)/n(n+1)X_{(n)}/n 的方差约为 θ2/n2\theta^2/n^2)实际上远小于这个“下界”。这并不矛盾,只是因为均匀分布不属于正则分布族,CR不等式在此不适用。

import numpy as np
from scipy import stats
import matplotlib.pyplot as plt

# 设置随机种子保证可复现
np.random.seed(42)

# 例1:验证泊松分布样本均值的方差达到CR下界
lambda_true = 5.0
n = 30
sample_size = 10000  # 模拟次数

# 模拟多次抽样,计算样本均值的方差
sample_means = []
for _ in range(sample_size):
    sample = stats.poisson.rvs(mu=lambda_true, size=n)
    sample_means.append(np.mean(sample))

# 计算模拟方差
simulated_var = np.var(sample_means, ddof=1)
# 理论方差(也是CR下界)
theoretical_var = lambda_true / n
# 计算Fisher信息量(单个观测)
I_lambda = 1 / lambda_true
# 计算CR下界公式
cr_lower_bound = 1 / (n * I_lambda)  # 因为 g(theta)=theta, g'(theta)=1

print("=== 泊松分布参数估计验证 ===")
print(f"真实参数 λ = {lambda_true}")
print(f"样本量 n = {n}")
print(f"Fisher信息量 I(λ) = {I_lambda:.4f}")
print(f"CR下界 = {cr_lower_bound:.4f}")
print(f"样本均值的理论方差 = {theoretical_var:.4f}")
print(f"样本均值的模拟方差 = {simulated_var:.4f}")
print(f"效率 (CR下界/模拟方差) = {cr_lower_bound / simulated_var:.4f}")

# 例2:验证均匀分布不属于正则族,其UMVUE方差可能“突破”CR下界
theta_true = 10.0
n_unif = 10

# 均匀分布UMVUE: (n+1)/n * X_(n)
def umvue_uniform(sample):
    return ((len(sample) + 1) / len(sample)) * np.max(sample)

# 模拟
umvue_estimates = []
for _ in range(sample_size):
    sample_unif = stats.uniform.rvs(loc=0, scale=theta_true, size=n_unif)
    umvue_estimates.append(umvue_uniform(sample_unif))

simulated_var_umvue = np.var(umvue_estimates, ddof=1)
# 均匀分布UMVUE的近似理论方差 (精确公式: θ^2 / (n(n+2)))
approx_theoretical_var_umvue = theta_true**2 / (n_unif * (n_unif + 2))
# **错误地**计算均匀分布的“CR下界”(前提不满足!)
# 对于U(0,θ),若强行求导,可得 I(θ) = 1/θ^2, g'(θ)=1, 故“CR下界” = θ^2 / n
fake_cr_bound = theta_true**2 / n_unif

print("\n=== 均匀分布(非正则族)警示案例 ===")
print(f"真实参数 θ = {theta_true}")
print(f"样本量 n = {n_unif}")
print(f"UMVUE的模拟方差 = {simulated_var_umvue:.4f}")
print(f"UMVUE的近似理论方差 ≈ {approx_theoretical_var_umvue:.4f}")
print(f"**错误计算的‘CR下界’** = {fake_cr_bound:.4f}")
print(f"注意:UMVUE方差 ({simulated_var_umvue:.4f}) < ‘CR下界’ ({fake_cr_bound:.4f})")
print("这正说明了均匀分布不满足CR不等式的正则条件,该‘下界’无效。")

📝 动手练一练

  1. 验证正态分布均值的估计:设 X1,,Xni.i.d.N(μ,σ2)X_1, \dots, X_n \stackrel{\text{i.i.d.}}{\sim} N(\mu, \sigma^2),其中 σ2\sigma^2 已知。

    • (a) 计算关于参数 μ\mu 的Fisher信息量 I(μ)I(\mu)
    • (b) 写出估计 g(μ)=μg(\mu) = \mu 的CR下界。
    • (c) 样本均值 Xˉ\bar{X} 是否为 μ\mu 的有效估计?请验证。
  2. 考察二项分布:设 XBinomial(m,p)X \sim \text{Binomial}(m, p),其中 mm 已知,pp 为未知参数。

    • (a) 验证二项分布(视为单参数 pp 的分布族)是正则分布族。
    • (b) 计算Fisher信息量 I(p)I(p)
    • (c) 对于样本 XX(这里 n=1n=1),估计 g(p)=pg(p)=pX/mX/mpp 的无偏估计吗?它的方差是否达到CR下界?

参考答案:

  1. (a) f(x;μ)=12πσe(xμ)22σ2f(x;\mu) = \frac{1}{\sqrt{2\pi}\sigma} e^{-\frac{(x-\mu)^2}{2\sigma^2}}lnfμ=xμσ2\frac{\partial \ln f}{\partial \mu} = \frac{x-\mu}{\sigma^2},故 I(μ)=Var(Xμσ2)=1σ4Var(X)=1σ2I(\mu) = \operatorname{Var}\left(\frac{X-\mu}{\sigma^2}\right) = \frac{1}{\sigma^4}\operatorname{Var}(X) = \frac{1}{\sigma^2}。 (b) g(μ)=1g’(\mu)=1,CR下界为 1nI(μ)=σ2n\frac{1}{n I(\mu)} = \frac{\sigma^2}{n}。 (c) Xˉ\bar{X}μ\mu 的无偏估计,且 Var(Xˉ)=σ2n\operatorname{Var}(\bar{X}) = \frac{\sigma^2}{n},等于CR下界,因此 Xˉ\bar{X}μ\mu 的有效估计(也是UMVUE)。

  2. (a) 支撑集 {0,1,,m}{0,1,\dots,m}pp 无关,概率函数 P(X=k)=(mk)pk(1p)mkP(X=k) = \binom{m}{k} p^k (1-p)^{m-k} 关于 pp 可导,积分(求和)与求导可交换,Fisher信息量存在,故满足正则条件。 (b) lnP(X=k)=常数+klnp+(mk)ln(1p)\ln P(X=k) = \text{常数} + k \ln p + (m-k)\ln(1-p)lnPp=kpmk1p\frac{\partial \ln P}{\partial p} = \frac{k}{p} - \frac{m-k}{1-p}2lnPp2=kp2mk(1p)2\frac{\partial^2 \ln P}{\partial p^2} = -\frac{k}{p^2} - \frac{m-k}{(1-p)^2}。利用 E[k]=mpE[k] = mp,得 I(p)=E[2lnPp2]=mp(1p)I(p) = -E\left[\frac{\partial^2 \ln P}{\partial p^2}\right] = \frac{m}{p(1-p)}。 (c) E[X/m]=pE[X/m] = p,是无偏估计。Var(X/m)=p(1p)m\operatorname{Var}(X/m) = \frac{p(1-p)}{m}g(p)=pg(p)=pg(p)=1g’(p)=1,CR下界(n=1n=1)为 1I(p)=p(1p)m\frac{1}{I(p)} = \frac{p(1-p)}{m}。方差等于CR下界,因此 X/mX/mpp 的有效估计。

本章小结

本节深入探讨了评价估计量优良性的一个重要理论工具——Cramér-Rao不等式。

  • 核心定理:在正则分布族条件下,任何无偏估计的方差都有一个明确的下限(CR下界),该下界由样本量、Fisher信息量和待估函数的变化率决定。
  • 关键概念Fisher信息量量化了总体分布本身所蕴含的参数信息量,是决定估计精度理论极限的核心因素。
  • 重要应用:若一个无偏估计的方差恰好达到CR下界,则它是有效估计,并且必然是一致最小方差无偏估计(UMVUE)。这为我们验证UMVUE提供了一条捷径(如泊松分布的 Xˉ\bar{X}λ\lambda 的估计)。
  • 前提警示:必须严格检查总体是否属于正则分布族。均匀分布 U(0,θ)U(0,\theta) 是一个经典的反例,提醒我们不可滥用CR不等式。

行动清单

  1. 判断与计算:面对一个估计问题,首先判断总体分布是否为正则族。若是,尝试计算其Fisher信息量和待估参数的CR下界。
  2. 验证有效性:对于已有的无偏估计(如样本均值、样本方差),计算其方差并与CR下界比较,判断其是否为有效估计或UMVUE。
  3. 代码实践:使用Python的scipy.stats模块模拟不同分布下的估计过程,直观感受样本量、Fisher信息量对估计方差的影响,并验证理论公式。

— 小象教研组

配套学习资源与课件
  • 第2章课件:点估计(PDF · 4.4MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问