← 返回《数据科学的统计基础》
📑 查看全课大纲(第 18 / 41 节)

Fisher显著性检验

约 50 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

Fisher显著性检验

小象实战讲义 · 数据科学的统计基础

假设检验是统计推断的核心支柱之一,它为我们提供了一套严谨的框架,用于基于样本数据对关于总体的某个命题(假设)做出判断。本节作为假设检验的入门,我们将聚焦于由R.A. Fisher提出的显著性检验思想。通过经典的“女士品茶”实验,你将直观理解假设检验的推理逻辑、核心概念(如原假设、拒绝域、p值思想)以及其与反证法、小概率事件原理的深刻联系。掌握这一思想,是后续学习各种具体检验方法(如t检验、卡方检验)的理论基石。

💡 核心导读

本节你将掌握:

  1. 假设检验的基本流程:从实际问题出发,建立假设、构造检验统计量、确定拒绝域、做出统计决策。
  2. Fisher显著性检验的核心思想:基于“小概率事件在一次试验中几乎不可能发生”的原理,通过计算在原假设成立下观测到当前样本(或更极端情况)的概率(即p值思想雏形)来判断是否拒绝原假设。
  3. 假设检验的核心概念:原假设与备择假设、拒绝域与接受域、第一类错误(弃真)与第二类错误(取伪)、势函数与显著性水平。
  4. 假设检验的三种思想类比:理解其与数学反证法、小概率事件原理以及司法“无罪推定”原则的相似之处。

假设检验概述与发展脉络

统计推断主要包含三大内容:抽样分布参数估计假设检验。其中,假设检验是统计学中最具特色、统计意味最浓的部分。它深刻地体现了从样本到总体的推断流程:从总体中抽取样本,构造统计量,并通过统计量对总体进行推断。

假设检验的方法与理论发展始于20世纪初,按时间顺序经历了以下重大事件:

  1. K. Pearson的拟合优度检验 (1900年左右):用于检验随机变量是否服从某个特定分布。
  2. R.A. Fisher的显著性检验 (20世纪20年代):本节重点,奠定了假设检验的直观思想基础。
  3. J. Neyman和E. Pearson的NP理论 (1928年开始):引入了备择假设和第二类错误,为假设检验建立了严格的数学理论基础。
  4. A. Wald的统计判决理论 (1950年左右):将“损失”函数引入决策过程,形成了更一般的决策框架。
  5. 贝叶斯方法:基于贝叶斯公式发展起来的一套统计推断方法,在假设检验中也有重要地位。

本课程中,拟合优度检验将在第五章介绍,NP理论是本章后三节的核心,统计判决理论在第六章介绍,而本节我们专注于Fisher的显著性检验。

Fisher显著性检验:女士品茶实验

我们通过统计学史上著名的“女士品茶”实验来阐述Fisher显著性检验的基本思想。

实验背景:一种饮料由牛奶(M)和茶(T)按一定比例混合而成。调制顺序有两种:先茶后奶(TM)或先奶后茶(MT)。一位女士声称她能鉴别出一杯饮料是TM还是MT。

实验设计:Fisher准备了8杯饮料,其中4杯为TM,4杯为MT,将它们随机排列。告知女士TM与MT各有4杯,请她品尝后指出哪4杯是TM。

核心问题:如果女士全部说对,我们是否有充分证据相信她真的具有鉴别能力?

Fisher的解决思路(显著性检验)

  1. 提出原假设:首先假设该女士没有鉴别能力,记此假设为 H0H_0
  2. 在原假设下计算概率:如果 H0H_0 成立,那么女士只是随机地从8杯中挑选4杯作为TM。从8杯中随机选4杯,总共有 C84=70C_8^4 = 70 种等可能的选法。
    • 其中,完全选对(即挑出的4杯恰好就是真正的4杯TM)的情况只有1种
    • 因此,在 H0H_0 成立下,她完全选对的概率为 P(完全选对H0)=1/700.0143P(\text{完全选对} | H_0) = 1/70 \approx 0.0143
  3. 做出统计推断:现在,实验完成了,女士确实完全选对了。面对这个结果,只有两种可能:
    • 情形AH0H_0 不成立(即女士有鉴别能力)。
    • 情形BH0H_0 成立,但发生了一件概率仅为 1/701/70 的小概率事件。 根据“小概率事件在一次试验中几乎不可能发生”的统计直觉,我们认为情形B发生的可能性极小。因此,我们有相当的理由拒绝原假设 H0H_0,转而接受备择假设 H1H_1:该女士具有鉴别能力。
  4. 结论:实验结果为“完全选对”这一事件,提供了不利于原假设 H0H_0 的显著性证据,从而我们拒绝 H0H_0

思考延伸:如果女士只选对了3杯呢?在 H0H_0 下,选对3杯及以上的概率为 17/700.24317/70 \approx 0.243。这个概率不算很小,这样的事件发生并不稀奇。因此,“选对3杯”这个结果没有提供足够的证据来拒绝 H0H_0,我们无法断定她是否有鉴别能力。

这个推理过程完美诠释了显著性检验的思想:先建立一个原假设,然后看在原假设成立的前提下,当前观测到的样本结果出现的概率有多大。如果这个概率非常小(小于某个阈值,如0.05),我们就认为原假设不太可能成立,从而拒绝它。

假设检验的基本概念

为了将显著性检验思想一般化,我们需要引入一系列标准术语。

原假设与备择假设

  • 统计假设:关于总体分布或参数的某个命题,其正确与否需通过样本进行推断。
  • 原假设(零假设):通常记为 H0H_0,是待检验的假设,往往代表一种“保守的”、“传统的”或“无效果的”状态。
  • 备择假设(对立假设):通常记为 H1H_1,是当原假设被拒绝时接受的假设,代表一种“有变化的”、“有效果的”或研究者希望证实的状态。

形式化定义:设样本 X=(X1,,Xn)\mathbf{X} = (X_1, \ldots, X_n) 来自参数分布族 {F(x;θ):θΘ}{F(\mathbf{x}; \theta): \theta \in \Theta},其中 Θ\Theta 为参数空间。设 Θ0\Theta_0Θ\Theta 的一个非空子集,Θ1=ΘΘ0\Theta_1 = \Theta - \Theta_0

  • 原假设:H0:θΘ0H_0: \theta \in \Theta_0
  • 备择假设:H1:θΘ1H_1: \theta \in \Theta_1

示例(产品次品率检验):工厂与商店约定,产品次品率 p0.05p \le 0.05 则接受该批产品。从一批产品中随机抽取 nn 件,XX 为次品数,XB(n,p)X \sim B(n, p)

  • 原假设 H0:p0.05H_0: p \le 0.05 (厂商声称的质量水平)
  • 备择假设 H1:p>0.05H_1: p > 0.05 (商店怀疑的质量问题)

假设的类型

  • 简单假设:假设完全确定了总体分布。例如:H0:p=0.05H_0: p = 0.05
  • 复合假设:假设对应参数空间的某个区域。例如:H0:p0.05H_0: p \le 0.05
  • 双边检验:备择假设指向参数偏离原假设值的两个方向。例如:H0:μ=μ0H_0: \mu = \mu_0, H1:μμ0H_1: \mu \neq \mu_0
  • 单边检验:备择假设指向参数偏离原假设值的一个方向。例如:H0:μμ0H_0: \mu \ge \mu_0, H1:μ<μ0H_1: \mu < \mu_0

拒绝域与检验

假设检验的本质是一个决策规则:根据样本观测值,决定是接受 H0H_0 还是拒绝 H0H_0

  • 样本空间划分:将所有可能样本观测值构成的样本空间 X\mathcal{X},划分为两个互不相交的区域:
    • 拒绝域 WW:如果样本观测值 xW\mathbf{x} \in W,则拒绝原假设 H0H_0
    • 接受域 WcW^c:如果样本观测值 xWc\mathbf{x} \in W^c,则接受(或不拒绝)原假设 H0H_0
  • 检验:上述决策规则或策略本身,就称为一个检验。有时也用一个示性函数 ϕ(x)\phi(\mathbf{x}) 表示检验: ϕ(x)={1,若 xW (拒绝 H0),0,若 xWc (接受 H0).\phi(\mathbf{x}) = \begin{cases} 1, & \text{若 } \mathbf{x} \in W \text{ (拒绝 } H_0 \text{)}, \ 0, & \text{若 } \mathbf{x} \in W^c \text{ (接受 } H_0 \text{)}. \end{cases}

两类错误与势函数

由于样本的随机性,任何检验都可能犯错误。

  • 第一类错误(弃真错误):原假设 H0H_0 为真,但检验却拒绝了 H0H_0
    • 犯第一类错误的概率记为:α(θ)=Pθ(XW),θΘ0\alpha(\theta) = P_\theta(\mathbf{X} \in W), \quad \theta \in \Theta_0
  • 第二类错误(取伪错误):备择假设 H1H_1 为真(即 H0H_0 为假),但检验却接受了 H0H_0
    • 犯第二类错误的概率记为:β(θ)=Pθ(XWc)=1Pθ(XW),θΘ1\beta(\theta) = P_\theta(\mathbf{X} \in W^c) = 1 - P_\theta(\mathbf{X} \in W), \quad \theta \in \Theta_1

我们自然希望两类错误概率都尽可能小。但遗憾的是,在样本量固定的情况下,这两类错误概率不可能同时减小。减小一个,往往会导致另一个增大。

为了综合衡量一个检验的性能,我们引入势函数

  • 势函数:定义为检验 ϕ\phi 拒绝 H0H_0 的概率,它是参数 θ\theta 的函数。 gϕ(θ)=Pθ(XW)=Eθ[ϕ(X)],θΘ.g_\phi(\theta) = P_\theta(\mathbf{X} \in W) = E_\theta[\phi(\mathbf{X})], \quad \theta \in \Theta.
    • θΘ0\theta \in \Theta_0 时,gϕ(θ)g_\phi(\theta) 就是犯第一类错误的概率 α(θ)\alpha(\theta)
    • θΘ1\theta \in \Theta_1 时,gϕ(θ)g_\phi(\theta) 就是检验功效,它等于 1β(θ)1 - \beta(\theta)。功效越大,说明当 H1H_1 为真时,正确拒绝 H0H_0 的能力越强。

显著性水平与检验的一般步骤

既然无法同时最小化两类错误,统计学的常规做法是:优先控制第一类错误

  • 显著性水平:给定一个较小的数 α\alpha (通常取 0.01, 0.05, 0.10),如果一个检验 ϕ\phi 满足: supθΘ0Pθ(XW)α,\sup_{\theta \in \Theta_0} P_\theta(\mathbf{X} \in W) \le \alpha, 则称 α\alpha 为该检验的显著性水平,称该检验是显著性水平为 α\alpha 的检验。这意味着,我们保证犯第一类错误的概率最大不超过 α\alpha

基于以上概念,一个完整的显著性检验通常包含以下五个步骤:

  1. 建立假设:根据实际问题提出原假设 H0H_0 和备择假设 H1H_1
  2. 选择检验统计量:构造一个合适的样本函数 T(X)T(\mathbf{X}),要求当 H0H_0 成立时,TT 的分布完全已知(且与未知参数无关)。
  3. 确定拒绝域形式:根据 H1H_1 的特点(单边或双边),确定拒绝域 WWTT 的哪种函数形式(如 T>cT > c, T<cT < c, 或 T>c|T| > c)。
  4. 确定临界值:根据给定的显著性水平 α\alphaTTH0H_0 下的分布,计算出拒绝域 WW 中的常数 cc
  5. 做出决策:根据样本观测值 x\mathbf{x} 计算检验统计量的值 T(x)T(\mathbf{x}),判断其是否落入拒绝域 WW,从而决定拒绝或接受 H0H_0

假设检验的思想内涵

假设检验的推理过程蕴含着深刻的统计思想,常与以下三种观念类比:

  1. 反证法思想:数学中的反证法先假设结论不成立,然后推导出矛盾,从而证明结论成立。假设检验类似,先假设 H0H_0 成立,然后推导出(在原假设下)当前样本是一个小概率事件。由于小概率事件“不应该”发生,我们便怀疑原假设 H0H_0 的正确性,从而拒绝它。
  2. 小概率事件原理:“小概率事件在一次试验中几乎不可能发生”是假设检验的直接依据。Fisher的显著性检验正是基于此原理,通过计算p值(或类似概率)来判断证据的强弱。
  3. “无罪推定”原则:在司法中,首先假定被告无罪(H0H_0:被告无罪),然后由控方提供证据。只有证据足够充分(达到“排除合理怀疑”的标准,类似显著性水平 α\alpha),才能推翻无罪假定,判定有罪(H1H_1:被告有罪)。如果证据不足,则维持无罪判决。假设检验中,我们也是首先接受 H0H_0 为真,只有样本提供了足够强的反面证据时,才拒绝 H0H_0

📝 动手练一练

  1. 品茶实验的变体:在女士品茶实验中,如果Fisher准备了10杯饮料(5杯TM,5杯MT),女士仍然被要求挑出5杯TM。

    • a) 在原假设(无鉴别能力)下,她完全选对的概率是多少?
    • b) 如果显著性水平设为 α=0.05\alpha = 0.05,那么“完全选对”这一结果是否足以让我们在0.05水平上拒绝原假设?
  2. 糖厂重量检验:某糖厂声称其袋装糖的平均净重为500克。质监部门怀疑其重量不足。已知袋装糖重量服从正态分布 N(μ,52)N(\mu, 5^2)(方差已知)。现随机抽取9袋,测得平均净重 xˉ=496\bar{x} = 496 克。

    • a) 请建立适当的原假设 H0H_0 和备择假设 H1H_1
    • b) 在显著性水平 α=0.05\alpha=0.05 下,应如何构造拒绝域?(提示:利用 XˉN(μ,25/9)\bar{X} \sim N(\mu, 25/9),当 H0H_0 成立时,Xˉ\bar{X} 的分布已知)
    • c) 根据样本数据,你是否认为有足够证据拒绝糖厂的说法?

参考答案

  1. a) 总选法为 C105=252C_{10}^5 = 252 种,完全选对只有1种,概率为 1/2520.003971/252 \approx 0.00397。 b) 0.00397<0.050.00397 < 0.05,因此“完全选对”是一个小概率事件,在0.05显著性水平下,我们拒绝原假设,认为女士有鉴别能力。

  2. a) H0:μ500H_0: \mu \ge 500, H1:μ<500H_1: \mu < 500。(这是一个左边检验) b) 检验统计量 Z=Xˉ5005/3Z = \frac{\bar{X} - 500}{5/3}。在 H0H_0 成立下(且取边界 μ=500\mu=500),ZN(0,1)Z \sim N(0,1)。对于左边检验,拒绝域为 Z<z0.95Z < -z_{0.95},其中 z0.95z_{0.95} 是标准正态分布的0.95分位数。查表得 z0.951.645z_{0.95} \approx 1.645,故拒绝域为 Z<1.645Z < -1.645。 c) 计算 z=4965005/3=2.4z = \frac{496 - 500}{5/3} = -2.4。因为 2.4<1.645-2.4 < -1.645,落入拒绝域,所以在0.05水平下,拒绝 H0H_0,认为袋装糖平均净重显著低于500克。

    import numpy as np
    from scipy import stats
    
    # 练习2的Python计算验证
    np.random.seed(2023) # 固定随机种子
    
    # 已知条件
    mu_0 = 500
    sigma = 5
    n = 9
    sample_mean = 496
    alpha = 0.05
    
    # 计算检验统计量z值
    z_stat = (sample_mean - mu_0) / (sigma / np.sqrt(n))
    print(f"检验统计量 z 值: {z_stat:.4f}")
    
    # 计算临界值 (左侧检验)
    z_critical = stats.norm.ppf(alpha) # 标准正态分布的alpha分位数
    print(f"显著性水平 {alpha} 下的临界值: {z_critical:.4f}")
    
    # 做出决策
    if z_stat < z_critical:
        print(f"决策: 因为 z({z_stat:.4f}) < 临界值({z_critical:.4f}),拒绝原假设 H0。")
    else:
        print(f"决策: 因为 z({z_stat:.4f}) >= 临界值({z_critical:.4f}),不拒绝原假设 H0。")
    
    # 也可以计算p值进行判断
    p_value = stats.norm.cdf(z_stat) # 左侧检验的p值是累积概率
    print(f"该检验的 p 值: {p_value:.6f}")
    if p_value < alpha:
        print(f"决策 (基于p值): 因为 p值({p_value:.6f}) < α({alpha}),拒绝原假设 H0。")
    else:
        print(f"决策 (基于p值): 因为 p值({p_value:.6f}) >= α({alpha}),不拒绝原假设 H0。")

本章小结

本节我们开启了假设检验的学习之旅,重点掌握了Fisher的显著性检验思想及其核心概念。

要点回顾

  • 显著性检验流程:提出 H0H_0 → 在 H0H_0 下计算当前结果概率 → 依据小概率原理做出决策。
  • 核心概念
    • H0H_0H1H_1:一对互斥的关于总体的命题。
    • 拒绝域 WW:导致拒绝 H0H_0 的样本值区域。
    • 两类错误:弃真(α\alpha)与取伪(β\beta),二者此消彼长。
    • 势函数:拒绝 H0H_0 的概率,综合反映检验性能。
    • 显著性水平 α\alpha:事先设定的第一类错误概率上限,是检验的严格性标准。
  • 思想内涵:与反证法、小概率事件原理及“无罪推定”原则一脉相承。

行动清单

  1. 重演经典:尝试向他人用“女士品茶”的例子解释什么是假设检验和p值的思想。
  2. 辨析概念:面对一个统计问题(如“新药是否有效?”),能准确指出其中的 H0H_0H1H_1,并说明什么是第一类错误、第二类错误。
  3. 动手验证:运行提供的Python代码,改变样本均值(sample_mean)、样本量(n)或显著性水平(alpha),观察检验统计量、临界值和最终决策如何变化,直观感受假设检验的过程。

— 小象教研组

配套学习资源与课件
  • 第4章课件:假设检验(PDF · 7.6MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问