📑 查看全课大纲(第 18 / 41 节)
- 1.数理统计中的基本概念
- 2.统计量与抽样分布(一)
- 3.统计量与抽样分布(二)
- 4.次序统计量
- 5.充分统计量与完备统计量
- 6.统计中常用分布族(一)
- 7.统计中常用分布族(二)
- 8.矩估计
- 9.极大似然估计
- 10.无偏估计与一致最小方差无偏估计(一)
- 11.无偏估计与一致最小方差无偏估计(二)
- 12.完备统计量
- 13.CR不等式及有效估计
- 14.相合估计
- 15.置信区间
- 16.正态总体参数的置信区间
- 17.大样本置信区间
- 18.Fisher显著性检验
- 19.正态总体参数的假设检验(一)
- 20.正态总体参数的假设检验(二)
- 21.似然比检验
- 22.Neyman-Pearson基本引理
- 23.一致最优势检验
- 24.无偏检验与一致最优势无偏检验
- 25.正态概率纸检验
- 26.拟合优度检验
- 27.列联表的独立性检验
- 28.Kolmogorov检验
- 29.正态性检验
- 30.Bayes统计
- 31.先验分布的确定
- 32.Bayes统计推断
- 33.统计判决理论
- 34.Minimax准则
- 35.非参数统计
- 36.符号检验
- 37.Wilcoxon符号秩检验
- 38.抽样调查
- 39.简单随机抽样
- 40.分层随机抽样
- 41.整群随机抽样
Fisher显著性检验
约 50 分钟
Fisher显著性检验
小象实战讲义 · 数据科学的统计基础
假设检验是统计推断的核心支柱之一,它为我们提供了一套严谨的框架,用于基于样本数据对关于总体的某个命题(假设)做出判断。本节作为假设检验的入门,我们将聚焦于由R.A. Fisher提出的显著性检验思想。通过经典的“女士品茶”实验,你将直观理解假设检验的推理逻辑、核心概念(如原假设、拒绝域、p值思想)以及其与反证法、小概率事件原理的深刻联系。掌握这一思想,是后续学习各种具体检验方法(如t检验、卡方检验)的理论基石。
💡 核心导读
本节你将掌握:
- 假设检验的基本流程:从实际问题出发,建立假设、构造检验统计量、确定拒绝域、做出统计决策。
- Fisher显著性检验的核心思想:基于“小概率事件在一次试验中几乎不可能发生”的原理,通过计算在原假设成立下观测到当前样本(或更极端情况)的概率(即p值思想雏形)来判断是否拒绝原假设。
- 假设检验的核心概念:原假设与备择假设、拒绝域与接受域、第一类错误(弃真)与第二类错误(取伪)、势函数与显著性水平。
- 假设检验的三种思想类比:理解其与数学反证法、小概率事件原理以及司法“无罪推定”原则的相似之处。
假设检验概述与发展脉络
统计推断主要包含三大内容:抽样分布、参数估计和假设检验。其中,假设检验是统计学中最具特色、统计意味最浓的部分。它深刻地体现了从样本到总体的推断流程:从总体中抽取样本,构造统计量,并通过统计量对总体进行推断。
假设检验的方法与理论发展始于20世纪初,按时间顺序经历了以下重大事件:
- K. Pearson的拟合优度检验 (1900年左右):用于检验随机变量是否服从某个特定分布。
- R.A. Fisher的显著性检验 (20世纪20年代):本节重点,奠定了假设检验的直观思想基础。
- J. Neyman和E. Pearson的NP理论 (1928年开始):引入了备择假设和第二类错误,为假设检验建立了严格的数学理论基础。
- A. Wald的统计判决理论 (1950年左右):将“损失”函数引入决策过程,形成了更一般的决策框架。
- 贝叶斯方法:基于贝叶斯公式发展起来的一套统计推断方法,在假设检验中也有重要地位。
本课程中,拟合优度检验将在第五章介绍,NP理论是本章后三节的核心,统计判决理论在第六章介绍,而本节我们专注于Fisher的显著性检验。
Fisher显著性检验:女士品茶实验
我们通过统计学史上著名的“女士品茶”实验来阐述Fisher显著性检验的基本思想。
实验背景:一种饮料由牛奶(M)和茶(T)按一定比例混合而成。调制顺序有两种:先茶后奶(TM)或先奶后茶(MT)。一位女士声称她能鉴别出一杯饮料是TM还是MT。
实验设计:Fisher准备了8杯饮料,其中4杯为TM,4杯为MT,将它们随机排列。告知女士TM与MT各有4杯,请她品尝后指出哪4杯是TM。
核心问题:如果女士全部说对,我们是否有充分证据相信她真的具有鉴别能力?
Fisher的解决思路(显著性检验):
- 提出原假设:首先假设该女士没有鉴别能力,记此假设为 。
- 在原假设下计算概率:如果 成立,那么女士只是随机地从8杯中挑选4杯作为TM。从8杯中随机选4杯,总共有 种等可能的选法。
- 其中,完全选对(即挑出的4杯恰好就是真正的4杯TM)的情况只有1种。
- 因此,在 成立下,她完全选对的概率为 。
- 做出统计推断:现在,实验完成了,女士确实完全选对了。面对这个结果,只有两种可能:
- 情形A: 不成立(即女士有鉴别能力)。
- 情形B: 成立,但发生了一件概率仅为 的小概率事件。 根据“小概率事件在一次试验中几乎不可能发生”的统计直觉,我们认为情形B发生的可能性极小。因此,我们有相当的理由拒绝原假设 ,转而接受备择假设 :该女士具有鉴别能力。
- 结论:实验结果为“完全选对”这一事件,提供了不利于原假设 的显著性证据,从而我们拒绝 。
思考延伸:如果女士只选对了3杯呢?在 下,选对3杯及以上的概率为 。这个概率不算很小,这样的事件发生并不稀奇。因此,“选对3杯”这个结果没有提供足够的证据来拒绝 ,我们无法断定她是否有鉴别能力。
这个推理过程完美诠释了显著性检验的思想:先建立一个原假设,然后看在原假设成立的前提下,当前观测到的样本结果出现的概率有多大。如果这个概率非常小(小于某个阈值,如0.05),我们就认为原假设不太可能成立,从而拒绝它。
假设检验的基本概念
为了将显著性检验思想一般化,我们需要引入一系列标准术语。
原假设与备择假设
- 统计假设:关于总体分布或参数的某个命题,其正确与否需通过样本进行推断。
- 原假设(零假设):通常记为 ,是待检验的假设,往往代表一种“保守的”、“传统的”或“无效果的”状态。
- 备择假设(对立假设):通常记为 ,是当原假设被拒绝时接受的假设,代表一种“有变化的”、“有效果的”或研究者希望证实的状态。
形式化定义:设样本 来自参数分布族 ,其中 为参数空间。设 是 的一个非空子集,。
- 原假设:
- 备择假设:
示例(产品次品率检验):工厂与商店约定,产品次品率 则接受该批产品。从一批产品中随机抽取 件, 为次品数,。
- 原假设 (厂商声称的质量水平)
- 备择假设 (商店怀疑的质量问题)
假设的类型:
- 简单假设:假设完全确定了总体分布。例如:。
- 复合假设:假设对应参数空间的某个区域。例如:。
- 双边检验:备择假设指向参数偏离原假设值的两个方向。例如:, 。
- 单边检验:备择假设指向参数偏离原假设值的一个方向。例如:, 。
拒绝域与检验
假设检验的本质是一个决策规则:根据样本观测值,决定是接受 还是拒绝 。
- 样本空间划分:将所有可能样本观测值构成的样本空间 ,划分为两个互不相交的区域:
- 拒绝域 :如果样本观测值 ,则拒绝原假设 。
- 接受域 :如果样本观测值 ,则接受(或不拒绝)原假设 。
- 检验:上述决策规则或策略本身,就称为一个检验。有时也用一个示性函数 表示检验:
两类错误与势函数
由于样本的随机性,任何检验都可能犯错误。
- 第一类错误(弃真错误):原假设 为真,但检验却拒绝了 。
- 犯第一类错误的概率记为:。
- 第二类错误(取伪错误):备择假设 为真(即 为假),但检验却接受了 。
- 犯第二类错误的概率记为:。
我们自然希望两类错误概率都尽可能小。但遗憾的是,在样本量固定的情况下,这两类错误概率不可能同时减小。减小一个,往往会导致另一个增大。
为了综合衡量一个检验的性能,我们引入势函数。
- 势函数:定义为检验 拒绝 的概率,它是参数 的函数。
- 当 时, 就是犯第一类错误的概率 。
- 当 时, 就是检验功效,它等于 。功效越大,说明当 为真时,正确拒绝 的能力越强。
显著性水平与检验的一般步骤
既然无法同时最小化两类错误,统计学的常规做法是:优先控制第一类错误。
- 显著性水平:给定一个较小的数 (通常取 0.01, 0.05, 0.10),如果一个检验 满足: 则称 为该检验的显著性水平,称该检验是显著性水平为 的检验。这意味着,我们保证犯第一类错误的概率最大不超过 。
基于以上概念,一个完整的显著性检验通常包含以下五个步骤:
- 建立假设:根据实际问题提出原假设 和备择假设 。
- 选择检验统计量:构造一个合适的样本函数 ,要求当 成立时, 的分布完全已知(且与未知参数无关)。
- 确定拒绝域形式:根据 的特点(单边或双边),确定拒绝域 是 的哪种函数形式(如 , , 或 )。
- 确定临界值:根据给定的显著性水平 和 在 下的分布,计算出拒绝域 中的常数 。
- 做出决策:根据样本观测值 计算检验统计量的值 ,判断其是否落入拒绝域 ,从而决定拒绝或接受 。
假设检验的思想内涵
假设检验的推理过程蕴含着深刻的统计思想,常与以下三种观念类比:
- 反证法思想:数学中的反证法先假设结论不成立,然后推导出矛盾,从而证明结论成立。假设检验类似,先假设 成立,然后推导出(在原假设下)当前样本是一个小概率事件。由于小概率事件“不应该”发生,我们便怀疑原假设 的正确性,从而拒绝它。
- 小概率事件原理:“小概率事件在一次试验中几乎不可能发生”是假设检验的直接依据。Fisher的显著性检验正是基于此原理,通过计算p值(或类似概率)来判断证据的强弱。
- “无罪推定”原则:在司法中,首先假定被告无罪(:被告无罪),然后由控方提供证据。只有证据足够充分(达到“排除合理怀疑”的标准,类似显著性水平 ),才能推翻无罪假定,判定有罪(:被告有罪)。如果证据不足,则维持无罪判决。假设检验中,我们也是首先接受 为真,只有样本提供了足够强的反面证据时,才拒绝 。
📝 动手练一练
品茶实验的变体:在女士品茶实验中,如果Fisher准备了10杯饮料(5杯TM,5杯MT),女士仍然被要求挑出5杯TM。
- a) 在原假设(无鉴别能力)下,她完全选对的概率是多少?
- b) 如果显著性水平设为 ,那么“完全选对”这一结果是否足以让我们在0.05水平上拒绝原假设?
糖厂重量检验:某糖厂声称其袋装糖的平均净重为500克。质监部门怀疑其重量不足。已知袋装糖重量服从正态分布 (方差已知)。现随机抽取9袋,测得平均净重 克。
- a) 请建立适当的原假设 和备择假设 。
- b) 在显著性水平 下,应如何构造拒绝域?(提示:利用 ,当 成立时, 的分布已知)
- c) 根据样本数据,你是否认为有足够证据拒绝糖厂的说法?
参考答案:
a) 总选法为 种,完全选对只有1种,概率为 。 b) ,因此“完全选对”是一个小概率事件,在0.05显著性水平下,我们拒绝原假设,认为女士有鉴别能力。
a) , 。(这是一个左边检验) b) 检验统计量 。在 成立下(且取边界 ),。对于左边检验,拒绝域为 ,其中 是标准正态分布的0.95分位数。查表得 ,故拒绝域为 。 c) 计算 。因为 ,落入拒绝域,所以在0.05水平下,拒绝 ,认为袋装糖平均净重显著低于500克。
import numpy as np from scipy import stats # 练习2的Python计算验证 np.random.seed(2023) # 固定随机种子 # 已知条件 mu_0 = 500 sigma = 5 n = 9 sample_mean = 496 alpha = 0.05 # 计算检验统计量z值 z_stat = (sample_mean - mu_0) / (sigma / np.sqrt(n)) print(f"检验统计量 z 值: {z_stat:.4f}") # 计算临界值 (左侧检验) z_critical = stats.norm.ppf(alpha) # 标准正态分布的alpha分位数 print(f"显著性水平 {alpha} 下的临界值: {z_critical:.4f}") # 做出决策 if z_stat < z_critical: print(f"决策: 因为 z({z_stat:.4f}) < 临界值({z_critical:.4f}),拒绝原假设 H0。") else: print(f"决策: 因为 z({z_stat:.4f}) >= 临界值({z_critical:.4f}),不拒绝原假设 H0。") # 也可以计算p值进行判断 p_value = stats.norm.cdf(z_stat) # 左侧检验的p值是累积概率 print(f"该检验的 p 值: {p_value:.6f}") if p_value < alpha: print(f"决策 (基于p值): 因为 p值({p_value:.6f}) < α({alpha}),拒绝原假设 H0。") else: print(f"决策 (基于p值): 因为 p值({p_value:.6f}) >= α({alpha}),不拒绝原假设 H0。")
本章小结
本节我们开启了假设检验的学习之旅,重点掌握了Fisher的显著性检验思想及其核心概念。
要点回顾:
- 显著性检验流程:提出 → 在 下计算当前结果概率 → 依据小概率原理做出决策。
- 核心概念:
- 与 :一对互斥的关于总体的命题。
- 拒绝域 :导致拒绝 的样本值区域。
- 两类错误:弃真()与取伪(),二者此消彼长。
- 势函数:拒绝 的概率,综合反映检验性能。
- 显著性水平 :事先设定的第一类错误概率上限,是检验的严格性标准。
- 思想内涵:与反证法、小概率事件原理及“无罪推定”原则一脉相承。
行动清单:
- 重演经典:尝试向他人用“女士品茶”的例子解释什么是假设检验和p值的思想。
- 辨析概念:面对一个统计问题(如“新药是否有效?”),能准确指出其中的 、,并说明什么是第一类错误、第二类错误。
- 动手验证:运行提供的Python代码,改变样本均值(
sample_mean)、样本量(n)或显著性水平(alpha),观察检验统计量、临界值和最终决策如何变化,直观感受假设检验的过程。
— 小象教研组
- 第4章课件:假设检验(PDF · 7.6MB)下载
领取《小象 11GB VIP 课件资料包与大厂真题手册》
包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。
- ✔完整 Python / 数据分析 Jupyter 实战源码
- ✔大厂真实业务数据集与练习题
- ✔微信扫码添加课程顾问,免费获取网盘下载链接
微信扫码添加顾问