📑 查看全课大纲(第 19 / 41 节)
- 1.数理统计中的基本概念
- 2.统计量与抽样分布(一)
- 3.统计量与抽样分布(二)
- 4.次序统计量
- 5.充分统计量与完备统计量
- 6.统计中常用分布族(一)
- 7.统计中常用分布族(二)
- 8.矩估计
- 9.极大似然估计
- 10.无偏估计与一致最小方差无偏估计(一)
- 11.无偏估计与一致最小方差无偏估计(二)
- 12.完备统计量
- 13.CR不等式及有效估计
- 14.相合估计
- 15.置信区间
- 16.正态总体参数的置信区间
- 17.大样本置信区间
- 18.Fisher显著性检验
- 19.正态总体参数的假设检验(一)
- 20.正态总体参数的假设检验(二)
- 21.似然比检验
- 22.Neyman-Pearson基本引理
- 23.一致最优势检验
- 24.无偏检验与一致最优势无偏检验
- 25.正态概率纸检验
- 26.拟合优度检验
- 27.列联表的独立性检验
- 28.Kolmogorov检验
- 29.正态性检验
- 30.Bayes统计
- 31.先验分布的确定
- 32.Bayes统计推断
- 33.统计判决理论
- 34.Minimax准则
- 35.非参数统计
- 36.符号检验
- 37.Wilcoxon符号秩检验
- 38.抽样调查
- 39.简单随机抽样
- 40.分层随机抽样
- 41.整群随机抽样
正态总体参数的假设检验(一)
约 44 分钟
正态总体参数的假设检验(一):单样本均值检验
小象实战讲义 · 数据科学的统计基础
在上一节学习了假设检验的基本思想后,我们面临一个实际问题:如何将理论应用于具体的统计推断?正态分布是数据科学中最常见、最重要的分布之一,许多统计方法都建立在数据服从正态分布的假设之上。本节我们将聚焦于单正态总体参数的假设检验,特别是总体均值的检验。学完本节,你将能够对一个正态总体的均值提出科学假设,并根据样本数据,利用U检验或t检验,判断是否有充分证据拒绝原假设,从而解决诸如“生产线是否正常”、“产品质量是否达标”等实际问题。
💡 核心导读
- 检验的核心要素:一个完整的假设检验由检验统计量和拒绝域构成,其目标是控制第一类错误(弃真)的概率。
- 原假设的“被保护”地位:原假设通常代表“现状”或“无显著差异”,除非有充分证据,否则不予拒绝。我们通常说“不拒绝原假设”,而非“接受原假设”。
- 单样本均值检验的两大场景:根据总体方差是否已知,分别采用U检验(Z检验) 和 t检验。
- 假设的三种形式:双边检验()和两种单边检验( 或 ),它们决定了拒绝域的方向。
- 显著性水平的选择:结论(拒绝与否)依赖于预先设定的显著性水平 (如0.05), 不同可能导致结论不同。
假设检验流程回顾与思想深化
在进入具体检验之前,我们首先巩固假设检验的基本流程与核心思想,这对理解后续所有检验都至关重要。
基本流程:
- 提出假设:根据实际问题,建立原假设 和备择假设 。
- 构造检验统计量:找到一个样本统计量 ,用于衡量数据与原假设的偏离程度。
- 确定统计量的分布:在原假设 成立的条件下,推导出检验统计量 的精确分布或渐近分布。这是整个检验的数学基础。
- 确定拒绝域:根据备择假设的方向,在 的分布上划定一个区域 (拒绝域),使得当 落入 时,我们拒绝 。区域 的边界由显著性水平 决定,满足 。
- 做出决策:将样本数据代入计算 的观测值 。若 ,则拒绝 ;否则,不拒绝 。
核心思想——“反证法”与“小概率事件”:
- 反证法:我们先“假定”原假设 成立。
- 小概率事件:在原假设成立的假定下,检验统计量 有一个已知分布。如果根据样本计算出的 值,落在了这个分布中概率非常小(如 )的区域,这意味着在原假设成立的前提下,发生了一件“不太可能”的事情。
- 做出推断:根据“小概率事件在一次试验中几乎不发生”的原则,我们更倾向于认为最初的假定( 成立)是不合理的,从而拒绝 。反之,如果 值落在大概率区域,则没有充分证据反对 ,我们选择不拒绝它。
原假设的“被保护”地位:在许多实际问题中(如产品质量检验、新药有效性检验),原假设 常代表“没有效果”、“过程正常”、“符合标准”等现状或保守结论。除非样本数据提供强有力的、小概率的证据反对它,否则我们维持原假设。这类似于司法中的“无罪推定”:在没有确凿证据证明有罪之前,假定被告无罪。因此,我们通常说“不拒绝 ”,这比“接受 ”更为严谨,因为不拒绝可能只是由于证据不足,而非 一定为真。
两类错误与NP理论:
- 第一类错误(弃真): 为真时拒绝了它,概率记为 。
- 第二类错误(存伪): 为假时没有拒绝它,概率记为 。 在样本量固定的情况下, 和 此消彼长。Fisher的显著性检验主要关注控制 。而后续的Neyman-Pearson (NP) 理论则追求:在控制第一类错误 不超过某个水平的前提下,寻找使第二类错误 最小(即检验功效最大)的检验方法。
单正态总体均值的假设检验
设 是来自正态总体 的简单随机样本。我们感兴趣的参数是总体均值 。待检验的假设通常围绕 与某个给定值 的关系展开。
情形一:方差 已知
当总体方差 已知时,我们使用 U检验(或称Z检验)。检验统计量基于样本均值 。我们知道,。将其标准化,得到U统计量: 在原假设 成立的条件下,,即服从标准正态分布。
下面针对三种常见的假设形式给出具体的检验方法。
1. 双边检验
直观理解:如果 成立,即 不等于 ,那么样本均值 作为 的估计,与 的差距(绝对值)应该会比较大。因此,当 很大时,我们倾向于拒绝 。
拒绝域的确定:我们需要控制第一类错误 。由于 下 ,临界值 应取标准正态分布的 分位数,记为 。通常, 时,。
检验结论:
- 若 ,则拒绝 。
- 若 ,则不拒绝 。
此检验称为水平为 的双边U检验。
例题应用(糖厂包装机):
- 问题:糖厂袋装糖标准质量为100克,已知标准差 克。随机抽检9袋,测得平均质量 克。问机器工作是否正常?()
- 假设:
- 计算: 。
- 结论:在0.05显著性水平下,没有充分证据拒绝 ,即不能认为包装机工作不正常。
import numpy as np
from scipy import stats
# 糖厂包装机检验示例 (方差已知,双边U检验)
mu_0 = 100 # 标准质量
sigma = 1.15 # 已知标准差
x_bar = 99.98 # 样本均值
n = 9 # 样本量
alpha = 0.05 # 显著性水平
# 计算U统计量
u_stat = (x_bar - mu_0) / (sigma / np.sqrt(n))
print(f"U统计量观测值: {u_stat:.4f}")
# 计算临界值
critical_value = stats.norm.ppf(1 - alpha/2)
print(f"双边检验临界值 (α={alpha}): ±{critical_value:.4f}")
# 计算p值 (双边)
p_value = 2 * (1 - stats.norm.cdf(abs(u_stat)))
print(f"检验p值: {p_value:.4f}")
# 做出决策
if abs(u_stat) > critical_value:
print(f"决策: |{u_stat:.4f}| > {critical_value:.4f}, 拒绝H0。")
else:
print(f"决策: |{u_stat:.4f}| ≤ {critical_value:.4f}, 不拒绝H0。")2. 左边检验
直观理解:如果 成立,即 小于 ,那么样本均值 倾向于小于 ,使得 统计量倾向于取负值,且绝对值较大。因此,当 很小时(即负得很多),我们拒绝 。
拒绝域的确定:控制 。由于 下 ,临界值 应取标准正态分布的 分位数,记为 。由于分布对称,。例如, 时,。
检验结论:
- 若 ,则拒绝 。
- 若 ,则不拒绝 。
此检验称为水平为 的单边(左边)U检验。
3. 右边检验
直观理解:与左边检验相反,如果 成立, 统计量倾向于取正值且较大。
拒绝域的确定:控制 。临界值 应取标准正态分布的 分位数 。
检验结论:
- 若 ,则拒绝 。
- 若 ,则不拒绝 。
此检验称为水平为 的单边(右边)U检验。
情形二:方差 未知
当总体方差 未知时,我们无法使用U统计量,因为它依赖于未知的 。自然的想法是用样本方差 来估计 。由此构造的统计量服从 t分布。
构造 t统计量: 在原假设 成立的条件下,,即自由度为 的 t 分布。
检验的逻辑与U检验完全相同,只是临界值需要从 t 分布中查找。
1. 双边检验
- 拒绝域:
- 名称:双边 t 检验
2. 左边检验
- 拒绝域:,其中
- 名称:单边(左边) t 检验
3. 右边检验
- 拒绝域:
- 名称:单边(右边) t 检验
# 模拟:方差未知时的单样本t检验
np.random.seed(42) # 固定随机种子
# 假设真实总体为 N(102, 2.5^2),但我们不知道方差
true_mu = 102
true_sigma = 2.5
n = 25
sample = np.random.normal(loc=true_mu, scale=true_sigma, size=n)
# 我们想检验 H0: mu = 100 vs H1: mu > 100 (右边检验)
mu_0 = 100
alpha = 0.05
# 计算样本统计量
x_bar = np.mean(sample)
s = np.std(sample, ddof=1) # 样本标准差,ddof=1表示除以n-1
print(f"样本均值: {x_bar:.4f}")
print(f"样本标准差: {s:.4f}")
# 计算t统计量
t_stat = (x_bar - mu_0) / (s / np.sqrt(n))
print(f"t统计量观测值: {t_stat:.4f}")
# 计算临界值 (自由度为 n-1)
df = n - 1
critical_value = stats.t.ppf(1 - alpha, df)
print(f"右边t检验临界值 (α={alpha}, df={df}): {critical_value:.4f}")
# 使用scipy内置函数进行单样本t检验,验证结果
# alternative='greater' 对应 H1: mu > mu_0
t_stat_scipy, p_value_scipy = stats.ttest_1samp(sample, popmean=mu_0, alternative='greater')
print(f"\nScipy t检验结果:")
print(f" t统计量: {t_stat_scipy:.4f}")
print(f" 单边p值 (greater): {p_value_scipy:.4f}")
# 做出决策
if t_stat > critical_value:
print(f"决策: {t_stat:.4f} > {critical_value:.4f}, 拒绝H0,认为总体均值大于100。")
else:
print(f"决策: {t_stat:.4f} ≤ {critical_value:.4f}, 不拒绝H0。")关于假设形式的进一步说明
在课件和讲授中,提到了五种假设形式,但最终可归结为上述三种检验:
- (双边检验)
- (单边检验)
- (单边检验)
- (可归入第3类)
- (可归入第2类)
为什么第4、5类可归入前两类? 以第4类为例,原假设 。在构造检验时,我们通常考虑对原假设最不利的情况,即 。因为如果在这个边界点上,我们都能控制第一类错误概率不超过 ,那么对于 的情况,犯第一类错误的概率只会更小。因此,我们可以直接采用针对 的检验方法(拒绝域为 ),它同时也是水平为 的针对 的检验。第5类情况同理。
一个关键要求:原假设 中必须包含等号(=)。这是因为我们需要在 成立的一个确定点上,推导出检验统计量的精确分布,从而计算临界值和p值。如果 只是 ,没有等号,则 是一个区间,检验统计量的分布不唯一,无法确定统一的临界值。
📝 动手练一练
练习题一(方差已知的U检验) 某品牌洗发水标注净含量为500ml。根据长期生产记录,灌装量的标准差稳定在 ml。质监部门从一批产品中随机抽取了36瓶进行测量,得到平均净含量 ml。在显著性水平 下,能否认为该批洗发水的平均净含量低于标注值?(提示:这是一个左边检验)
参考答案: 建立假设:。 计算U统计量:。 查表得 的左边临界值 。 因为 ,所以不拒绝 。在0.01水平下,没有充分证据表明该批产品平均净含量低于500ml。
练习题二(方差未知的t检验) 为研究一种新型肥料对小麦株高的影响,在试验田中随机选取了16株使用该肥料的小麦,测得株高(cm)如下:
[82, 85, 88, 86, 84, 87, 90, 83, 89, 85, 86, 84, 87, 88, 86, 85]已知该品种小麦在常规肥料下的平均株高为84.5cm。假设株高服从正态分布,在 水平下,检验这种新型肥料是否提高了小麦的平均株高。参考答案:
import numpy as np from scipy import stats heights = np.array([82, 85, 88, 86, 84, 87, 90, 83, 89, 85, 86, 84, 87, 88, 86, 85]) mu_0 = 84.5 alpha = 0.05 # 使用scipy进行单样本右边t检验 t_stat, p_value = stats.ttest_1samp(heights, popmean=mu_0, alternative='greater') print(f"样本均值: {np.mean(heights):.2f}") print(f"样本标准差: {np.std(heights, ddof=1):.2f}") print(f"t统计量: {t_stat:.4f}") print(f"p值 (右边): {p_value:.4f}") if p_value < alpha: print(f"结论: p值 ({p_value:.4f}) < α ({alpha}),拒绝H0,认为新型肥料提高了平均株高。") else: print(f"结论: p值 ({p_value:.4f}) ≥ α ({alpha}),不拒绝H0。")运行代码后,p值约为0.0092,小于0.05,因此拒绝原假设,认为新型肥料显著提高了小麦的平均株高。
本章小结
本节我们深入探讨了单正态总体均值假设检验的完整框架,这是统计推断中最基础、应用最广泛的方法之一。
要点回顾:
- 检验思想:基于反证法与小概率事件原理,通过构造在原假设下有已知分布的检验统计量,来判断样本数据是否提供了拒绝原假设的充分证据。
- 核心要素:检验由检验统计量和拒绝域构成,通过控制第一类错误概率 来确定拒绝域的边界。
- 两大场景:
- 方差已知:使用 U检验(Z检验),统计量 。
- 方差未知:使用 t检验,统计量 。
- 三种假设:根据备择假设的方向,分为双边检验和单边(左、右)检验,它们决定了拒绝域是双侧还是单侧。
- 决策表述:严谨的结论是“拒绝 ”或“不拒绝 ”,后者不等同于“接受 ”,体现了原假设的“被保护”地位。
行动清单:
- 明确场景:面对一个关于均值的检验问题,首先判断总体方差是否已知,以决定使用U检验还是t检验。
- 正确建立假设:根据研究问题的方向(是否关心特定方向的变化),选择双边或单边假设。牢记原假设必须包含等号。
- 掌握计算与查表:熟练计算检验统计量的观测值,并会根据显著性水平 和自由度(t检验时)查找对应的临界值,或利用软件计算p值。
- 理解结论的统计含义:“不拒绝 ”意味着证据不足,而非证明 为真;结论的可靠性依赖于预先设定的 水平。
— 小象教研组
- 第4章课件:假设检验(PDF · 7.6MB)下载
领取《小象 11GB VIP 课件资料包与大厂真题手册》
包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。
- ✔完整 Python / 数据分析 Jupyter 实战源码
- ✔大厂真实业务数据集与练习题
- ✔微信扫码添加课程顾问,免费获取网盘下载链接
微信扫码添加顾问