📑 查看全课大纲(第 38 / 41 节)
- 1.数理统计中的基本概念
- 2.统计量与抽样分布(一)
- 3.统计量与抽样分布(二)
- 4.次序统计量
- 5.充分统计量与完备统计量
- 6.统计中常用分布族(一)
- 7.统计中常用分布族(二)
- 8.矩估计
- 9.极大似然估计
- 10.无偏估计与一致最小方差无偏估计(一)
- 11.无偏估计与一致最小方差无偏估计(二)
- 12.完备统计量
- 13.CR不等式及有效估计
- 14.相合估计
- 15.置信区间
- 16.正态总体参数的置信区间
- 17.大样本置信区间
- 18.Fisher显著性检验
- 19.正态总体参数的假设检验(一)
- 20.正态总体参数的假设检验(二)
- 21.似然比检验
- 22.Neyman-Pearson基本引理
- 23.一致最优势检验
- 24.无偏检验与一致最优势无偏检验
- 25.正态概率纸检验
- 26.拟合优度检验
- 27.列联表的独立性检验
- 28.Kolmogorov检验
- 29.正态性检验
- 30.Bayes统计
- 31.先验分布的确定
- 32.Bayes统计推断
- 33.统计判决理论
- 34.Minimax准则
- 35.非参数统计
- 36.符号检验
- 37.Wilcoxon符号秩检验
- 38.抽样调查
- 39.简单随机抽样
- 40.分层随机抽样
- 41.整群随机抽样
抽样调查
约 41 分钟
抽样调查概述
小象实战讲义 · 数据科学的统计基础
在数据科学的实践中,我们常常面对庞大的总体,难以进行全面的普查。本节将开启《抽样调查》的学习,这是数理统计课程的最后一章。我们将从统计调查的基本概念入手,理解如何通过科学、高效地抽取部分样本,来对总体特征进行可靠的推断。学完本节,你将能够区分不同类型的统计调查,理解抽样调查的核心原则与优越性,并为后续学习具体的抽样方法打下坚实的理论基础。
💡 核心导读
- 统计调查的分类:了解全面调查(普查)与非全面调查(包括重点调查、典型调查和抽样调查)的区别与适用场景。
- 抽样调查的核心:掌握抽样调查必须遵循的随机原则,理解其“以样本推断总体”的本质。
- 误差的区分:明确抽样误差(因抽样本身产生的、可度量的误差)与非抽样误差(因调查设计、执行等环节失误造成的偏差)的根本区别。
- 调查实施流程:概览一个科学统计调查从计划、设计到执行、总结的全过程,认识到问卷设计等环节的重要性。
- 常见抽样方法预览:初步认识简单随机抽样、分层抽样、整群抽样、等距抽样和多阶抽样等基本方法。
统计调查的基本概念与分类
统计调查是根据统计任务的要求,运用科学的调查方法,有计划、有组织地收集统计资料的过程。其目的在于获取尽可能准确的综合数字和资料,用以说明调查对象的总体性质和规律。它是对由个人、机构或实体单位所组成的总体进行的科学研究,旨在通过对自然存在的总体进行观察,对其综合特征作出数量描述。
根据调查范围,统计调查可分为两大类:
- 全面调查(普查):对总体的全部单元,在某一时期逐个进行观察和记录。例如,我国每十年一次的人口普查。普查能得到总体的真实参数,但往往成本高昂、耗时费力。
- 非全面调查:只对调查对象中的一部分单元进行调查。它又分为以下几种:
- 重点调查:抽取总体中在数量或比重上占有重要地位的少数单位进行调查。例如,调查几家大型油田以掌握全国石油生产概况;调查几家重点商场以了解市场物价和购买动向。其核心在于被调查单位在总体中具有“权重”优势。
- 典型调查(判定抽样):调查者在对总体已有一定了解的基础上,根据自己的调查目的,有计划地从总体中抽取个别的、具有代表性的典型单位进行深入分析,“解剖麻雀”,以观察趋势、指导一般。例如,毛泽东的《兴国调查》、费孝通的《江村调查》。其核心在于被调查单位的“典型性”而非“权重”。
- 抽样调查:这是本课程的重点。它是按照随机原则,即保证总体中每个单元都有一定概率被抽取的原则,抽取部分总体单元进行调查。所抽取的部分称为随机样本或概率样本。精心设计的概率抽样可以提供能够有效反映总体的样本。
抽样调查的特点与优越性
抽样调查的核心特点
- 按随机原则抽取样本:这是抽样调查科学性的基石。它确保了总体中的每一个个体都有已知的、非零的概率被抽中,从而避免了主观选择带来的偏差。
- 在数量上以样本推断总体:其根本目的是利用样本数据所计算出的统计量(如样本均值 ),来估计或推断总体的相应参数(如总体均值 )。
- 可量化并控制抽样误差:可以在一定的概率保证(置信水平)下,计算抽样误差的大小,并可通过调整样本量等方式将其控制在允许的范围内。这是统计学精妙之处的体现。
抽样调查的优越性
与普查相比,抽样调查具有显著优势:
- 费用较低:只调查总体的一小部分,显著降低了人力、物力和财力成本。
- 速度较快:搜集和处理样本资料远比处理全面资料迅速,在需要快速决策时尤为重要。
- 应用范围广:对于需要专业设备或人员的调查,进行全面普查往往不现实,抽样调查成为唯一可行的方法。它广泛应用于社会科学、公共卫生、商业市场研究等领域。
- 准确度可能更高:由于工作量减少,可以雇佣和培训更高质量的调查员,实施更严格的监督,并对抽出的样本进行更深入、更详细的调查,从而可能获得比粗糙的普查更准确的结果。
一个著名的例子是美国盖洛普公司在1936年总统大选预测中的成功。该公司仅通过科学抽取约5万个配额样本进行问卷调查,就成功预测了富兰克林·罗斯福的当选;而《文学文摘》(Literary Digest)杂志基于电话簿和汽车车主名单发放了数百万份问卷(回收约240万份),但因样本严重偏向富裕阶层(多支持共和党),导致预测失败。这个案例生动地说明了科学抽样设计相对于单纯追求大样本量的重要性。
统计调查的实施与误差控制
一个科学的统计调查通常遵循以下流程,其中每一步都至关重要。
调查实施的关键环节
- 统计调查计划:确定调查任务与目的、调查对象、调查项目,并设计调查问卷或表格。这是整个调查的蓝图。
- 抽样调查方案设计:明确调查总体、抽样框、采用的抽样方法(如简单随机抽样、分层抽样等)以及样本量。
- 问卷与表格设计:这是减少非抽样误差的关键。设计时需注意:
- 结构清晰:包括导语(说明调查机构与目的)、主体问题、结束语。
- 减少偏差:避免诱导性、敏感性问题,或通过婉转的方式提问。问题应简洁明了,问卷不宜过长。
- 保持中立:访问员在调查过程中必须保持中立,忠实记录被访者的回答,不得代答或诱导。
- 调查与数据处理:严格按照方案执行调查,并对回收的数据进行审核、编码、录入和清理。
- 调查总结报告:对数据进行描述性统计分析,呈现主要发现,并形成完整的调查报告,为后续的深入推断分析奠定基础。
抽样误差与非抽样误差
理解并区分这两种误差对于评估调查质量至关重要。
抽样误差:由于只调查了总体的一部分(样本),用样本统计量估计总体参数时所产生的不可避免的差异。例如,用样本均值 估计总体均值 ,其误差 即为抽样误差。它不是错误,而是抽样推断固有的不确定性,可以度量并通过增加样本量来减小。
- 度量方法:包括实际误差 、均方误差 、标准误等。为了消除量纲影响,还可计算相对误差。
非抽样误差:在调查的各个阶段,由于计划不周、设计缺陷、执行错误(如问卷设计不当、访问员诱导、被访者拒答或误答、数据录入错误)等原因造成的误差。它会使资料严重偏离真实情况,且难以度量和控制。前述1936年电话调查的失败,根源就在于抽样框偏差(只覆盖了有电话的富人群体)这一严重的非抽样误差。
核心目标:优秀的调查设计应致力于在可控成本下减小抽样误差,同时通过严谨的流程和设计最大限度地避免非抽样误差。
抽样调查的基本概念与方法预览
基本概念
- 总体:调查研究对象的全体个体构成的集合。在抽样调查中,需明确定义其内容、单位、范围和时间。
- 总体特征数(参数):我们关心的总体数字特征,主要包括四类:总体均值、总体总值、两个总值的比率、以及具有某种属性的单位在总体中所占的比例(总体比例)。
- 概率抽样 vs. 非概率抽样:
- 概率抽样(随机抽样):每个单元被抽中的概率是已知且非零的。这是我们课程中讨论的“抽样调查”所指的方法。
- 非概率抽样:依赖于调查者的主观判断或便利性抽取样本,如“街头偶遇抽样”。这种方法无法计算抽样误差,样本代表性无法保证,应尽量避免在严格的统计推断中使用。
常见抽样方法预览
- 简单随机抽样:从容量为 的总体中,以等概率抽取 个单元。分为“放回”和“不放回”两种。它是其他抽样方法的基础,理论性质最清晰,但实际操作(如编制完整的抽样框)有时较困难。
- 分层随机抽样:先将总体划分为互不重叠的“层”(如按年级、地区划分),然后在每一层内独立地进行简单随机抽样。层内单元尽可能同质,层间差异尽可能大,可以提高估计精度。
- 整群随机抽样:先将总体划分为若干个“群”(如班级、社区),然后随机抽取一部分群,并对被抽中群内的所有单元进行调查。适用于群内单元差异大、群间差异小的情况,便于组织,但精度通常低于简单随机抽样。
- 等距抽样(系统抽样):将总体单元按某种顺序排列,随机确定一个起点,然后每隔固定的间隔 抽取一个单元。操作简便,但若总体存在周期性波动,可能导致严重偏差。
- 多阶抽样:抽样分两个或以上阶段进行。例如,先在全国随机抽省(一阶),再在被抽中的省里随机抽市(二阶),最后在市里随机抽户(三阶)。这是大规模调查(如人口抽样调查)的常用方法。
import numpy as np
import matplotlib.pyplot as plt
from scipy import stats
# 设置随机种子以保证结果可复现
np.random.seed(2025)
# 模拟一个总体:假设某城市成年男性身高服从正态分布 N(175, 6^2)
population_mean = 175
population_std = 6
population_size = 100000 # 假设总体大小为10万
# 生成总体数据(在实际中我们通常无法获得)
population = np.random.normal(loc=population_mean, scale=population_std, size=population_size)
print(f"模拟总体均值: {population_mean:.2f} cm")
print(f"模拟总体标准差: {population_std:.2f} cm")
# 进行一次简单随机抽样(不放回),样本量 n=500
sample_size = 500
sample = np.random.choice(population, size=sample_size, replace=False)
sample_mean = np.mean(sample)
sample_std = np.std(sample, ddof=1) # 样本标准差,使用 ddof=1 计算无偏估计
print(f"\n抽取的样本量: {sample_size}")
print(f"样本均值: {sample_mean:.2f} cm")
print(f"样本标准差: {sample_std:.2f} cm")
# 计算抽样误差(实际误差)
sampling_error = sample_mean - population_mean
print(f"\n本次抽样的实际误差 (样本均值 - 总体均值): {sampling_error:.2f} cm")
# 根据中心极限定理,样本均值的标准误为 sigma / sqrt(n)
# 由于总体标准差未知,用样本标准差估计
standard_error = sample_std / np.sqrt(sample_size)
print(f"样本均值的标准误估计值: {standard_error:.2f} cm")
# 构建总体均值的95%置信区间
confidence_level = 0.95
z_critical = stats.norm.ppf((1 + confidence_level) / 2) # 标准正态分布临界值
margin_of_error = z_critical * standard_error
ci_lower = sample_mean - margin_of_error
ci_upper = sample_mean + margin_of_error
print(f"\n总体均值的95%置信区间: ({ci_lower:.2f}, {ci_upper:.2f}) cm")
print(f"区间宽度: {ci_upper - ci_lower:.2f} cm")
# 可视化:样本均值分布(模拟中心极限定理)
n_simulations = 10000
sample_means = [np.mean(np.random.choice(population, sample_size, replace=False)) for _ in range(n_simulations)]
plt.figure(figsize=(10, 6))
plt.hist(sample_means, bins=50, density=True, alpha=0.7, edgecolor='black', label='样本均值分布')
# 绘制理论正态分布曲线
x = np.linspace(min(sample_means), max(sample_means), 200)
theory_std = population_std / np.sqrt(sample_size) # 理论标准误
plt.plot(x, stats.norm.pdf(x, population_mean, theory_std), 'r-', linewidth=2, label='理论正态分布')
plt.axvline(x=population_mean, color='green', linestyle='--', linewidth=2, label='总体均值')
plt.axvline(x=sample_mean, color='orange', linestyle='--', linewidth=2, label='本次样本均值')
plt.xlabel('样本均值 (cm)')
plt.ylabel('密度')
plt.title('中心极限定理演示:样本均值的抽样分布')
plt.legend()
plt.grid(True, alpha=0.3)
plt.show()📝 动手练一练
情景辨析:某研究机构想了解全国大学生每月平均网络娱乐支出。他们选择了北京大学、清华大学、复旦大学和上海交通大学四所高校,每校随机抽取200名学生进行调查。
- 问题:这主要采用了哪种非全面调查方法?这种抽样设计可能引入什么类型的误差?如何改进?
误差计算:已知某品牌灯泡使用寿命的总体均值为 小时。通过简单随机抽样得到 个样本,计算出的样本均值为 小时,样本标准差为 小时。
- 问题:计算本次抽样的实际误差、样本均值的标准误估计值,以及总体均值的95%置信区间(已知 )。
参考答案:
- 这主要采用了典型调查(判断抽样:研究者凭经验主观选取顶尖高校作为“典型”,属于非概率抽样,校内的随机抽取并不能弥补高校选择环节的偏差)。可能引入的误差包括:非抽样误差中的抽样框偏差(仅选取顶尖高校,无法代表所有层次高校的学生)和选择偏差。改进方法:采用分层随机抽样,先按高校类型(如“双一流”、“普通本科”、“高职高专”等)分层,然后在各层中随机抽取若干高校,再在抽中的高校内随机抽取学生。
- 实际误差: 小时。
- 标准误估计值: 小时。
- 95%置信区间:,即 小时。
本章小结
本节作为《抽样调查》的导论,为我们构建了该领域的整体认知框架。我们首先明确了统计调查的科学内涵,并重点区分了全面调查与非全面调查(重点调查、典型调查、抽样调查)。抽样调查以其随机性、推断性和误差可控性成为现代统计学推断的基石。我们深入探讨了抽样误差(可度量、不可避免)与非抽样误差(应极力避免)的本质区别,并概述了一个科学统计调查从计划、设计、执行到总结的全流程。最后,预览了几种核心的抽样方法,为后续深入学习做好了准备。
行动清单
- 审视调查设计:下次看到任何调查报告(如市场调研、民意测验)时,尝试思考其可能采用的抽样方法,并评估其是否存在明显的非抽样误差风险(如抽样框不全、问卷诱导性强)。
- 模拟理解误差:运行本节提供的Python代码,修改样本量
sample_size,观察样本均值分布、标准误和置信区间宽度的变化,直观理解样本量对抽样误差的影响。 - 预习核心方法:提前思考简单随机抽样、分层抽样和整群抽样分别适用于什么样的现实场景,它们各自的优势和潜在缺点是什么。
— 小象教研组
- 第8章课件:抽样调查(PDF · 7.7MB)下载
领取《小象 11GB VIP 课件资料包与大厂真题手册》
包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。
- ✔完整 Python / 数据分析 Jupyter 实战源码
- ✔大厂真实业务数据集与练习题
- ✔微信扫码添加课程顾问,免费获取网盘下载链接
微信扫码添加顾问