← 返回《数据科学的统计基础》
📑 查看全课大纲(第 41 / 41 节)

整群随机抽样

约 10 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

整群随机抽样

小象实战讲义 · 数据科学的统计基础

在学习了简单随机抽样和分层随机抽样后,我们面对一个现实问题:当总体单元难以逐个获取,或者逐个调查成本过高时,如何高效地进行抽样调查?本节介绍的整群随机抽样,正是解决这类问题的利器。学完本节,你将理解整群抽样的核心思想、适用场景,并能清晰地区分它与分层抽样的异同,为在实际项目中设计经济高效的调查方案打下基础。

💡 核心导读

  • 核心定义:理解整群抽样是将总体划分为若干“群”,以“群”为抽样单位进行随机抽取,并对抽中的群进行全面调查的抽样方法(群内不再二次抽样,属于单阶段整群抽样;若在群内再抽子样本,则称为两阶段抽样)。
  • 关键对比:掌握整群抽样与分层抽样在分组原则、抽样阶段(群间/层间、群内/层内)以及方差分解目标上的根本区别。
  • 设计原则:领会整群抽样“群内差异大、群间差异小”的设计原则,并理解其背后的统计效率逻辑。
  • 适用场景:识别四种典型的适用整群抽样的现实约束条件,如调查成本高、总体单元名单难以获取等。
  • 方差分解:了解总体方差可以分解为群内方差与群间方差之和,这是理解整群抽样估计量性质的基础。

整群抽样的基本概念

整群随机抽样(Cluster Random Sampling)是一种将总体划分为若干互不重叠的组,每个组称为一个“群”或“集团”(Cluster),然后以“群”作为基本抽样单位进行随机抽样,并对抽中的群进行全面调查的抽样方法。

其操作流程可概括为两个阶段:

  1. 第一阶段(群间抽样):从总体所有群中,随机抽取若干个群。
  2. 第二阶段(群内调查):对每一个被抽中的群,对其包含的所有总体单元(即群内所有个体)进行调查,不进行二次抽样。

一个典型例子:某饮料生产商需要检测其生产的某批次饮料的某项质量指标(如糖度)。如果一瓶一瓶地随机抽取并检测,操作繁琐且可能破坏包装。更高效的做法是:以“箱”为单位,随机抽取若干箱饮料,然后对抽中的每一箱内的所有饮料进行检测。这里,每一“箱”就是一个“群”。

等群与非等群

设总体被划分为 RR 个群,第 ii 个群包含 MiM_i 个总体单元,则总体单元总数为: N=i=1RMiN = \sum_{i=1}^{R} M_i

  • 等群:如果每个群包含的单元数相等,即 M1=M2==MR=MM_1 = M_2 = \dots = M_R = M,则称为等群抽样。上例中,若每箱饮料瓶数相同,即为等群。
  • 非等群:如果各群包含的单元数不相等,则称为非等群抽样。例如,调查城市中的社区,每个社区的住户数通常不同。

分组必须满足的条件

与分层抽样类似,对总体进行分群时必须满足以下条件:

  1. 完备性:总体中的每个单元必须属于且仅属于某一个群。
  2. 已知性:每个群所含的总体单元数 MiM_i 是确切已知的。
  3. 随机性:群的抽取必须遵循随机原则(如对群做简单随机抽样),保证每个群以已知的、非零的概率被抽中。

整群抽样与分层抽样的对比

整群抽样与分层抽样在形式上都涉及对总体进行分组,但它们在设计思想、操作方法和统计目标上存在本质区别。理解这些区别是掌握两种方法的关键。

下表清晰地概括了二者的核心差异:

对比维度分层随机抽样 (Stratified Sampling)整群随机抽样 (Cluster Sampling)
分组目的缩小层内差异,扩大层间差异。扩大群内差异,缩小群间差异。
抽样阶段1. 层间:全面调查(每层都抽)。
2. 层内:简单随机抽样。
1. 群间:简单随机抽样。
2. 群内:全面调查。
适用场景层间差异明显,层内有代表性名单。缺乏总体单元名单,或逐个调查成本高、操作难。
统计效率目标通过控制层内方差,使总体估计量的方差最小化。通过控制群间方差,使总体估计量的方差最小化。

核心原则解读

  • 分层抽样“层内同质、层间异质”:因为我们在每一层内部都进行随机抽样,层内方差会影响估计精度。层内单元越相似(方差小),从该层抽出的样本对该层的代表性就越好,从而降低整个估计量的方差。层间差异大,则能确保样本覆盖总体的各个不同部分。
  • 整群抽样“群内异质、群间同质”:因为我们抽中的群会被全部调查,所以群内的变异不会引入额外的抽样误差。影响估计精度的主要来源是群与群之间的差异。如果群间差异小,意味着随便抽哪个群来普查,得到的结果都差不多,估计自然就准。反之,如果群间差异大,只抽少数几个群就可能严重偏离总体。

为什么使用整群抽样?

在实际调查中,选择整群抽样通常源于以下几类现实约束或考量:

  1. 调查成本约束:当对单个总体单元进行抽样或调查的成本非常高昂时。例如,在全国范围内进行入户调查,交通和人力成本巨大。若以“行政村”或“社区”为群进行抽样,然后对抽中的社区进行普查,能极大节省成本。
  2. 调查对象特性:某些调查对象天然以“群”的形式存在,且破坏群结构进行调查不经济或不现实。例如,检测整箱包装的食品、药品,检查集装箱内的货物,评估班级整体的教学效果等。打开包装只取一个,显然浪费且可能影响剩余物品。
  3. 缺乏抽样框:当没有可靠的总体所有个体的名单(抽样框),或编制这样一份名单成本过高时。例如,调查一个大型城市的所有流动商贩。我们可能很容易获得“市场”或“街区”的名单,但难以获得所有商贩的名单。此时可以以“市场”为群进行抽样。
  4. 操作便利性:在样本量相同的条件下,整群抽样的样本单元在地理或逻辑上相对集中。虽然这可能因为群内个体的相似性(违背“群内异质”原则)而导致样本代表性下降,即估计效率低于简单随机抽样,但它能大幅节省调查时间、人力和财力。在精度要求不是极端严格,而成本和时间是关键因素的场景下,整群抽样是实用选择。

整群抽样的方差分解

与分层抽样类似,整群抽样中总体方差也可以进行分解,这有助于我们从理论上理解其估计量的性质。

设总体有 RR 个群,第 ii 个群有 MiM_i 个单元,第 ii 群第 jj 个单元的观测值为 YijY_{ij}。总体总值为 Y=i=1Rj=1MiYijY = \sum_{i=1}^{R} \sum_{j=1}^{M_i} Y_{ij},总体均值为 Yˉ=Y/N\bar{Y} = Y / N

总体总方差(Total Sum of Squares, TSS)可以分解为群内方差(Within-cluster Sum of Squares, WSS)和群间方差(Between-cluster Sum of Squares, BSS)之和: TSS=WSS+BSS\text{TSS} = \text{WSS} + \text{BSS}

其中:

  • 群内方差 (WSS):衡量同一个群内部各单元之间的变异。 WSS=i=1Rj=1Mi(YijYˉi)2\text{WSS} = \sum_{i=1}^{R} \sum_{j=1}^{M_i} (Y_{ij} - \bar{Y}i)^2 这里 Yˉi=1Mij=1MiYij\bar{Y}i = \frac{1}{M_i} \sum{j=1}^{M_i} Y{ij} 是第 ii 群的群内均值。
  • 群间方差 (BSS):衡量不同群的群均值之间的变异。 BSS=i=1RMi(YˉiYˉ)2\text{BSS} = \sum_{i=1}^{R} M_i (\bar{Y}_i - \bar{Y})^2

这一分解的实践意义:在整群抽样中,由于对抽中的群进行普查,群内方差不会贡献给最终估计量的抽样误差。估计量方差主要来源于群间方差。因此,为了获得更精确的估计(即更小的估计量方差),我们在设计分群方案时,应努力使 BSS 尽可能小(群间同质),即使得 WSS 尽可能大(群内异质)。这与前面提到的设计原则完全一致。

对于等群情形(Mi=MM_i = M),总体均值 Yˉ\bar{Y} 的估计量 Yˉ^\hat{\bar{Y}} 的方差公式与群间方差密切相关,具体推导虽超出本入门课程范围,但其结论强化了“缩小群间差异”的重要性。

📝 动手练一练

  1. 场景辨析:某教育研究机构希望评估全国小学五年级学生的数学素养。现有两种抽样方案:

    • 方案A:将全国所有小学按城市、县镇、农村分为三层,每层按学校规模比例抽取若干所学校,然后在抽中的学校内随机抽取一个五年级班级进行测试。
    • 方案B:将全国所有小学五年级的班级名单作为抽样框,直接随机抽取若干个班级,并对抽中班级的所有学生进行测试。 请问,方案A和方案B分别主要采用了哪种抽样方法?并简要说明理由。
  2. 方差分解计算:假设一个微型总体由2个群(A群和B群)构成,用于模拟整群抽样。

    • A群有3个单元,值分别为:2, 4, 6
    • B群有2个单元,值分别为:5, 7 请计算: a) 总体均值 Yˉ\bar{Y}。 b) 群内方差 (WSS) 和群间方差 (BSS)。 c) 验证 TSS = WSS + BSS。

参考答案:

  1. 方案A主要采用了分层随机抽样(以学校类型分层)与整群抽样(以班级为群)相结合的多阶段抽样。方案B是典型的**(单阶段)整群随机抽样**,直接以班级为群进行抽取并普查。
  2. a) 总体总值 Y=(2+4+6)+(5+7)=24Y = (2+4+6) + (5+7) = 24,总体单元数 N=5N=5,故 Yˉ=24/5=4.8\bar{Y} = 24/5 = 4.8。 b) A群均值 YˉA=(2+4+6)/3=4\bar{Y}_A = (2+4+6)/3 = 4;B群均值 YˉB=(5+7)/2=6\bar{Y}_B = (5+7)/2 = 6。 WSS = [(24)2+(44)2+(64)2]+[(56)2+(76)2]=(4+0+4)+(1+1)=10[(2-4)^2+(4-4)^2+(6-4)^2] + [(5-6)^2+(7-6)^2] = (4+0+4) + (1+1) = 10。 BSS = 3×(44.8)2+2×(64.8)2=3×0.64+2×1.44=1.92+2.88=4.83 \times (4-4.8)^2 + 2 \times (6-4.8)^2 = 3 \times 0.64 + 2 \times 1.44 = 1.92 + 2.88 = 4.8。 c) TSS = (24.8)2+(44.8)2+(64.8)2+(54.8)2+(74.8)2=7.84+0.64+1.44+0.04+4.84=14.8(2-4.8)^2+(4-4.8)^2+(6-4.8)^2+(5-4.8)^2+(7-4.8)^2 = 7.84+0.64+1.44+0.04+4.84=14.8。 而 WSS + BSS = 10 + 4.8 = 14.8,验证成立。
import numpy as np

# 设置随机种子确保结果可复现
np.random.seed(2025)

# 模拟一个符合“群内异质、群间同质”原则的总体
# 假设有5个群,每个群有10个单元
num_clusters = 5
units_per_cluster = 10

# 生成数据:每个群有自己的基准水平(群均值相近),但群内波动大
cluster_means = np.random.normal(loc=100, scale=5, size=num_clusters)  # 群均值,尺度小表示群间差异小
print(f"模拟的{num_clusters}个群的群均值:{cluster_means.round(2)}")
print(f"群均值的方差(代表群间差异):{np.var(cluster_means):.4f}\n")

data = []
for i, mu in enumerate(cluster_means):
    # 群内数据围绕群均值波动,尺度大表示群内差异大
    cluster_data = np.random.normal(loc=mu, scale=15, size=units_per_cluster)
    data.append(cluster_data)
    print(f"群{i+1} (均值={mu:.2f}) 内部数据方差:{np.var(cluster_data):.2f}")

# 将数据展平为总体
population = np.concatenate(data)
print(f"\n总体均值:{population.mean():.2f}")
print(f"总体方差:{population.var(ddof=0):.2f}")

# 手动计算方差分解
overall_mean = population.mean()
wss = 0
bss = 0

for cluster_data in data:
    cluster_mean = cluster_data.mean()
    # 计算该群的群内方差贡献
    wss += ((cluster_data - cluster_mean) ** 2).sum()
    # 计算该群的群间方差贡献 (权重为群大小)
    bss += len(cluster_data) * (cluster_mean - overall_mean) ** 2

print(f"\n计算验证:")
print(f"群内方差和 (WSS):{wss:.2f}")
print(f"群间方差和 (BSS):{bss:.2f}")
print(f"总和 (WSS+BSS):{wss + bss:.2f}")
print(f"总体方差 * N:{population.var(ddof=0) * len(population):.2f}")
print(f"两者是否相等?{np.isclose(wss + bss, population.var(ddof=0) * len(population))}")

本章小结

本节系统介绍了抽样调查中的另一种重要方法——整群随机抽样。

要点回顾

  1. 定义与流程:整群抽样是以“群”为初级抽样单位进行随机抽取,并对中选群进行全面调查的方法(单阶段整群抽样;若群内再抽子样本则为两阶段抽样)。分为等群与非等群。
  2. 核心对比:与分层抽样相比,整群抽样在分组原则(群内异质/层内同质)、抽样阶段(群间抽/层内抽)上截然相反,根本原因在于它们控制误差的来源不同。
  3. 设计原则:为提高估计效率,整群抽样应遵循“扩大群内差异,缩小群间差异”的原则,因为估计量的方差主要来源于群间差异。
  4. 适用场景:整群抽样特别适用于调查单元难以获取、调查成本高昂、调查对象天然成群或缺乏完整抽样框的实际情况,其优势在于能显著节省成本和时间。
  5. 理论基础:总体方差可分解为群内方差与群间方差之和,这为理解整群抽样估计量的性质提供了理论框架。

行动清单

  • 下次设计调查:当面临名单缺失或成本压力时,主动思考能否以某种自然或行政单元作为“群”来实施整群抽样。
  • 阅读研究报告:看到“以XX为抽样单位进行调查”的描述时,尝试判断其是否采用了整群抽样,并思考其分群方式是否符合“群内异质”的原则。
  • 进行方案评估:在比较抽样方案时,不仅能计算简单随机抽样所需的样本量,也能初步评估若采用整群抽样,其设计效应(Design Effect)可能大于1(即需要更大样本以达到相同精度),从而在成本与精度间做出权衡。

— 小象教研组

配套学习资源与课件
  • 第8章课件:抽样调查(PDF · 7.7MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问