← 返回《数据科学的统计基础》
📑 查看全课大纲(第 35 / 41 节)

非参数统计

约 35 分钟

📺 正在播放小象官方高清录播(支持倍速与清晰度调节)

非参数统计

小象实战讲义 · 数据科学的统计基础

在之前的章节中,我们学习的点估计、区间估计和假设检验等方法,大多建立在一个关键前提之上:总体的分布形式是已知的(如正态分布、泊松分布),我们只需推断其中的未知参数(如均值、方差)。然而,在实际数据分析中,我们常常对数据背后的总体分布知之甚少。本节将开启一门全新的统计学分支——非参数统计。我们将学习当总体分布形式未知时,如何进行统计推断,理解其核心思想、特点与基本概念,为后续学习具体的非参数检验方法奠定基础。

💡 核心导读

本节将为你建立非参数统计的宏观图景:

  1. 概念辨析:明确参数统计与非参数统计的根本区别,理解后者“与分布无关”的核心思想。
  2. 特点剖析:掌握非参数统计方法适用面广、稳健性强等优点,同时也了解其针对性差、依赖大样本等局限性。
  3. 范畴划分:了解非参数统计的两大范畴:经典的基于秩的方法与现代的非参数回归、密度估计等。
  4. 基础概念:掌握“适应任意分布统计量”、“计数统计量”和至关重要的“秩统计量”及其分布性质。

参数统计与非参数统计:两种范式

在进入非参数统计之前,让我们先回顾一下我们已经熟悉的统计推断范式。

参数统计 (Parametric Statistics)

在参数统计问题中,我们通常做如下设定:

  • 总体:设总体 XX 的分布函数为 F(x;θ)F(x; \theta),其中 θΘRk\theta \in \Theta \subseteq \mathbb{R}^k 是一个未知的参数向量
  • 已知信息:分布族 {F(x;θ):θΘ}{F(x; \theta): \theta \in \Theta}数学形式是已知的。例如,我们知道它属于正态分布族 N(μ,σ2)N(\mu, \sigma^2)、泊松分布族 P(λ)P(\lambda) 或指数分布族等。
  • 未知信息:具体的参数值 θ\theta(如 μ,σ2\mu, \sigma^2)是未知的。
  • 推断目标:基于从总体中抽取的样本 X1,X2,,XnX_1, X_2, \dots, X_n,对未知参数 θ\theta 进行点估计、区间估计或假设检验。

核心思想:一旦确定了参数 θ\theta,整个分布就完全确定了。因此,统计推断的核心就是对有限维参数 θ\theta 的推断。我们之前学习的矩估计、极大似然估计、tt 检验、FF 检验等,都属于参数统计方法。

非参数统计 (Nonparametric Statistics)

在实际问题中,我们常常无法获知总体分布的具体数学形式。这时,我们就需要非参数统计方法。其设定如下:

  • 总体:设总体 XX 的分布函数为 F(x)F(x)
  • 已知信息:对 F(x)F(x) 的数学形式一无所知,或仅做一些非常宽泛的假定,如连续性、对称性等。
  • 推断目标:基于样本,对分布函数 F(x)F(x) 本身或其某些特征(如中位数、是否对称等)进行推断。

核心思想:由于对分布形式知之甚少,推断方法必须尽可能不依赖于具体的分布形式,即“与分布无关”。这使得模型通常是无穷维的(因为要估计整个函数 F(x)F(x)),而非有限维的参数 θ\theta

类比理解:参数统计如同已知一个函数是“二次函数 y=ax2+bx+cy=ax^2+bx+c”,目标是通过数据估计 a,b,ca, b, c。而非参数统计则只知道 yyxx 存在某种关系 y=f(x)y=f(x),但对 ff 的形式没有任何限制,目标是从数据中学习 ff 的形状。

非参数统计的特点与范畴

主要特点

  1. 适用面广,针对性差

    • 优点:由于对总体分布假定极少,非参数方法适用于几乎任何分布类型的数据,适用面非常广泛。
    • 缺点:如果事实上总体分布已知(如确实是正态分布),使用非参数方法会损失掉分布形式所蕴含的信息,导致推断效率(如检验功效)低于针对性强的参数方法。因此,在分布信息充足时,应优先使用参数方法。
  2. 大样本理论至关重要

    • 因为对分布信息掌握少,要做出可靠的推断往往需要更多的数据。许多非参数方法优良性质(如估计的相合性、检验的势)的证明都依赖于样本量 nn \to \infty 的渐近理论。
    • 经典例子:经验分布函数 F^n(x)\hat{F}_n(x) 是总体分布函数 F(x)F(x) 的相合估计,且由格里汶科定理保证,当 nn \to \infty 时,supxF^n(x)F(x)a.s.0\sup_x |\hat{F}_n(x) - F(x)| \xrightarrow{a.s.} 0。但在小样本下,F^n(x)\hat{F}_n(x) 可能波动很大。
  3. 使用样本的一般信息

    • 非参数方法通常不直接使用样本的原始数值,而是使用其次序关系符号等与具体分布无关的“一般信息”来构造统计量。
  4. 稳健性高

    • 当真实分布与理论模型(如正态性)发生轻微或中度偏离时,非参数方法因其对模型假定要求低,其性能(如检验的第一类错误率)通常比参数方法更稳定,不易受到偏离的影响。

主要范畴

非参数统计主要包含两大范畴:

  1. 经典的基于秩的非参数统计

    • 这是发展较早、体系较成熟的部分,核心是利用样本的来构造检验统计量。
    • 主要内容:符号检验、Wilcoxon符号秩检验、Mann-Whitney UU 检验(秩和检验)、Kruskal-Wallis HH 检验(多样本秩检验)、分位数估计等。
    • 特点:方法直观,计算相对简单,特别适用于位置参数(如中位数)的检验。
  2. 现代非参数统计

    • 近几十年随着计算能力发展而兴起,主要关注函数估计问题。
    • 主要内容
      • 分布函数与密度函数估计:如核密度估计。
      • 泛函估计:估计依赖于整个分布的量,如均值 μ=xdF(x)\mu = \int x dF(x)
      • 非参数回归与曲线估计:估计变量间的关系 Y=m(X)+ϵY = m(X) + \epsilon,其中 m()m(\cdot) 的形式未知。这包括了局部多项式回归、样条平滑、小波方法等。
    • 特点:模型灵活,能捕捉复杂的数据结构,但计算更复杂,涉及平滑参数的选择。

本章将重点介绍基于秩的非参数统计中的两种基本方法:符号检验和Wilcoxon符号秩检验。

非参数统计的基本概念

为了后续学习具体的检验方法,我们需要先掌握几个核心概念。

适应任意分布统计量 (Distribution-Free Statistic)

在参数统计中,统计量 TT 的分布通常依赖于总体分布 FF。例如,样本均值 Xˉ\bar{X} 的分布,在正态总体下是正态分布,在泊松总体下则近似正态(大样本时),但精确分布不同。

定义:设 F\mathcal{F} 是一族分布函数。统计量 T=T(X1,,Xn)T = T(X_1, \dots, X_n) 称为关于 F\mathcal{F}适应任意分布的,如果 TT 的分布在 F\mathcal{F} 中的每一个分布 FF 下都相同。

意义:这意味着我们无需知道总体 FF 的具体形式,就能知道检验统计量 TT 的精确分布,从而可以方便地计算 pp 值或临界值。

例子:设 F={N(μ,σ2):μR,σ2>0}\mathcal{F} = {N(\mu, \sigma^2): \mu \in \mathbb{R}, \sigma^2 > 0} 为正态分布族。考虑统计量 T=n(Xˉμ0)ST = \frac{\sqrt{n}(\bar{X} - \mu_0)}{S} 其中 Xˉ\bar{X} 为样本均值,SS 为样本标准差。当总体服从 N(μ,σ2)N(\mu, \sigma^2) 时,无论 μ\muσ2\sigma^2 取何值,TT 都服从自由度为 n1n-1tt 分布。因此,TT 关于正态分布族 F\mathcal{F} 是适应任意分布的。这正是我们做单样本 tt 检验的基础。

计数统计量 (Counting Statistic)

这是一种简单但非常有用的非参数统计量。

定义:设 XX 是一个随机变量,θ0\theta_0 是一个给定的实数。定义随机变量 ϕ(Xθ0)={1,若 Xθ0>00,若 Xθ00\phi(X - \theta_0) = \begin{cases} 1, & \text{若 } X - \theta_0 > 0 \ 0, & \text{若 } X - \theta_0 \le 0 \end{cases} 则称 ϕ(Xθ0)\phi(X - \theta_0)XXθ0\theta_0 分段的计数统计量

意义:它只记录样本点相对于某个阈值 θ0\theta_0符号(正或非正),而忽略了具体的数值大小。后续的符号检验就是基于这种思想。

秩统计量 (Rank Statistic) 及其分布

是非参数统计中最重要的概念之一。

定义:设 Z1,Z2,,ZnZ_1, Z_2, \dots, Z_n 是来自连续分布 F(z)F(z) 的简单随机样本。将其按从小到大的顺序排列,得到次序统计量 Z(1)Z(2)Z(n)Z_{(1)} \le Z_{(2)} \le \dots \le Z_{(n)}。 定义 RiR_iZiZ_i 在次序统计量中的位置,即如果 Zi=Z(r)Z_i = Z_{(r)},则定义 Ri=rR_i = r。称 RiR_iZiZ_i。 向量 R=(R1,R2,,Rn)\mathbf{R} = (R_1, R_2, \dots, R_n) 称为秩统计量

例子:设样本观测值为 (5,1,3,4)(5, 1, 3, 4)

  • 排序后为:(1,3,4,5)(1, 3, 4, 5)
  • 因此,55 的秩 R1=4R_1 = 411 的秩 R2=1R_2 = 133 的秩 R3=2R_3 = 244 的秩 R4=3R_4 = 3
  • 秩向量为 R=(4,1,2,3)\mathbf{R} = (4, 1, 2, 3)

关键性质:由于总体分布 FF 是连续的,样本观测值几乎必然互不相等,因此秩是唯一确定的。如果出现相等值(称为“结”,tie),则需要特殊的处理方法,如取平均秩。

秩统计量具有非常优美的分布性质,这使其成为构造适应任意分布检验统计量的理想基石。

定理 1(秩向量的分布):设 Z1,,Zni.i.d.F(z)Z_1, \dots, Z_n \stackrel{\text{i.i.d.}}{\sim} F(z)FF 连续。则秩向量 R=(R1,,Rn)\mathbf{R} = (R_1, \dots, R_n) 在样本空间 R={(r1,,rn):(r1,,rn) 是 (1,2,,n) 的一个排列}\mathcal{R} = {(r_1, \dots, r_n): (r_1, \dots, r_n) \text{ 是 } (1,2,\dots,n) \text{ 的一个排列}} 上服从均匀分布。即,对于 R\mathcal{R} 中的任意一个排列 r\mathbf{r},有 P(R=r)=1n!.P(\mathbf{R} = \mathbf{r}) = \frac{1}{n!}.

定理 2(边缘分布):在定理1的条件下,

  1. 一维边缘分布:对任意 iiP(Ri=r)=1nP(R_i = r) = \frac{1}{n}r=1,2,,nr = 1, 2, \dots, n。即 RiR_i{1,,n}{1, \dots, n} 上均匀分布。
  2. 二维边缘分布:对任意 iji \ne jP(Ri=r,Rj=s)=1n(n1)P(R_i = r, R_j = s) = \frac{1}{n(n-1)}r,s{1,,n}r, s \in {1, \dots, n}rsr \ne s

基于上述均匀分布性质,我们可以推导出秩统计量的数字特征。

定理 3(秩的数字特征):设 RiR_i 为第 ii 个观测值的秩,则有

  1. 期望E(Ri)=n+12E(R_i) = \frac{n+1}{2}
  2. 方差Var(Ri)=(n+1)(n1)12=n2112\mathrm{Var}(R_i) = \frac{(n+1)(n-1)}{12} = \frac{n^2 - 1}{12}
  3. 协方差:对于 iji \ne jCov(Ri,Rj)=n+112\mathrm{Cov}(R_i, R_j) = -\frac{n+1}{12}

证明(期望与方差): 由于 RiUniform{1,2,,n}R_i \sim \text{Uniform}{1, 2, \dots, n},其期望为: E(Ri)=r=1nr1n=1nn(n+1)2=n+12.E(R_i) = \sum_{r=1}^{n} r \cdot \frac{1}{n} = \frac{1}{n} \cdot \frac{n(n+1)}{2} = \frac{n+1}{2}. 其方差为: Var(Ri)=E(Ri2)[E(Ri)]2=r=1nr21n(n+12)2=1nn(n+1)(2n+1)6(n+1)24=(n+1)(2n+1)6(n+1)24=(n+1)[2(2n+1)3(n+1)]12=(n+1)(n1)12=n2112.\begin{aligned} \mathrm{Var}(R_i) &= E(R_i^2) - [E(R_i)]^2 \ &= \sum_{r=1}^{n} r^2 \cdot \frac{1}{n} - \left( \frac{n+1}{2} \right)^2 \ &= \frac{1}{n} \cdot \frac{n(n+1)(2n+1)}{6} - \frac{(n+1)^2}{4} \ &= \frac{(n+1)(2n+1)}{6} - \frac{(n+1)^2}{4} \ &= \frac{(n+1)[2(2n+1) - 3(n+1)]}{12} \ &= \frac{(n+1)(n-1)}{12} = \frac{n^2 - 1}{12}. \end{aligned} 协方差的证明类似,可利用 E(RiRj)E(R_i R_j) 进行计算,此处从略。

这些性质非常重要,它们不依赖于总体分布 FF 的具体形式,只与样本量 nn 有关。在后续构造基于秩的检验统计量时,我们可以直接利用这些已知的期望和方差来推导统计量的渐近分布。

import math
import numpy as np
import scipy.stats as stats

# 验证秩统计量的数字特征(通过模拟)
np.random.seed(2025)  # 固定随机种子
n = 10  # 样本量
n_sim = 10000  # 模拟次数

# 从任意连续分布(这里用标准正态分布)中抽样
all_ranks = []
for _ in range(n_sim):
    sample = np.random.randn(n)  # 来自N(0,1)的样本
    ranks = stats.rankdata(sample)  # 计算秩 (1, 2, ..., n)
    all_ranks.append(ranks)

all_ranks = np.array(all_ranks)  # 形状:(n_sim, n)

# 计算第一个观测值秩 R1 的模拟均值和方差
R1_sim = all_ranks[:, 0]
mean_R1_sim = np.mean(R1_sim)
var_R1_sim = np.var(R1_sim, ddof=1)  # 样本方差

# 理论值
mean_R1_theory = (n + 1) / 2
var_R1_theory = (n**2 - 1) / 12

print(f"样本量 n = {n}")
print(f"模拟次数 = {n_sim}")
print("-" * 40)
print(f"R1 的模拟均值: {mean_R1_sim:.4f}")
print(f"R1 的理论均值: {mean_R1_theory:.4f}")
print(f"差值: {abs(mean_R1_sim - mean_R1_theory):.6f}")
print("-" * 40)
print(f"R1 的模拟方差: {var_R1_sim:.4f}")
print(f"R1 的理论方差: {var_R1_theory:.4f}")
print(f"差值: {abs(var_R1_sim - var_R1_theory):.6f}")

# 验证秩向量的均匀分布(观察一个特定排列的出现频率)
# 特定排列:自然顺序 (1, 2, ..., n)。在原样本严格递增时出现。
# 对于连续分布,样本严格递增的概率 = 1/n!
target_perm_freq_sim = np.mean(np.all(all_ranks == np.arange(1, n+1), axis=1))
target_perm_prob_theory = 1 / math.factorial(n)

print("-" * 40)
print(f"排列 (1,2,...,n) 的模拟出现频率: {target_perm_freq_sim:.6f}")
print(f"排列 (1,2,...,n) 的理论概率 (1/n!): {target_perm_prob_theory:.6f}")

📝 动手练一练

  1. 概念辨析:某工厂生产一种零件,其长度规格为 10.0±0.110.0 \pm 0.1 mm。质检员从生产线上随机抽取 n=8n=8 个零件,测量其长度。若已知零件长度服从正态分布,检验其均值是否为 10.010.0 mm,应使用参数方法还是非参数方法?若对该零件的长度分布一无所知,又应使用哪种方法?请简述理由。

  2. 秩的计算与性质:从某总体中抽取一个容量为 55 的样本,观测值为:{12.3,8.9,11.1,10.5,9.7}{12.3, 8.9, 11.1, 10.5, 9.7}

    • a) 计算每个观测值的秩。
    • b) 计算秩向量 R\mathbf{R} 的期望 E(R)E(\mathbf{R})(即每个分量的期望组成的向量)。
    • c) 计算第一个观测值秩 R1R_1 的理论方差。

参考答案

  1. 若已知长度服从正态分布,应使用参数方法(如单样本 tt 检验),因为可以利用分布信息,检验更有效(功效更高)。若对分布一无所知,应使用非参数方法(如符号检验或Wilcoxon符号秩检验),因为其不依赖于分布假定,结论更稳健。
    • a) 排序后观测值为:8.9, 9.7, 10.5, 11.1, 12.3。对应秩为:8.9→1, 9.7→2, 10.5→3, 11.1→4, 12.3→5。故秩向量 R=(5,1,4,3,2)\mathbf{R} = (5, 1, 4, 3, 2)
    • b) 对于 n=5n=5E(Ri)=(5+1)/2=3E(R_i) = (5+1)/2 = 3。故 E(R)=(3,3,3,3,3)E(\mathbf{R}) = (3, 3, 3, 3, 3)
    • c) Var(R1)=(521)/12=24/12=2\mathrm{Var}(R_1) = (5^2 - 1)/12 = 24/12 = 2

本章小结

本节作为非参数统计的导论,为你搭建了该领域的整体框架:

  • 核心思想:在总体分布形式未知或假定极少的情况下,利用与分布无关的样本信息(如符号、秩)进行统计推断。
  • 方法特点:认识到非参数方法具有适用面广、稳健性强的优点,但也存在针对性差、更依赖大样本的局限性。在实际应用中,应根据对总体信息的了解程度,在参数与非参数方法间做出权衡。
  • 知识范畴:了解了非参数统计包含经典的基于秩的推断(如符号检验、秩和检验)和现代的函数估计(如密度估计、非参数回归)两大范畴。本章后续将聚焦于前者。
  • 关键概念:掌握了适应任意分布统计量计数统计量秩统计量的定义。重点推导并理解了秩统计量在样本空间上服从均匀分布这一根本性质,以及由此导出的秩的期望、方差等数字特征。这些是后续所有基于秩的检验方法的理论基础。

🎯 行动清单

学完本节,你可以立即:

  1. 审视你的数据:面对一个新的数据集,在应用统计方法前,先问自己:我对总体分布有足够的了解吗?是否需要先进行正态性检验?
  2. 理解方法选择:当看到“符号检验”、“Wilcoxon检验”等名词时,能意识到它们属于非参数方法,适用于分布未知或数据不满足参数方法假定的情形。
  3. 动手验证:使用Python的 scipy.stats.rankdata 函数对你手头的一组数据计算秩,并验证其均值是否接近 (n+1)/2(n+1)/2

— 小象教研组

配套学习资源与课件
  • 第7章课件:非参数统计(PDF · 1.8MB)
    下载
🎁 免费学习资源

领取《小象 11GB VIP 课件资料包与大厂真题手册》

包含全套实战 Jupyter 源码、清洗后数据集、大厂高频面试真题与专属学员答疑交流群。

  • 完整 Python / 数据分析 Jupyter 实战源码
  • 大厂真实业务数据集与练习题
  • 微信扫码添加课程顾问,免费获取网盘下载链接
微信二维码:扫码添加课程顾问微信扫码添加顾问