ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

非参数统计期末复习:核心概念与检验方法选择速查

非参数统计期末复习:核心概念与检验方法选择速查 非参数统计这门课不少同学复习时最容易学成“一堆检验的堆砌”符号检验、秩和检验、游程检验、Kruskal-Wallis、Friedman……每个看起来都差不多真拿到题目又不知道该选哪个。这篇文章不打算铺开讲全部理论而是站在期末复习的角度把非参数统计的核心概念、常用方法、易混淆对比点一次性整理清楚重点放在“怎么选方法”和“怎么套步骤得分”。适合学过一遍但还没形成知识体系的朋友拿来抱佛脚也适合想快速盘点重点、害怕大题算不对的同学直接照着搭框架。1. 先搞清楚非参数统计到底在做什么1.1 参数统计和非参数统计的分界线很多同学对非参数统计的第一印象是“不用正态分布”这个说法对但不完整。更准确地说参数统计的核心思路是先假设总体服从某个已知分布最常见的是正态分布然后只对分布里的参数——比如均值 μ、方差 σ²——做估计和检验。t 检验、F 检验、Z 检验都属于这条路它们的推断精度高但前提是分布假设必须靠谱。非参数统计的思路完全不同它不关心总体具体是什么分布而是直接利用样本本身的排序信息、符号信息或者秩信息来做推断。所以它也被称为“分布自由”方法。比如中位数的检验、等级数据的比较、分类数据的独立性判断都属于非参数方法。这不是说非参数方法没有假设而是它的假设比参数方法宽松得多比如对分布形状通常只要求连续、对称这类相对弱的条件。从复习角度看判断一道题该用参数还是非参数记住三个信号就行样本量很小、数据明显偏态或存在异常值、数据本身就是等级或顺序数据。遇到这三种情况优先考虑换非参数方法。反过来如果数据量大、分布接近正态、又是连续变量参数方法通常检验功效更高这也是“为什么参数方法还占主流”的根本原因——非参数方法稳健但略保守参数方法灵敏但脆弱。1.2 期末最容易考到的概念辨析非参数统计期末选择题里最高频的概念跳不开这几个秩、符号、经验分布函数、检验功效、渐近相对效率。其中“秩”是核心中的核心。所谓秩就是把一组数据从小到大排序后每个观测值所占据的位置编号。最小值的秩是 1最大值是 n。出现并列的值时一般取平均秩。后面讲的所有秩检验本质上都是把原始数据“降维”成秩再做计算。“符号”就更简单了只记录数据是大于还是小于某个参考值大于记正号小于记负号不考虑具体差多少。符号检验只用符号Wilcoxon 符号秩检验在符号基础上还叠加了秩所以它比符号检验利用的信息更多、功效更高。这道辨析题几乎是每年必考问“符号检验和符号秩检验的区别是什么”标准答法就是“符号检验仅利用差异方向符号秩检验同时利用差异方向和差异大小的秩”。经验分布函数也常考它在每个观测点处往上跳 1/n 的阶梯函数Kolmogorov-Smirnov 检验就是比较经验分布函数和理论分布函数之间的最大距离。这个概念不难但容易和概率密度函数、直方图搞混复习时抓一个本质经验分布函数是“样本自己长出来的分布”不需要任何假设。2. 单样本问题符号检验与 Wilcoxon 符号秩检验2.1 符号检验只数正负号思路最朴素符号检验是理解非参数方法的最佳入口。典型问题是已知样本 x₁, x₂, …, xₙ想检验总体中位数是否等于某个指定值 M₀。做法很简单——把每个样本值和 M₀ 比大于记正号小于记负号等于则剔除。然后数一数正号个数 S₊。如果中位数真的是 M₀正号和负号的数量应当差不多也就是 S₊ 服从成功概率 p0.5 的二项分布。检验时直接算 P 值P(S ≥ S₊)再和显著性水平比较。这里有个重要推导符号检验其实是“配对样本中位数差是否为 0”的检验。把配对数据相减得到差值 dᵢ然后对差值做单样本符号检验就是配对符号检验。考试里如果给你 10 对治疗前后的数据让你检验治疗是否有效那就是这个套路。符号检验的优点是非常稳健计算量极小手算也快缺点是只记方向、不记幅度浪费了大量信息所以功效相对低。期末如果问“为什么有了符号检验还要学 Wilcoxon 符号秩检验”答案就落在功效上。2.2 Wilcoxon 符号秩检验符号检验的进阶版Wilcoxon 符号秩检验是期末计算题的重灾区但它步骤清晰按部就班做就行。设原假设仍是 H₀: 中位数 M₀。第一步算差值 dᵢ xᵢ − M₀。第二步把差值绝对值 |dᵢ| 排序剔除差值为 0 的数据剩余 n 个非零差值按绝对值从小到大赋秩绝对值相同的取平均秩。第三步给每个秩恢复原差值的正负号得到正符号秩和 W₊、负符号秩和 W₋。第四步检验统计量 W min(W₊, W₋)或者直接用 W₊。小样本n 30 左右查 Wilcoxon 临界值表大样本可以用正态近似E(W₊) n(n1)/4Var(W₊) n(n1)(2n1)/24然后计算 Z (W₊ − E(W₊)) / √Var(W₊)。这里的关键细节是Wilcoxon 符号秩检验要求差值分布近似对称如果数据严重偏态结果会失真。我复习时经常把符号检验和 Wilcoxon 放在一起对比记忆符号检验把差值变成“/−”两个类别Wilcoxon 把差值变成“带正负号的秩”后者多利用了差值的相对大小所以功效更高但符号检验几乎不需要任何前提更加万金油。2.3 游程检验检验“随机性”的特殊单样本方法游程检验Runs Test也是单样本问题但它检验的对象不是位置而是随机性。典型场景给你一组按时间顺序记录的观测值检验它是不是纯随机序列。做法是把数据按某个参考值通常是中位数分成两类比如高于中位数记为 A低于中位数记为 B然后去数连续相同字母组成的段数这个段数就叫游程数 R。游程数的直觉很好理解R 太小时说明序列有聚集倾向比如前面全是 A后面全是 B说明数据不是随机产生R 太大时说明序列有系统交替倾向比如 A、B、A、B 来回跳同样也不随机。大样本下游程数 R 近似正态分布期望和方差分别为 E(R) 1 2n₁n₂/(n₁n₂) 和 Var(R) 2n₁n₂(2n₁n₂ − n₁ − n₂) / [(n₁n₂)²(n₁n₂−1)]考试直接代入公式再查正态分布表。期末问“游程检验的原假设是什么”标准答案是“样本序列是随机的”这个千万别写成“均值相等”或者“分布相同”。3. 两样本与多样本检验期末大题的主战场3.1 Mann-Whitney U 检验与 Wilcoxon 秩和检验学过非参数统计的人一定绕不开 Mann-Whitney U 检验它和 Wilcoxon 秩和检验经常混着出题其实两个名字指的是同一个检验的两种等价表达。适用场景是两个独立样本比较它们的总体分布位置是否相同原假设是“两总体分布相同”等价说法是“两总体中位数相等”。考试里最常给的形式是两组观测值样本量分别是 n₁ 和 n₂让你检验两组是否存在显著差异。手算步骤如下第一步把两组数据合并从小到大统一排序。第二步对所有观测值赋秩并列取平均秩。第三步分别计算两组的秩和 R₁ 和 R₂。第四步计算 U₁ n₁n₂ n₁(n₁1)/2 − R₁U₂ n₁n₂ − U₁检验统计量取 U min(U₁, U₂)。小样本查 U 临界值表大样本时用正态近似Z (U − n₁n₂/2) / √(n₁n₂(n₁n₂1)/12)。注意 U₁ 和 U₂ 的关系理论上 U₁ U₂ n₁n₂这个等式可以用来检查计算有没有出错我考试时习惯每步都验算一下。这里提醒一个记法技巧Mann-Whitney U 的实质是比较“跨样本的顺序关系”。U₁ 大代表第一组的值普遍偏大U₁ 小代表第一组的值普遍偏小。如果两组完全混合、差异很小U 就会接近 n₁n₂/2。所以最后判断拒绝与否本质是看 U 偏离中心值 n₁n₂/2 有多远。许多同学记公式容易把 n₁(n₁1)/2 和 n₂(n₂1)/2 搞混其实只要写一步公式里减去的永远是“本组的秩和与最小可能秩和之间的差距”思路理顺了就不会错。3.2 Kruskal-Wallis 检验多样本独立比较Kruskal-Wallis 检验是 Mann-Whitney U 检验向多样本的推广对应的是单因素方差分析ANOVA的非参数版本。适用场景是 k 个独立样本检验 k 个总体的位置是否相同原假设是“k 个总体分布相同”或“k 个中位数相等”。期末大题如果给你 3 组数据每组 5 个观测让你比较三组差异那就是它。计算步骤第一步把 k 组数据全部合并统一排序赋秩并列值取平均秩。第二步计算第 i 组的秩和 Rᵢ样本量为 nᵢ总样本量 N Σnᵢ。第三步计算 Kruskal-Wallis 统计量 HH [12 / (N(N1))] × Σ(Rᵢ²/nᵢ) − 3(N1)自由度是 k−1查卡方分布表。当 k2 时H 统计量恰好等于 Mann-Whitney U 的某种变形这一点很多教材会提记住的话可以帮你理解“不同检验之间其实是层层递进的”。还有一个细节数据存在大量并列秩时需要对 H 做结校正校正式子是 H_c H / [1 − Σ(t³−t)/(N³−N)]其中 t 是每个“结”里并列观测的个数。简单说并列值越多原 H 会稍微偏大校正后更保守手算题里如果没特别说明一般只要求计算未校正的 H。3.3 Friedman 检验区组设计的非参数方案Friedman 检验是期末复习里最容易被忽略但考到就容易拉开差距的方法。它适用的是随机化区组设计也就是 k 个相关样本。典型例子是n 个受试者分别接受 k 种不同处理看处理效果是否有差异。比如 10 位病人分别测 3 种药物的疗效每个人就是一个区组每种药物是一个处理。这个场景和 Kruskal-Wallis 的根本区别在于样本是否独立——Friedman 要求区组内相关Kruskal-Wallis 要求组间独立。计算时不是把所有数据混在一起排序而是在每个区组内部单独排序。对第 j 个处理把 n 个区组里它所得的秩加起来得到秩和 Rⱼ。然后计算统计量S [12 / (n×k×(k1))] × ΣRⱼ² − 3n(k1)自由度是 k−1查卡方分布。这里最容易出的错误是把区组当成组、直接把所有数据处理成独立样本那样就等于把 Friedman 做成了 Kruskal-Wallis前提就错了。复习时盯住一句话有“区组”两个字的题优先想 Friedman有“独立分组”的题优先想 Kruskal-Wallis。3.4 McNemar 检验与配对分类数据McNemar 检验解决的是配对二分类数据的比较问题场景通常是“治疗前后”或者“两种诊断方法”结果只有两种类型。比如 100 名患者治疗前检测阳性/阴性后退检测阳性/阴性得到的四格表就构成了典型配对分类数据。McNemar 检验只关心两个“不一致”的格子治疗前阳性后来阴性的人数设为 b治疗前阴性后来阳性的人数设为 c。原假设是两种状态下的边际概率相等。检验统计量是不校正卡方形式 χ² (b − c)² / (b c)如果样本量较小常用连续性校正版本 χ² (|b − c| − 1)² / (b c)。自由度是 1。McNemar 检验最常和普通卡方独立性检验搞混二者的关键区别是McNemar 处理配对样本四个格子里两个来自同一个体的前后测量而卡方独立性检验处理两个独立样本的分类结果。出题人经常故意把一个配对实验的数据列成 2×2 表看你是不是机械地去做卡方独立性检验。4. 相关分析与分布检验最容易混淆的一组方法4.1 Spearman 秩相关与 Kendall 相关系数相关分析里皮尔逊相关检验的是线性关系但很多数据不满足“线性”或“正态”前提这时候就轮到秩相关出场。Spearman 秩相关是用来衡量两个变量之间的单调相关程度的计算时把两组数据分别排序赋秩再对秩计算皮尔逊相关系数。无并列值时公式可以简化为 ρ 1 − 6Σdᵢ² / (n(n²−1))其中 dᵢ xᵢ 的秩 − yᵢ 的秩。如果存在并列值直接用秩做 Pearson 相关就可以了。Kendall 相关系数 τ 是另一种思路对任意两个观测点比较它们的 x 方向顺序和 y 方向顺序是否一致。如果 x 大、y 也大那就叫一致对如果 x 大、y 反而小就是非一致对。用 C 表示一致对数D 表示非一致对数无并列时 τ (C − D) / (C D)有并列时常用 τ_b 版本。考试中问“Spearman ρ 和 Kendall τ 怎么选”可以这样答两者都测单调相关其中 Kendall τ 在小样本下更稳健解释也更直观但计算量大Spearman ρ 在大多数软件默认输出、计算方便应用更普遍。期末如果只是让你判断“两变量是否存在相关趋势”得分关键不是纠结选哪个而是千万别用 Pearson 去硬做偏态数据。4.2 卡方拟合优度检验与独立性检验卡方检验底下有两个长得像但用法不同的分支一个是拟合优度检验一个是独立性检验很多人考完还说不清。拟合优度检验针对单个分类变量检验它的观测频数分布是否符合某个理论分布。比如一枚骰子掷 60 次点数 1 到 6 的频数分别是 12、8、10、9、11、10问骰子是否公平这就是拟合优度检验。统计量 χ² Σ(Oᵢ − Eᵢ)² / Eᵢ自由度是类别数 k 减去 1 再减去估计参数个数 p常见情况 p0自由度就是 k−1。独立性检验针对两个分类变量用的是 r×c 列联表。原假设是两个变量相互独立核心计算是先求出每个格子的期望频数 Eᵢⱼ (行合计 × 列合计) / 总合计再代进同一个公式 χ² ΣΣ(Oᵢⱼ − Eᵢⱼ)² / Eᵢⱼ自由度是 (r−1)(c−1)。这里有一个通用记忆点凡是卡方家族本质都是“观测频数和期望频数的偏差大小在多大程度上来自随机”。期望频数算得越准确卡方统计量越小越倾向于不拒绝原假设。复习时把这两个检验放在一起对比记忆比单独背公式高效得多。4.3 Kolmogorov-Smirnov 检验与正态性检验Kolmogorov-Smirnov 检验简称 K-S 检验用来判断样本是否来自某个指定的连续分布。单样本版本比较经验分布函数 Fₙ(x) 和理论分布函数 F₀(x)统计量为 D sup|Fₙ(x) − F₀(x)|也就是两条曲线之间最大的竖直距离。D 越大说明样本和理论分布偏离越远越倾向拒绝原假设。K-S 检验的好处是它可以检验任意连续分布不限于正态坏处是如果分布参数比如均值和方差是从样本里估计出来的标准 K-S 表就不再适用这时要用 Lilliefors 修正否则检验会过于保守容易犯第二类错误。如果只是检验正态性还有一个更常见的选择是 Shapiro-Wilk 检验S-W 检验它专门检验正态分布假设小样本下功效很高。期末考试的常见问法是“现有一组小样本数据想检验是否来自正态分布应该用什么方法”答 Shapiro-Wilk 检验最稳妥。如果样本量很大S-W 检验也容易对轻微偏离敏感这时反而可以结合 Q-Q 图观察形态、综合考虑。记法上注意K-S 好比“通用分布匹配器”S-W 是“正态专属检测器”场景不同选择自然不同。4.4 Fisher 精确检验的适用场景Fisher 精确检验用于 2×2 列联表当格子期望频数太小时卡方检验的近似效果会变差这时就改用 Fisher。一般经验法则是如果有任何一个格子的期望频数小于 5卡方检验可能不可靠更严谨的标准是超过 20% 的格子期望频数小于 5或者任何一个格子期望频数小于 1就应该用 Fisher 精确检验。它的原理是超几何分布——在行和列边际合计固定的前提下直接计算出当前四格表出现的精确概率。期末考题往往不会让你完整手算 Fisher 概率因为涉及组合数计算比较繁琐但会以选择或简答形式问“什么时候用 Fisher 而不是卡方”。答“样本量小、期望频数低时用 Fisher”就够。还有一个容易忽略的点Fisher 检验在四格表两边都是二分类变量时最合适如果是更一般的 r×c 表则需要扩展为 Fisher-Freeman-Halton 检验或者考虑合并类别。看到 2×2 表加小频数直接选 Fisher基本不会错。5. 方法选择速查表与统计量记忆技巧5.1 一张表搞定方法选型期末答题最怕的不是不会算而是拿到题目不知道套哪个方法。我把常见场景和对应方法整理成一张速查表考前看这个就够数据类型研究问题对应方法核心统计量单样本连续数据中位数是否等于某值符号检验 / Wilcoxon 符号秩检验S₊ / W₊配对连续数据处理前后是否有差异配对符号检验 / Wilcoxon 符号秩检验S₊ / W₊两独立样本连续/等级数据两组位置是否相同Mann-Whitney U 检验U多样化独立样本多组位置是否相同Kruskal-Wallis 检验H随机区组设计多种处理效果是否相同Friedman 检验S配对二分类数据治疗前后效果是否变化McNemar 检验χ²两个连续变量是否存在单调相关Spearman / Kendall 相关ρ / τ单个分类变量是否符合某种分布卡方拟合优度检验χ²两个分类变量是否相互独立卡方独立性检验必要时 Fisherχ²一组顺序观测序列是否随机游程检验R单个连续样本是否来自某个分布K-S 检验 / S-W 检验D / W表格不是背下来就能得分关键是要理解每一行背后的“为什么”。比如 McNemar 后面写 χ²但它和卡方独立性检验的场景完全不同前者是配对设计后者是独立样本这个我在前面反复强调就是因为考题特别爱在这个地方挖坑。5.2 检验统计量怎么记不容易忘统计量公式多死记硬背容易串。我分享三个记忆策略都是复习后期自己总结的。第一抓住“中心化”思路。绝大多数非参数检验统计量都可以写成“观测值 − 期望值÷ 标准差”或者“观测秩和偏离期望秩和的形式”。Wilcoxon 的 W₊、Mann-Whitney 的 U、Kruskal-Wallis 的 H 本质上都是围绕“秩和应该在什么位置”展开的。只要你记住单样本的期望秩和是 n(n1)/2很多公式都能推出来。第二统一记“秩和版”。Mann-Whitney U 用 U 公式容易记错但如果你先求 R₁第一组秩和再代 U₁ n₁n₂ n₁(n₁1)/2 − R₁最后 Z 公式用 (U − n₁n₂/2) / √(n₁n₂(n₁n₂1)/12)链条是完整的。任何一道两独立样本的手算题先做“合并排序赋秩、算秩和”这个动作后面都是机械步骤。第三记住卡方家族的统一公式Σ(O − E)²/E。拟合优度、独立性、McNemar 都是它的变形。McNemar 之所以变成 (b−c)²/(bc)是因为在“不一致格子”中期望频数相同都是 (bc)/2代入统一公式后化简得到的。一旦理解了变形来源公式不用背也能写出来。5.3 判定规则什么时候拒绝原假设复习到最后一定要能快速说出每个检验的拒绝域方向。符号检验和 Wilcoxon 符号秩检验是“统计量太小或太大都拒绝”因为偏离中心越多越不像是随机波动Mann-Whitney U 取 min(U₁, U₂)也是 U 越小越拒绝Kruskal-Wallis H 只在 H 偏大时拒绝因为 H 是组间秩和差异的“整体衡量”差异越大越拒绝卡方家族全部是“统计量越大越拒绝”因为它们衡量观测与期望的偏离程度K-S 检验 D 越大越拒绝也是偏离越大越不可能是同一个分布。考试中最常出现的低级失误拿到 Kruskal-Wallis 把 H 算出来后不知道往哪查表——自由度 k−1查的是卡方分布表不是 Z 表。另一个低级失误Friedman 统计量 S 查表时也查卡方分布但有些人会惯性往 t 表或 F 表上找。记法建议凡是“秩”类检验小样本查专项表Wilcoxon 表、U 表大样本查正态分布表凡是“卡方类”检验永远查卡方分布表凡是自由度是 r−1、c−1、k−1 的基本都是卡方家族。6. 期末复习最容易踩的坑与备考策略6.1 五个高频易错点第一个易错点是把“秩和检验”和“符号秩检验”混为一谈。Mann-Whitney U / Wilcoxon 秩和检验处理的是两独立样本Wilcoxon 符号秩检验处理的是单样本或配对样本。很多题目只需要看几个字就能判断——“两组独立患者”“两种独立处理”一定是秩和检验“同一批患者治疗前后”“配对差值”一定是符号秩检验。第二个易错点是忽略并列值取平均秩。手算题里经常出现两个数据相等的情况如果不取平均秩后面的秩和、U 值全都错。记住并列时取平均秩这是所有秩检验的统一规则。第三个易错点是配对设计却错用独立样本检验。题目给了 20 对数据本质上是 20 个差值应该对差值做单样本检验而不是把 40 个数据当成两组做 Mann-Whitney U。这种情况下自由度、样本量都会错。第四个易错点是卡方独立性检验里期望频数算错。Eᵢⱼ 行合计 × 列合计 / 总合计必须用“两个边际合计的乘积除以总人数”不能用观测频数直接算。期望频数一旦错了后面统计量、自由度、结论全错。第五个易错点是显著性水平与双侧/单侧判断不分。符号检验和 Wilcoxon 符号秩检验都有单侧和双侧版本题目问“是否增加了”用单侧问“是否相同”用双侧。有些同学统用双侧查表结果明明该拒绝的没拒绝白白丢分。6.2 案例分析题的答题模板非参数统计期末的大题通常是给一段实际场景和若干数据要求选择合适的检验方法并给出结论。我建议按照固定模板来答步骤清晰、不容易漏分。第一步写“研究设计与数据类型”。比如这是两独立样本的等级数据目的是比较两种方法的疗效差异。这一句不用长但要写明数据是否独立、是连续还是等级、比较目的是什么。第二步写“方法与原假设”。明确写出拟采用的检验名称比如 Mann-Whitney U 检验然后写出 H₀两总体位置相同H₁两总体位置不同。第三步写“计算过程”。合并排序、赋秩、算秩和、算统计量所有中间结果都写上这样可以拿过程分。第四步写“结论判定”。给出检验统计量的值、临界值或 P 值说明是否拒绝原假设并翻译成一句话结论比如“在 0.05 显著性水平下两种方法疗效差异有统计学意义”。这个模板适用于 Wilcoxon 符号秩检验、Mann-Whitney U、Kruskal-Wallis、Friedman、卡方检验等绝大多数计算题。关键在于把“选方法”和“算统计量”连接起来而不是一上来就套公式。阅卷老师最喜欢看到的是方法选择理由正确、中间步骤完整、最后结论表述清晰。6.3 考前一周的实战复习节奏最后一周不建议再从头翻教材而是按“概念梳理 → 表格记忆 → 计算题限时练 → 错题复盘”四步走。第一天到第二天用我前面整理的框架把每种方法适用场景、原假设、统计量、查表方式在纸上画一张大表重过一遍概念题常考的辨析点。第三天到第四天专门练计算题每类方法找 2 到 3 题完整手算到查表给结论计时训练。第五天把做错的地方集中复盘尤其是并列值、配对误判、查表方向这三类错误对着题目重新做一遍。第六天和考前晚上只看速查表和错题清单不再做新题。从我自己的复习经验来看非参数统计期末最拉分的不是计算难度而是方法选择的敏感度。题目不会明着告诉你“用 Wilcoxon”它只会描述场景、给你数据逼你自己判断。所以复习的重心必须放在“场景对应方法”的反射速度上而不是公式本身。多过几遍速查表、多拿配套课件里的例题自测比盲目刷一百道计算题更有用。最后再分享一个很实际的备考习惯把所有检验方法画在 A4 纸中间向外画分支。中心写“非参数统计”一级分支按数据类型分“单样本、两样本、多样本、相关、分布检验”二级分支写具体方法名三级分支写原假设和统计量。这张图做完整门课的骨架就真的长在脑子上了。考试当天拿到卷子先花一分钟定位每道大题属于哪个分支再动手计算正确率会稳很多。
返回列表