引言Introduction
为什么多重比较会导致P值膨胀? 这是医学生、医生和科研人员做组间分析时最容易忽视的问题。比较次数一多,假阳性风险就会上升,原本“看起来显著”的结果,可能只是偶然波动。

在多组计数资料、率的比较和事后两两比较中,这个问题尤其常见。本文结合SPSS分析思路,讲清楚多重比较与 P 值膨胀 的来源、危害和控制方法,帮助你避免统计推断中的常见错误。
1. 什么是多重比较
1.1 从一次检验到多次检验
单次假设检验通常设定显著性水平为0.05,意思是当原假设成立时,允许5%的第一类错误概率。问题在于,一旦你把同一数据反复做多次检验,整体出错概率就不再是0.05,而会逐步累积。
在临床研究里,这种情况很常见。比如三组病人的有效率比较,先做整体卡方检验,再做两两比较。此时每多做一次比较,都会增加一次“碰巧显著”的机会。这就是多重比较与 P 值膨胀的核心背景。
1.2 为什么“显著”会变多
如果你把显著性阈值固定在0.05,那么单次检验下的假阳性率是5%。但当你进行多次独立比较时,至少出现一次假阳性的概率会明显升高。
一个简单的近似例子是,若做10次独立检验,每次α=0.05,那么“至少一次误判为阳性”的概率会远高于5%。这并不代表每个结果都错了,而是说明总体上更容易出现假阳性堆积 。因此,看到多个P值时,不能只盯着单个结果是否小于0.05。
2. P值膨胀是怎么发生的
2.1 不是P值变大,而是“错误发现”变多
严格来说,P值本身不是被“算大”了,而是在多次比较场景下,误判为显著的结果数量变多了 。很多人把这种现象口语化地称为P值膨胀,但更准确的理解是第一类错误率累积上升。
举例来说,若三组之间进行两两比较,共有3次比较。即使真实差异并不存在,也可能因为随机误差导致其中1次P值小于0.05。此时如果直接宣布“有差异”,结论就会偏乐观。
2.2 组间比较越多,风险越高
多重比较与 P 值膨胀最常发生在以下场景:
- 三组及以上的有效率、并发症率比较。
- 多个构成比比较。
- 多组等级资料的事后两两比较。
- 多终点研究中同时分析多个结局指标。
这些分析都具有同一个特点:检验次数不是1次,而是2次、3次,甚至更多次。 检验次数越多,整体假阳性风险越高。
2.3 整体检验显著,不代表任意两组都显著
这是很多论文写作中最常见的误区。整体卡方检验提示三组“不全相同”,并不等于你可以直接认定A组和B组、B组和C组、A组和C组都存在差异。
正确做法是先做整体检验,再根据研究设计进行事后比较,并对多次比较进行校正。如果不校正,就容易把随机波动误判为真实差异。
3. 统计学上为什么要校正
3.1 维持总体α水平
多重比较校正的目标很明确,就是把整体第一类错误率控制在可接受范围内。也就是说,不是让每一次检验都“更保守”而已,而是要保证整组比较的错误率仍然可控 。
最常见的思路是把原本0.05的α水平分摊到多个比较中。比如三组两两比较,共3次,采用Bonferroni思路时,校正后的阈值可近似设为0.05/3=0.017。这样做能降低假阳性,但代价是检验会更严格。
3.2 保守与灵敏度的平衡
校正不是越严越好。校正过强会增加假阴性,也就是把真实差异漏掉。临床研究中,研究者需要在假阳性和假阴性之间做平衡。
因此,方法选择要看研究目的:
- 探索性研究,可适度控制错误率。
- 验证性研究,应更严格控制多重比较风险。
- 终点很多的研究,尤其要提前定义主要终点,避免后期“挑结果”。
4. 常见的多重比较校正思路
4.1 Bonferroni校正
Bonferroni是最常用、也最容易理解的方法。核心逻辑是把总α除以比较次数。优点是简单,缺点是偏保守。
适合:
- 比较次数不多。
- 研究者希望方法清晰、容易解释。
- 医学论文中常见的三组或少量组间两两比较。
4.2 事先规划比较
另一种更稳妥的策略,是在研究设计阶段就明确主要比较,而不是事后无限扩展分析。这样可以减少“边看数据边决定比较对象”的问题。
事先规划比事后补救更可靠。 因为一旦数据已经看过,再决定做哪些比较,研究偏倚就更容易进入结论。
4.3 在SPSS中先整体检验,再做两两比较
根据上游知识库中的思路,多组计数资料和多组成组设计等级资料,常先做整体检验,例如卡方检验或Kruskal-Wallis检验。若整体差异有统计学意义,再进一步进行事后两两比较,并采用校正后的α值。
例如三组比较时,校正后α常设为0.017。这样可以减少由于重复检验带来的第一类错误累积。这一步是控制多重比较与 P 值膨胀的关键操作。
5. 论文写作和结果解读要注意什么
5.1 不要只报P值
P值不是结论本身。它只说明在零假设成立时,当前结果出现的概率。多重比较场景下,单个P值尤其容易被误读。
更稳妥的做法是同时报告:
- 检验方法。
- 校正方法。
- 具体P值。
- 必要时报告效应量和置信区间。
5.2 明确说明比较次数
如果你做了3次、6次或者更多次比较,必须在方法部分写清楚。读者需要知道你是否控制了多重比较与 P 值膨胀。
例如可以说明:
- 先进行总体卡方检验。
- 若总体差异显著,再进行两两比较。
- 两两比较采用Bonferroni校正。
这样写,逻辑清楚,也更符合E-E-A-T要求中的可验证性和透明度。
5.3 警惕“事后挑选显著结果”
如果一个研究同时比较很多指标,只报告显著的几个结果,而忽略不显著结果,结论会明显偏倚。读文献时尤其要注意这一点。
对科研人员来说,最重要的是区分:
- 预先定义的主要分析。
- 事后补做的探索性分析。
两者不能混为一谈。
6. 一个适用于医学研究的实用判断框架
6.1 先判断是否存在多次检验
当你准备比较多个组、多个指标、多个时间点时,先问自己一句:这是不是多重比较场景?
如果答案是肯定的,就不能直接按单次检验的0.05来解释结果。
6.2 再判断是否需要校正
如果只有少量、预先计划好的比较,校正方式可以相对简化。若比较很多,或者是探索性分析,就应考虑更严格的校正。
6.3 最后回到研究问题本身
统计分析不是为了制造显著性,而是为了回答临床问题。你真正关心的不是“有几个P<0.05”,而是:
- 哪些组之间真的不同。
- 这种差异是否有临床意义。
- 结论是否稳定、可重复。
结论Conclusion
多重比较之所以会导致P值膨胀,本质上是因为检验次数增加后,假阳性会累积 。因此,整体检验显著并不等于每个两两比较都显著。医学研究中,必须结合校正方法、比较次数和研究设计来解读结果。
如果你希望把多组率、构成比、等级资料的比较流程写得更规范,建议结合解螺旋的统计与写作支持工具,先完成整体检验,再规范设置事后比较。这样更容易减少多重比较与 P 值膨胀带来的误判,也能让论文结果更稳健、更容易发表。

- 引言Introduction
- 1. 什么是多重比较
- 2. P值膨胀是怎么发生的
- 3. 统计学上为什么要校正
- 4. 常见的多重比较校正思路
- 5. 论文写作和结果解读要注意什么
- 6. 一个适用于医学研究的实用判断框架
- 结论Conclusion






