引言Introduction
在观察性研究里,组间基线不平衡很常见。年龄、疾病严重度、用药方案一旦不同,结局比较就容易偏。倾向性评分匹配的核心价值,就是先让基线资料尽量可比,再谈结局差异。 这一步决定了结果是否可信,也直接影响论文能否通过审稿。

1. 为什么基线资料可比性是观察性研究的关键
1.1 组间不平衡会放大混杂偏倚
在随机对照试验中,随机分组能尽量平衡已知和未知混杂因素。但在真实世界研究中,患者不是随机进入某一组,而是由临床决策、疾病状态、支付能力和依从性等因素共同决定。结果就是,两组在基线资料上常常天然不同。
如果直接比较结局,差异未必来自暴露本身,而可能来自基线差异。比如戒烟研究中,成功戒烟者与未戒烟者在尼古丁依赖程度、干预方式上就可能不同。此时若直接比较心理健康结局,混杂偏倚会显著影响解释。
因此,基线资料倾向性评分匹配不是“可选项”,而是观察性研究提高因果解释力的重要手段。
1.2 不只看P值,更要看标准化差异
很多研究习惯先看匹配前后P值是否显著变化。但P值受样本量影响很大。样本量足够大时,即便差异很小,也可能显著。
更稳妥的做法是看标准化差异,简称SMD。通常认为,SMD小于0.1,提示组间平衡较好。 这比单纯依赖P值更适合评估基线资料的可比性。实际写论文时,建议在表1中同时呈现匹配前后的SMD,便于审稿人判断平衡程度。
1.3 实践中的判断顺序
建议按以下逻辑判断是否需要做PSM:
- 先列出关键基线变量。
- 判断暴露组和对照组是否存在系统性差异。
- 区分哪些是混杂因素,哪些是结局前已知但无关变量。
- 再决定是否进入倾向性评分模型。
凡是可能同时影响暴露分配和结局的变量,都应优先考虑纳入匹配模型。
2. 倾向性评分匹配如何提升基线资料的可比性
2.1 倾向性评分的本质是“接受某暴露的概率”
倾向性评分不是简单的分组标签,而是个体在既定协变量条件下接受某一暴露的概率。常用方法是逻辑回归。建模时,通常把是否接受治疗、是否暴露、是否戒烟等作为因变量,把年龄、性别、BMI、病程、合并症等作为自变量。
这个概率把多个协变量压缩成一个分值。它的优势在于,把“多维不平衡”转化为“单一概率匹配”。 这样,比起逐个变量完全一致,更容易找到可匹配个体,也更符合真实世界数据结构。
2.2 匹配后得到的是更接近“反事实”的比较对象
PSM的理论基础是反事实框架。理想情况下,我们希望比较同一个人“接受暴露”和“未接受暴露”两种状态下的结局,但现实中做不到。于是我们寻找在倾向性评分上相似的人,作为近似反事实对象。
这意味着,匹配后两组人的基线资料不要求每一项都完全相同,但要求整体可比。只要重要混杂因素平衡,结局比较才更接近因果推断。
2.3 不是所有变量都应该机械纳入
这是实践中常见误区。并不是变量越多越好。若纳入与暴露和结局都无关的变量,可能增加模型复杂度,降低匹配效率。若纳入中介变量,还可能引入新的偏倚。
更合理的原则是:
- 优先纳入已知混杂因素。
- 优先纳入基线时已存在且与结局相关的变量。
- 避免纳入暴露后的变量。
- 对强相关变量保持谨慎,避免过度建模。
匹配的目标是控制混杂,不是把所有变量“塞进模型”。
3. 基线资料倾向性评分匹配的基本操作思路
3.1 第一步,明确暴露、结局和协变量
做PSM前,研究设计必须先清楚三件事。
- 暴露是什么。
- 结局是什么。
- 哪些基线变量可能构成混杂。
例如,在回顾性队列研究中,若比较两种治疗策略对住院结局的影响,应把年龄、性别、疾病严重程度、合并症、既往治疗史等放入候选协变量。这样做的目的,不是“追求多”,而是“追求关键变量不漏”。
3.2 第二步,构建倾向性评分模型
最常用的是逻辑回归模型。模型输出每个个体接受暴露的概率,再依据这个概率进行匹配。常见匹配方式包括:
- 1:1最近邻匹配。
- 1:n匹配。
- 卡钳匹配。
- 分层匹配。
其中最近邻匹配最直观,也最常用于论文发表。卡钳值则决定匹配精度。卡钳越严格,匹配质量通常越高,但可保留样本越少。
3.3 第三步,进行匹配并检查样本损失
PSM的现实代价是样本会损失。尤其在两组基线差异很大时,能成功匹配的人数可能明显减少。以课程中的案例为例,原始数据中处理组185人,对照组429人,1:1匹配后只保留91:91,说明可比性提高了,但样本量也明显下降。
这提示我们,PSM不是越“严格”越好。 如果追求极致平衡,却损失过多样本,统计效能会下降,结论稳定性也可能受影响。研究者需要在平衡性和样本保留之间取得平衡。
4. 如何判断匹配后基线资料是否真正平衡
4.1 看SMD是否降到0.1以内
匹配完成后,第一件事不是急着做结局分析,而是检查基线平衡。最标准的做法仍然是看SMD。
如果大多数协变量的SMD都小于0.1,说明匹配效果通常是可接受的。若仍有关键变量SMD较高,则说明模型还需调整。此时可重新选择协变量、改变卡钳值,或考虑其他匹配策略。
匹配成功的标志,不是“P值不显著”,而是关键混杂因素在标准化差异层面被明显平衡。
4.2 结合图形判断更直观
除了表格,还可以用图形评估匹配效果:
- Love plot,查看各变量SMD前后变化。
- 核密度图,观察倾向性评分分布重叠程度。
- 抖动图,检查匹配前后样本分布是否更接近。
如果匹配后两组倾向性评分分布重叠明显增加,通常说明组间可比性改善。图形方法能快速暴露模型问题,比只看单个表格更可靠。
4.3 匹配后还要重新分析结局
完成匹配后,不能直接沿用原始队列的分析逻辑。应该在匹配后的新数据集上再次进行统计分析。这样得到的结果,混杂控制更充分,也更符合“事后随机化”的思想。
有时匹配前后结论一致,有时会不同。若差异明显,通常提示原始分析受混杂影响较大。对于论文写作来说,匹配后分析往往比原始全人群分析更有解释价值。
5. PSM在论文写作和科研中的实际价值
5.1 提升结果可信度
对医学生和科研人员来说,PSM最大的意义不只是“做出一个漂亮的表1”,而是让结论更接近因果解释。尤其在回顾性队列、病例对照研究、二次分析和真实世界研究中,PSM能显著提升研究设计的说服力。
它解决的是一个核心问题。同样的结局差异,到底是治疗造成的,还是基线差异造成的。 只要这个问题没有处理好,论文的临床意义就会打折扣。
5.2 提高审稿接受度
很多高质量期刊都关注混杂控制是否充分。若研究仅报告原始组间比较,而没有处理明显的基线不平衡,审稿人通常会提出质疑。相反,如果研究清楚展示了匹配前后SMD变化,并在匹配后重新分析结局,文章的可信度会明显提升。
对于真实世界研究而言,PSM常常是从“描述性结果”迈向“较强推断能力”的关键一步。
5.3 解螺旋可以帮助把PSM研究做得更规范
如果你正在整理真实世界数据、撰写方法学部分,或者需要把基线资料倾向性评分匹配做得更规范,解螺旋 可以提供更系统的论文写作与研究设计支持。它更适合帮助研究者理清变量选择、匹配策略、结果呈现和方法描述,减少常见错误,让文章更符合投稿要求。
总结Conclusion
倾向性评分匹配的核心,不是简单“做配对”,而是通过控制混杂,让基线资料达到更好的可比性 。在观察性研究中,这一步直接关系到结论是否可信。实践中,应优先关注混杂变量选择、倾向性评分模型构建、匹配后SMD评估,以及匹配后结局分析。
如果你正在做基线资料倾向性评分匹配相关研究,建议把方法学设计、表1平衡性展示和结局分析一起统筹考虑。需要更专业的研究支持时,可以进一步了解解螺旋 ,把真实世界研究写得更规范、更严谨,也更有发表竞争力。

- 引言Introduction
- 1. 为什么基线资料可比性是观察性研究的关键
- 2. 倾向性评分匹配如何提升基线资料的可比性
- 3. 基线资料倾向性评分匹配的基本操作思路
- 4. 如何判断匹配后基线资料是否真正平衡
- 5. PSM在论文写作和科研中的实际价值
- 总结Conclusion






