引言Introduction
观察性研究里,治疗组和对照组往往天生不平衡。年龄、病情分期、合并症不同,最后比较出来的结局很容易被混杂因素“带偏”。基线资料不可比,是临床研究最常见也最容易被忽视的问题。

1. 为什么基线可比性是临床研究的第一关
1.1 组间不平衡会直接放大偏倚
在随机试验中,随机分配可以尽量平衡已知和未知混杂因素。但在回顾性队列、真实世界研究和病例对照研究中,分组往往基于现实治疗决策,这意味着组间差异是常态,不是例外。
比如同样研究一种治疗措施,治疗组可能更年轻、肿瘤分期更早、合并症更少。若直接比较生存率或并发症率,结果可能反映的是“谁更健康”,而不是“治疗本身的效果”。
1.2 仅看P值,不足以判断可比性
很多研究会在基线表中逐项报告P值。但要注意,P值受样本量影响很大。
样本量大时,极小差异也可能显著。样本量小时,明显差异也可能不显著。因此,单靠P值判断是否平衡并不稳妥。
更合理的做法是同时关注:
- 临床意义上的差异。
- 标准化差异,SMD。
- 匹配前后分布是否重叠。
一般认为,SMD小于0.1,提示平衡性较好。 这是配对样本基线比较中常用的判断标准。
1.3 研究者真正要回答的是“是否可比”
基线资料可比性不是形式问题,而是因果推断的基础。
如果暴露组和对照组在治疗前就差异明显,那么后续任何统计结果都可能掺杂选择偏倚。先让两组“像”,再谈疗效比较。
2. 倾向性评分匹配的核心逻辑
2.1 用一个“概率”替代多个混杂因素
倾向性评分匹配,PSM,本质上是把多个协变量压缩成一个倾向性评分。这个评分表示个体接受某种暴露或治疗的概率。
它不是结局概率,而是“进入治疗组”的概率。
在实际研究中,常用逻辑回归来估计这个概率。纳入模型的变量,就是你认为会影响分组、也可能影响结局的混杂因素。
2.2 反事实思想是PSM的基础
PSM解决的是观察性研究中无法直接实现的“同一个人既治疗又不治疗”的问题。
我们无法对同一个患者同时观察两种状态,所以只能寻找一个在基线特征上尽可能接近、且具有相似倾向性评分的替代个体。
当两名患者的倾向性评分相近时,我们认为他们更接近“可比的反事实个体”。
2.3 不是所有变量都要强行逐项一致
很多初学者会误解PSM,以为必须把年龄、性别、分期等每个变量都配到完全一致。实际上并非如此。
PSM追求的是组间整体平衡 ,而不是逐项机械相等。只要倾向性评分相近,部分变量允许存在差异,前提是这些差异在总体上已被模型吸收和校正。
这也是PSM比直接逐变量硬匹配更高效的原因。
3. PSM实战中,协变量怎么选
3.1 优先纳入临床上明确的混杂因素
协变量选择,决定了PSM质量。常见思路有四类:
-
基于专业知识和临床经验。
例如肿瘤研究中,年龄、分期、病理类型、转移情况常常是关键混杂因素。 -
基于文献证据。
既往研究反复出现、且与结局相关的变量,应优先考虑。 -
基于基线差异。
如果某些变量在匹配前已明显不平衡,也建议纳入模型。 -
基于多因素分析结果。
能影响暴露和结局的变量,通常更值得保留。
3.2 不建议把所有变量无差别塞进模型
PSM不是变量越多越好。
如果把与暴露和结局都无关的变量纳入过多,可能降低匹配效率,增加样本损失。相反,遗漏关键混杂因素,则会削弱平衡效果。
原则很简单,优先纳入“可能影响分组,也可能影响结局”的变量。
3.3 变量整理要满足软件要求
以SPSS操作为例,数据整理必须规范:
- 二分类分组变量要明确编码。
- 分类变量和连续变量要区分清楚。
- 变量名不要出现空格和特殊字符。
- 数值型变量最好统一为标准格式。
如果前期整理不规范,后面容易出现无法匹配、变量识别失败等问题。很多PSM失败,不是方法错了,而是数据结构错了。
4. 如何在SPSS中完成匹配并解读结果
4.1 先明确匹配类型
常见匹配方式包括:
- 1:1匹配。
- 1:n匹配。
- 分层法。
- 倾向性评分校正法。
- 倾向性评分加权法。
其中,1:1匹配最直观,也最常用于配对样本基线比较。
适合治疗组和对照组样本量接近、且希望保留解释简洁性的研究。
4.2 卡钳值决定“匹配精度”
卡钳值越小,匹配越严格。
但卡钳值过小,会导致大量样本无法匹配,样本损失增大。卡钳值过大,则可能降低匹配质量。
实务中常见做法是结合数据分布、样本量和研究目的综合选择。匹配不是越严越好,而是要在平衡性和样本保留之间取得平衡。
4.3 匹配后先看平衡,再看结局
完成PSM后,第一步不是直接分析结局,而是先检验基线是否平衡。重点看三类结果:
- 匹配前后SMD是否下降。
- 各变量的P值是否大多不再显著。
- 倾向性评分分布是否重叠增加。
如果匹配后SMD仍然偏大,说明协变量平衡还不够,不能急于进入结局分析。
4.4 基线表应该如何呈现
配对样本基线比较时,建议同时展示:
- 匹配前样本量。
- 匹配后样本量。
- 各协变量的均值、标准差或构成比。
- P值。
- SMD。
只有P值没有SMD,往往不足以支撑“基线平衡良好”的结论。
5. 配对样本基线比较,应该怎么判断“匹配成功”
5.1 先看样本是否损失过多
PSM后的一个常见问题,是样本量下降。
比如1:1匹配时,原本两组差异较大,可能只有部分样本能成功匹配。样本损失越多,外推性越受影响。
研究者需要权衡:
- 匹配后是否足够平衡。
- 保留样本是否仍有统计效能。
- 是否会因过度筛选而改变研究人群代表性。
5.2 再看标准化差异是否达标
SMD是评价配对样本基线比较最实用的指标之一。
其优势在于不受样本量影响。对连续变量和分类变量,都能较好反映组间差异。
常用判断:
- SMD < 0.1,通常认为可接受。
- SMD越接近0,平衡越好。
5.3 最后看图形是否支持
图形能帮助快速判断匹配质量,常见包括:
- 倾向性评分分布图。
- 核密度图。
- Love plot。
- 抖动图。
如果匹配前两组分布明显分离,匹配后重叠明显增加,通常说明PSM效果较好。
6. 结局分析要建立在合格的基线平衡之上
6.1 匹配后数据应按配对设计处理
完成PSM后,不能简单把数据当成原始独立样本继续分析。
如果是严格1:1配对,后续统计方法应尽量考虑配对结构,例如配对检验、条件Logistic回归,或按研究设计选择合适模型。
6.2 匹配前后结果不一致很常见
有些研究在匹配前提示暴露因素与结局有关,匹配后关联消失。
这并不奇怪,反而说明原始分析受混杂影响较大。相反,如果匹配前后结果一致,也要确认这种一致性是否建立在充分平衡的前提上。
6.3 不要把“匹配后显著性消失”简单理解为无效
结局效应变弱,可能来自真实混杂校正后的结果。
因此,倾向性评分匹配的价值,不是制造显著性,而是尽量逼近更可信的因果比较。
7. 解螺旋如何帮助你把PSM做规范
7.1 从数据整理到结果呈现,一步到位
PSM真正难的地方,往往不在算法,而在流程。
从变量整理、协变量选择、匹配参数设置,到基线表和结果表输出,每一步都需要规范。解螺旋提供的临床研究方法支持,可以帮助你减少这类流程性错误。
7.2 让配对样本基线比较更容易落地
如果你正在做真实世界研究、回顾性队列分析,或者需要完成论文中的基线平衡评估,解螺旋可以帮助你更高效地完成配对样本基线比较、SMD判断和结果呈现。
这能明显降低返工率,也更符合论文投稿对方法学严谨性的要求。
总结Conclusion
倾向性评分匹配的核心,不是“强行让两组完全一样”,而是通过合理选择协变量和匹配参数,让治疗组与对照组在基线层面尽可能可比。配对样本基线比较是否合格,直接决定后续结局分析是否可信。
如果你希望把PSM从“会做”提升到“做得规范”,建议从变量选择、SMD判断、匹配后诊断三步入手。需要进一步优化研究流程时,也可以借助解螺旋 ,让你的临床研究分析更稳、更快、更容易发表。

- 引言Introduction
- 1. 为什么基线可比性是临床研究的第一关
- 2. 倾向性评分匹配的核心逻辑
- 3. PSM实战中,协变量怎么选
- 4. 如何在SPSS中完成匹配并解读结果
- 5. 配对样本基线比较,应该怎么判断“匹配成功”
- 6. 结局分析要建立在合格的基线平衡之上
- 7. 解螺旋如何帮助你把PSM做规范
- 总结Conclusion






