引言Introduction
观察性研究里,暴露组和对照组常常“天生不一样”。年龄、病情、治疗方式一旦不平衡,结论就可能被选择偏倚和混杂偏倚带偏。倾向性评分匹配,核心任务就是把组间差异尽量拉平,让比较更接近真实因果。

1. 为什么观察性研究容易出现选择偏倚
1.1 组间不平衡是常态,不是例外
在真实世界研究中,研究对象不是随机分配的。是否接受某种暴露,往往与年龄、基础疾病、经济状况、依从性等因素有关。
这意味着暴露组和对照组在进入研究时就可能不具可比性。
如果直接比较结局,得到的差异未必来自暴露本身。
以吸烟研究为例,吸烟者可能同时伴随更低的社会经济水平、更高的合并疾病负担,甚至不同的医疗可及性。结局差异背后,常常混着多个因素的影响。
所以,观察性研究最常见的问题不是“有没有差异”,而是“差异到底由什么造成”。
1.2 选择偏倚和混杂偏倚会放大误判
选择偏倚强调的是,进入某一组的人本来就不同。混杂偏倚则是,某些变量同时影响暴露和结局,导致表面关联失真。
在临床研究里,这两类偏倚经常同时存在。
如果不控制这些偏倚,回归分析也未必够用。
原因很简单,模型可以调整变量,但前提是你知道该调什么、调得是否充分、样本是否支持这么做。
当组间差异太大时,单纯多变量回归往往无法真正解决“可比性”问题。
2. 倾向性评分匹配的基本逻辑
2.1 用“接受暴露的概率”代替逐项硬匹配
倾向性评分匹配的思想很直接。先估计每个个体接受暴露的概率,也就是倾向性评分,再按这个概率去匹配暴露组和对照组。
它不是要求每个变量都完全一致,而是要求个体在接受暴露的概率上尽量接近。
这比逐项匹配更现实。因为如果同时要求年龄、性别、BMI、基础病、实验室指标都完全相同,往往会丢掉大量样本。
PSM的优势就在于,它用一个综合概率把多个混杂因素折叠起来,从而提高匹配成功率。
2.2 反事实框架是它的理论基础
倾向性评分匹配背后的逻辑,本质上接近反事实思维。
理想情况下,我们希望比较“同一个人暴露前后”的结局,但现实中做不到。于是,PSM试图找到一个“在已知协变量上尽量相似、但暴露状态不同”的替代个体。
匹配成功的两个个体,可以近似看作互为反事实。
这也是为什么PSM比简单分组比较更适合真实世界研究。
它不是消灭差异,而是尽量把“可解释的差异”压缩到最低。
3. 实战中如何设计一个可靠的PSM
3.1 先判断哪些变量该放进模型
不是所有变量都适合塞进倾向性评分模型。通常应优先纳入以下几类变量。
- 与暴露有关的因素。
- 与结局有关的预后因素。
- 基线时已经存在的不平衡变量。
- 明确的临床混杂因素。
原则是尽量纳入混杂因素,而不是结局后的变量。
如果把中介变量或暴露后的变量放进去,可能会引入新的偏倚。
因此,变量选择要基于临床知识、机制理解和研究目的,而不是只看统计显著性。
3.2 常用逻辑回归估计倾向性评分
在实际工作中,最常见的做法是用逻辑回归建立“是否接受暴露”的预测模型。
模型输出的每个概率值,就是该个体的倾向性评分。
例如,在研究“是否戒烟”时,可以把是否戒烟作为因变量,把年龄、FTND评分、干预方案、婚姻状态等作为协变量。
这样每个人都会得到一个戒烟概率。
这个概率不是结局概率,而是接受暴露的概率。
如果变量类型处理不当,模型结果会明显失真。比如分类变量被误当作连续变量,或者变量编码方向混乱,都会影响匹配质量。
所以在建模前,必须先检查变量类型、缺失情况和编码规则。
4. 匹配阶段最容易出错的地方
4.1 卡钳值决定“严”还是“松”
卡钳值是实战中最关键的参数之一。
它决定两个个体的倾向性评分差距要小到什么程度,才能被认为可匹配。
卡钳值越小,匹配越严格,样本损失越大。
卡钳值越大,能匹配更多样本,但可比性可能下降。
这是一种典型的效率和精度平衡。
一般实践中,常会结合研究样本量、暴露比例和PS分布来设定卡钳,而不是机械套用固定值。
如果暴露组样本本来就少,过严的卡钳可能导致大量无法匹配,最终使统计效能不足。
4.2 1:1、1:n和是否放回都会影响结果
最常见的是1:1最近邻匹配,也就是一个暴露个体配一个对照个体。
但在某些研究中,也会采用1:n匹配,以提高统计效率。
常见选择包括:
- 1:1匹配,平衡性最好,解释最简单。
- 1:n匹配,可提高样本利用率。
- 放回匹配,允许同一个对照个体被重复使用。
- 不放回匹配,更符合独立样本思路,但可能降低成功率。
如果研究目标是尽量保守地控制混杂,1:1匹配通常更稳妥。
如果样本稀少、对照充足,1:n匹配可能更有优势。
但无论哪种方式,匹配后的平衡性都必须重新评估。
5. 怎么判断匹配真的“做对了”
5.1 不要只看P值,要看标准化差异
很多初学者会只看匹配前后基线资料的P值。
这并不够。因为P值受样本量影响很大,样本一大,微小差异也可能显著;样本一小,明显差异也可能不显著。
更推荐使用标准化差异,SMD。
一般认为,SMD小于10%时,组间平衡性较好。
这是PSM评估中更稳定、更适合比较前后变化的指标。
5.2 看分布图,比只看表格更直观
除了数值指标,还应查看匹配前后的分布图。
常见图形包括:
- 倾向性评分直方图。
- 密度图。
- 抖动图。
- 标准化差异图。
这些图能帮助判断两组在匹配后是否有更好的重叠。
如果匹配后两组PS分布明显重叠增加,通常说明匹配有效。
如果仍然存在大片“断层”,说明共同支持域不足,研究结论要谨慎解释。
6. 匹配后分析,才是最后一步
6.1 匹配后数据要按新的队列重新分析
匹配完成后,不是直接看匹配结果就结束了。
真正的统计分析应该基于匹配后的数据集重新进行。
这一步的目的,是在更均衡的样本基础上估计暴露与结局的关系。
匹配前的显著性,不一定能代表真实效应。
匹配后结果更接近控制混杂后的估计。
不过要注意,匹配后样本量减少,统计效能也会下降。
因此,结论要结合效应量、置信区间和临床意义综合判断,不能只盯着P值。
6.2 结果解释必须保留边界感
PSM并不能保证完全消除偏倚。
它只能控制“已测量且已纳入模型的混杂因素”。
对于未测量混杂、测量误差和模型设定错误,PSM无能为力。
所以,PSM更适合做“减偏倚”,不是“变随机”。
在论文写作中,建议明确说明纳入了哪些协变量、使用了何种匹配方式、卡钳如何设定、匹配后平衡性如何评价。
这些信息决定了研究的可信度。
7. 写论文和做课题时,最实用的几点建议
7.1 先画基线差异,再决定是否用PSM
如果暴露组和对照组本身就高度不平衡,直接做传统回归往往不够稳。
此时PSM通常更合适。
但如果样本极小,或者关键变量缺失严重,PSM未必是最优方案。
方法永远服务于数据结构,而不是反过来。
课题设计阶段就应评估:数据是否支持匹配,变量是否足够,样本是否会在匹配后严重流失。
7.2 让统计方法和临床问题对齐
真实世界研究中,研究者最容易犯的错误是“先选方法,再找问题”。
正确做法应当是:先明确临床问题,再选择是否需要PSM,以及如何设置匹配策略。
如果你的核心目标是比较两种治疗在真实世界中的效果,且基线不平衡明显,那么PSM是很有价值的工具。
如果你的问题更适合时间依赖分析、纵向轨迹分析或因果推断框架中的其他方法,就不要为了“看起来高级”而强行匹配。
7.3 选择可靠工具,提高流程可重复性
无论是SPSS还是R,PSM都不是“点一下就完事”。
变量编码、模型构建、卡钳设定、平衡性评价、结果导出,每一步都可能影响结论。
对于想规范开展真实世界研究的团队,建议采用标准化流程和可复现工具。
如果你希望把PSM做得更稳、更快、更可追溯,可以借助解螺旋的研究服务和工具支持,把变量整理、匹配分析和结果输出流程化,减少人为误差,提高研究效率。
总结Conclusion
倾向性评分匹配的价值,不在于“制造显著性”,而在于尽可能让暴露组和对照组在基线层面变得可比 。它通过倾向性评分、卡钳、匹配算法和匹配后平衡性评估,帮助观察性研究更接近因果比较。
对于医学生、医生和科研人员来说,真正要掌握的不是某个软件按钮,而是背后的设计逻辑、变量选择原则和结果解释边界。
如果你正在做真实世界研究,且担心选择偏倚和混杂偏倚影响结论,建议优先建立规范的PSM流程,并结合解螺旋的专业支持,让研究更稳、更清晰、更可发表。

- 引言Introduction
- 1. 为什么观察性研究容易出现选择偏倚
- 2. 倾向性评分匹配的基本逻辑
- 3. 实战中如何设计一个可靠的PSM
- 4. 匹配阶段最容易出错的地方
- 5. 怎么判断匹配真的“做对了”
- 6. 匹配后分析,才是最后一步
- 7. 写论文和做课题时,最实用的几点建议
- 总结Conclusion






