引言Introduction
临床研究中,缺失值处理几乎绕不开。问卷漏答、检验未做、录入错误,都会让数据分析失真。如果处理不当,样本量会减少,偏倚会放大,结论也可能失去可信度。 本文按临床研究常用流程,系统梳理缺失值处理方法与适用场景。
1. 缺失值为什么不能忽视
1.1 缺失值会影响什么
缺失值不是简单的“空白”。它会直接影响统计结果。
常见影响有三类:
- 样本量下降 。删除缺失个案后,纳入分析的数据会变少。
- 信息损失 。原本可用的临床特征、随访信息和结局信息会被丢掉。
- 结果偏倚 。如果缺失并非随机,分析结论可能偏离真实情况。
在回归模型中,软件通常会自动剔除含缺失的个案。看似“没有删除”,本质上还是样本减少。
1.2 先判断缺失类型
缺失值处理前,先判断缺失机制。临床研究中常见三类。
- 完全随机缺失 。缺失与任何变量都无关。
- 随机缺失 。缺失与其他变量有关,但与自身数值无关。
- 非随机缺失 。缺失与变量本身有关。
最适合常规填补的方法,通常建立在完全随机缺失或随机缺失的前提下。
如果是非随机缺失,直接填补更容易引入误差。
2. 先做资料核查,再决定是否处理
2.1 资料核查法是第一步
发现缺失值后,第一步不是马上填补,而是核查原始资料。
可以优先检查:
- 原始病例报告表。
- 电子病历或检验系统。
- 调查问卷原件。
- 是否存在录入遗漏。
如果是录入错误或抄录遗漏,补回真实数据是最理想的方案。
这一步的价值在于,它恢复的是原始信息,而不是“估算值”。
2.2 什么时候可以不处理
并非所有缺失都必须强行补齐。
有时“不处理”也是一种处理。
适合保留缺失标记的情况包括:
- 缺失率较低。
- 缺失变量不是核心变量。
- 后续分析模型可以接受这种设置。
- 研究目的更重视透明报告而非完整补值。
但要注意,不处理不等于忽略。
论文或报告中应明确说明缺失比例和处理方式。
3. 常见缺失值处理方法
3.1 个案删除法
当缺失样本较少、样本量较大时,可以删除含缺失值的整条个案。
优点很直接:
- 操作简单。
- 后续分析方便。
- 结果解释清晰。
但它的代价也很明显:
- 样本量下降。
- 可能破坏样本代表性。
- 若缺失集中在关键变量上,偏倚风险上升。
除非缺失的是非常关键的暴露因素或结局因素,否则不建议轻易整例删除。
3.2 虚拟变量法
虚拟变量法主要用于分类变量缺失 。
做法是把缺失单独编码为一个新类别,比如“未知”。
例如吸烟状态:
- 1 = 吸烟
- 0 = 不吸烟
- 9 = 缺失或未知
这种方法的好处是:
- 不丢失其他信息。
- 保留原始个案。
- 在模型中可单独评估“未知”类别。
但风险也存在。
如果“缺失”本身并不代表一个真实类别,模型估计可能被干扰。
3.3 均数或众数填补法
这是最容易理解的填补方法。
适用规则很明确:
- 连续型变量 ,可用均数或中位数。
- 分类变量或计数资料 ,常用众数。
例如身高缺失,可以用同组平均身高替代。
例如机构人数缺失,可用最常见人数填补。
优点是:
- 简单。
- 快速。
- 易于在小规模数据中实施。
缺点也很明显:
- 会压缩变量变异。
- 可能低估标准误。
- 容易造成结果偏倚。
它更像应急方案,不是高质量研究的首选方案。
3.4 回归法
当缺失变量与其他变量之间关系清楚时,可以用回归法。
思路是:
- 找到与缺失变量相关的预测变量。
- 建立回归模型。
- 用模型预测缺失值。
例如血压缺失时,可结合年龄、性别、职业等变量估计。
常见模型包括线性回归和Logistic回归。
这类方法的优势是:
- 估计有依据。
- 比简单均值填补更符合变量关系。
- 适合变量间关联明确的场景。
但前提要求更高:
- 需要较好的建模基础。
- 需要明确变量关系。
- 结果依赖模型设定。
3.5 多重插补
多重插补是临床研究里非常常见的方法。
它的核心思想是:缺失值不是唯一的,而是存在不确定性。
它的基本流程是:
- 根据已知变量建立缺失值分布。
- 生成多个完整数据集。
- 分别进行统计分析。
- 合并多个结果,得到最终估计。
这种方法的优点很突出:
- 能同时处理多个变量缺失。
- 能反映插补不确定性。
- 通常比单次填补更稳健。
在实际研究中,多重插补常被用于回归分析、预后研究、队列研究等场景。
当缺失变量较多、变量关系复杂时,它通常比简单填补更可靠。
4. 如何选择合适的方法
4.1 先看缺失比例
缺失比例是决策的重要依据。
一般可以这样理解:
- 低缺失率 ,可考虑填补或保留。
- 中等缺失率 ,优先考虑多重插补或回归法。
- 高缺失率 ,要谨慎,必要时考虑删除变量或重新评估研究设计。
如果某个变量缺失超过50%,继续填补的意义往往会下降。
因为不确定性太高,结果容易失真。
4.2 再看变量重要性
不是所有变量都值得同样处理。
要先判断它是不是核心变量。
- 暴露因素缺失 。影响分组和因果推断。
- 结局变量缺失 。直接影响主要终点判断。
- 协变量缺失 。通常更适合通过插补处理。
如果是核心变量缺失,简单填补可能会造成错误分类。
这种情况下,删除或重新核查往往比盲目补值更稳妥。
4.3 再看变量类型
不同变量,处理方式不同。
- 分类变量,优先考虑虚拟变量法或多重插补。
- 连续变量,常见方法是均数、中位数、回归法或多重插补。
- 多变量联合缺失,优先考虑多重插补。
方法的选择,不是越复杂越好,而是越符合数据结构越好。
5. 实战中常见的工作流程
5.1 一个更稳妥的处理顺序
临床研究里,可以按以下顺序处理缺失值:
- 先核查原始资料。
- 判断缺失机制和缺失比例。
- 判断变量是否为核心变量。
- 根据变量类型选择方法。
- 对比不同方法的结果。
- 在论文中如实报告处理过程。
这个流程的好处是,既保证数据质量,也方便审稿和复现。
5.2 结果比较很重要
缺失值处理后,最好做敏感性分析。
也就是比较不同处理方式下,结论是否一致。
可重点比较:
- 主要效应方向是否一致。
- 置信区间是否明显变化。
- P值是否稳定。
- 模型拟合是否明显波动。
如果不同方法得出一致结论,研究可信度会更高。
如果差异很大,就说明缺失值处理对结论影响显著,需要重新审视数据质量。
5.3 报告时不能省略
很多研究的问题,不在于没处理缺失值,而在于没说清楚怎么处理。
论文中建议交代:
- 缺失比例。
- 缺失变量名称。
- 采用的处理方法。
- 是否进行了敏感性分析。
这符合临床研究的透明原则,也更符合 E-E-A-T 所强调的可信表达。
6. 实务中的一个核心原则
缺失值处理没有统一万能公式。
每一种方法都有边界条件。
- 个案删除简单,但会损失样本。
- 均数填补方便,但容易偏倚。
- 回归法更有依据,但模型要求高。
- 多重插补更稳健,但需要规范实施。
因此,真正专业的做法不是“只会一种方法”,而是根据研究目的、变量类型和缺失模式做选择。
如果你希望在临床研究中更高效地完成数据清洗、插补和分析流程,解螺旋 可以帮助你把缺失值处理做得更规范、更系统,减少返工,提高分析效率。
总结Conclusion
缺失值处理不是数据清洗里的附属步骤,而是影响研究可信度的关键环节。先核查,再判断缺失机制,再选方法。对临床研究来说,最重要的不是把空白补上,而是用最合理的方式恢复数据结构和统计解释力。 如果你正在做课题、论文或回顾性分析,不妨把缺失值处理流程标准化,并借助解螺旋 提升数据处理效率与研究质量。

- 引言Introduction
- 1. 缺失值为什么不能忽视
- 2. 先做资料核查,再决定是否处理
- 3. 常见缺失值处理方法
- 4. 如何选择合适的方法
- 5. 实战中常见的工作流程
- 6. 实务中的一个核心原则
- 总结Conclusion






