引言Introduction

临床研究中,缺失值处理几乎绕不开。问卷漏答、检验未做、录入错误,都会让数据分析失真。如果处理不当,样本量会减少,偏倚会放大,结论也可能失去可信度。 本文按临床研究常用流程,系统梳理缺失值处理方法与适用场景。临床研究数据表格、缺失单元格高亮、研究者分析数据的专业场景图

1. 缺失值为什么不能忽视

1.1 缺失值会影响什么

缺失值不是简单的“空白”。它会直接影响统计结果。

常见影响有三类:

  1. 样本量下降 。删除缺失个案后,纳入分析的数据会变少。
  2. 信息损失 。原本可用的临床特征、随访信息和结局信息会被丢掉。
  3. 结果偏倚 。如果缺失并非随机,分析结论可能偏离真实情况。

在回归模型中,软件通常会自动剔除含缺失的个案。看似“没有删除”,本质上还是样本减少。

1.2 先判断缺失类型

缺失值处理前,先判断缺失机制。临床研究中常见三类。

  • 完全随机缺失 。缺失与任何变量都无关。
  • 随机缺失 。缺失与其他变量有关,但与自身数值无关。
  • 非随机缺失 。缺失与变量本身有关。

最适合常规填补的方法,通常建立在完全随机缺失或随机缺失的前提下。
如果是非随机缺失,直接填补更容易引入误差。

2. 先做资料核查,再决定是否处理

2.1 资料核查法是第一步

发现缺失值后,第一步不是马上填补,而是核查原始资料。

可以优先检查:

  • 原始病例报告表。
  • 电子病历或检验系统。
  • 调查问卷原件。
  • 是否存在录入遗漏。

如果是录入错误或抄录遗漏,补回真实数据是最理想的方案。
这一步的价值在于,它恢复的是原始信息,而不是“估算值”。

2.2 什么时候可以不处理

并非所有缺失都必须强行补齐。
有时“不处理”也是一种处理。

适合保留缺失标记的情况包括:

  • 缺失率较低。
  • 缺失变量不是核心变量。
  • 后续分析模型可以接受这种设置。
  • 研究目的更重视透明报告而非完整补值。

但要注意,不处理不等于忽略。
论文或报告中应明确说明缺失比例和处理方式。

3. 常见缺失值处理方法

3.1 个案删除法

当缺失样本较少、样本量较大时,可以删除含缺失值的整条个案。

优点很直接:

  • 操作简单。
  • 后续分析方便。
  • 结果解释清晰。

但它的代价也很明显:

  • 样本量下降。
  • 可能破坏样本代表性。
  • 若缺失集中在关键变量上,偏倚风险上升。

除非缺失的是非常关键的暴露因素或结局因素,否则不建议轻易整例删除。

3.2 虚拟变量法

虚拟变量法主要用于分类变量缺失
做法是把缺失单独编码为一个新类别,比如“未知”。

例如吸烟状态:

  • 1 = 吸烟
  • 0 = 不吸烟
  • 9 = 缺失或未知

这种方法的好处是:

  • 不丢失其他信息。
  • 保留原始个案。
  • 在模型中可单独评估“未知”类别。

但风险也存在。
如果“缺失”本身并不代表一个真实类别,模型估计可能被干扰。

3.3 均数或众数填补法

这是最容易理解的填补方法。

适用规则很明确:

  • 连续型变量 ,可用均数或中位数。
  • 分类变量或计数资料 ,常用众数。

例如身高缺失,可以用同组平均身高替代。
例如机构人数缺失,可用最常见人数填补。

优点是:

  • 简单。
  • 快速。
  • 易于在小规模数据中实施。

缺点也很明显:

  • 会压缩变量变异。
  • 可能低估标准误。
  • 容易造成结果偏倚。

它更像应急方案,不是高质量研究的首选方案。

3.4 回归法

当缺失变量与其他变量之间关系清楚时,可以用回归法。

思路是:

  1. 找到与缺失变量相关的预测变量。
  2. 建立回归模型。
  3. 用模型预测缺失值。

例如血压缺失时,可结合年龄、性别、职业等变量估计。
常见模型包括线性回归和Logistic回归。

这类方法的优势是:

  • 估计有依据。
  • 比简单均值填补更符合变量关系。
  • 适合变量间关联明确的场景。

但前提要求更高:

  • 需要较好的建模基础。
  • 需要明确变量关系。
  • 结果依赖模型设定。

3.5 多重插补

多重插补是临床研究里非常常见的方法。
它的核心思想是:缺失值不是唯一的,而是存在不确定性。

它的基本流程是:

  1. 根据已知变量建立缺失值分布。
  2. 生成多个完整数据集。
  3. 分别进行统计分析。
  4. 合并多个结果,得到最终估计。

这种方法的优点很突出:

  • 能同时处理多个变量缺失。
  • 能反映插补不确定性。
  • 通常比单次填补更稳健。

在实际研究中,多重插补常被用于回归分析、预后研究、队列研究等场景。
当缺失变量较多、变量关系复杂时,它通常比简单填补更可靠。

4. 如何选择合适的方法

4.1 先看缺失比例

缺失比例是决策的重要依据。

一般可以这样理解:

  • 低缺失率 ,可考虑填补或保留。
  • 中等缺失率 ,优先考虑多重插补或回归法。
  • 高缺失率 ,要谨慎,必要时考虑删除变量或重新评估研究设计。

如果某个变量缺失超过50%,继续填补的意义往往会下降。
因为不确定性太高,结果容易失真。

4.2 再看变量重要性

不是所有变量都值得同样处理。
要先判断它是不是核心变量。

  • 暴露因素缺失 。影响分组和因果推断。
  • 结局变量缺失 。直接影响主要终点判断。
  • 协变量缺失 。通常更适合通过插补处理。

如果是核心变量缺失,简单填补可能会造成错误分类。
这种情况下,删除或重新核查往往比盲目补值更稳妥。

4.3 再看变量类型

不同变量,处理方式不同。

  • 分类变量,优先考虑虚拟变量法或多重插补。
  • 连续变量,常见方法是均数、中位数、回归法或多重插补。
  • 多变量联合缺失,优先考虑多重插补。

方法的选择,不是越复杂越好,而是越符合数据结构越好。

5. 实战中常见的工作流程

5.1 一个更稳妥的处理顺序

临床研究里,可以按以下顺序处理缺失值:

  1. 先核查原始资料。
  2. 判断缺失机制和缺失比例。
  3. 判断变量是否为核心变量。
  4. 根据变量类型选择方法。
  5. 对比不同方法的结果。
  6. 在论文中如实报告处理过程。

这个流程的好处是,既保证数据质量,也方便审稿和复现。

5.2 结果比较很重要

缺失值处理后,最好做敏感性分析。
也就是比较不同处理方式下,结论是否一致。

可重点比较:

  • 主要效应方向是否一致。
  • 置信区间是否明显变化。
  • P值是否稳定。
  • 模型拟合是否明显波动。

如果不同方法得出一致结论,研究可信度会更高。
如果差异很大,就说明缺失值处理对结论影响显著,需要重新审视数据质量。

5.3 报告时不能省略

很多研究的问题,不在于没处理缺失值,而在于没说清楚怎么处理。

论文中建议交代:

  • 缺失比例。
  • 缺失变量名称。
  • 采用的处理方法。
  • 是否进行了敏感性分析。

这符合临床研究的透明原则,也更符合 E-E-A-T 所强调的可信表达。

6. 实务中的一个核心原则

缺失值处理没有统一万能公式。
每一种方法都有边界条件。

  • 个案删除简单,但会损失样本。
  • 均数填补方便,但容易偏倚。
  • 回归法更有依据,但模型要求高。
  • 多重插补更稳健,但需要规范实施。

因此,真正专业的做法不是“只会一种方法”,而是根据研究目的、变量类型和缺失模式做选择。

如果你希望在临床研究中更高效地完成数据清洗、插补和分析流程,解螺旋 可以帮助你把缺失值处理做得更规范、更系统,减少返工,提高分析效率。

总结Conclusion

缺失值处理不是数据清洗里的附属步骤,而是影响研究可信度的关键环节。先核查,再判断缺失机制,再选方法。对临床研究来说,最重要的不是把空白补上,而是用最合理的方式恢复数据结构和统计解释力。 如果你正在做课题、论文或回顾性分析,不妨把缺失值处理流程标准化,并借助解螺旋 提升数据处理效率与研究质量。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料