引言Introduction

临床数据清洗是把原始临床数据变成可分析、可发文结果的关键一步。很多研究者在导入SPSS后急于统计,忽略了重复、异常和缺失,最后影响结论可靠性。数据清洗不是附加工作,而是统计分析的一半。

医学生或科研人员在电脑前核对临床表格,旁边展示Excel、SPSS和数据清洗流程示意图。

1. 为什么临床数据清洗决定研究质量

1.1 先清洗,再分析

临床研究常见流程是:数据收集,整理,导入统计软件,清洗,验证,锁库,分析。这个顺序不能反。因为一旦原始数据中存在错误值,后续统计结果就可能被放大偏差。

临床数据清洗的核心目标,是尽可能把“不可分析的数据”变成“可分析的数据”。
在实际项目中,数据问题主要集中在三类。重复个案,异常值,缺失值。只要这三类问题没有处理好,后续回归、分组比较、生存分析都可能失真。

1.2 研究者最容易忽略的两个环节

很多人以为数据导入完成就可以开始分析。实际上,导入后最先做的不是跑P值,而是检查数据结构是否完整。
上游知识库强调了两个容易被忽视的步骤。第一是清洗验证 ,即重新审视每个变量,重复异常值和缺失值检查,确认问题已被处理。第二是锁定数据库 ,确保未来所有分析都基于同一个最终版本。

这一步很关键。因为如果数据库反复修改,不仅会影响结果一致性,也会影响研究的可追溯性。

2. 临床数据清洗的完整流程

2.1 数据整理与导入

临床数据常先从录入系统导出,再导入SPSS或其他统计软件。知识库建议,优先导出为Excel或TXT格式,再导入SPSS。原因很直接。直接导出SPSS格式时,中文和时间格式更容易出现转码错误。

导入后,先不要急着做描述性统计。建议先检查变量名、变量类型、时间格式、分类编码是否统一。
例如,性别变量必须确认编码一致。1代表男性,2代表女性。否则,后续交叉分析会出现错误解释。

2.2 重复个案识别

重复个案常见于多中心录入、多人协作录入、或者合并多个文件后。
识别时要先定义匹配依据。常见做法有两种:

  1. 仅以ID判断重复。
  2. 以ID加姓名判断重复。

如果原始表格本身没有统一的唯一标识,重复识别就会变得复杂。因此,研究启动前建立统一ID,是临床数据清洗的基础。

2.3 异常值识别

异常值是指不符合现实逻辑或数学逻辑的值。
对于连续变量,可从两个角度判断。

  • 现实逻辑。例如年龄出现负数,显然不合理。
  • 数学逻辑。例如通过箱形图判断,落在1.5倍四分位距之外的值,可视为异常值候选。

对于分类变量,更适合直接用现实逻辑判断。比如性别出现3,吸烟状态出现5,都属于需要核查的值。

异常值不等于错误值。 90岁的患者未必是异常录入,也可能是真实病例。处理前要先核对原始病历、问卷或数据库来源。

3. 异常值和缺失值怎么处理才规范

3.1 异常值的处理原则

临床数据清洗中,异常值处理不能一刀切。知识库给出的思路是“具体情况具体分析”。常见处理方式有四种。

  • 核对原始资料,确认是否录入错误。
  • 更正为真实值。
  • 删除整条记录。
  • 将异常值改为缺失值。

如果异常值出现在关键分组变量上,例如吸烟与否,且无法判断真实含义,通常应谨慎处理。因为这类变量一旦错误,整个分组分析都会受影响。

3.2 缺失值的分类

缺失值不能只看“有没有”,还要看“为什么缺失”。上游知识库中提到三类情况。

  • 非随机缺失。缺失与变量本身有关。
  • 随机缺失。缺失与该变量有关,但可借助其他变量推断。
  • 完全随机缺失。缺失与自身和其他变量都无关。

这三类缺失不能用同一种方法处理。
尤其是非随机缺失,不适合简单用均数填补或多重填补。

3.3 缺失值常用处理方法

知识库列出的常见方法包括:

  1. 资料核查。
  2. 不处理。
  3. 个案删除法。
  4. 虚拟变量法。
  5. 均数填补法。
  6. 多重填补法。

其中,多重填补较常用,但前提是缺失机制合适,且缺失比例不宜过大。知识库给出的经验是,缺失值比例在10%以下时,填补通常更可接受。

对研究者来说,最重要的不是“用哪一种方法最先进”,而是“哪一种方法最符合数据机制”。

4. 清洗验证与变量说明表的价值

4.1 为什么要做清洗验证

很多团队做完第一轮数据清洗后,会直接交给统计人员分析。但这并不稳妥。
因为人工修正后,仍可能残留未发现的问题。清洗验证的目的,就是再次核查每个变量,确认异常值和缺失值确实已经处理。

清洗验证相当于数据质量的复检。
它能明显降低后续分析返工的概率,也能减少合作团队之间对数据版本的争议。

4.2 变量说明表必须建立

当变量名全部使用英文时,分析人员未必知道每个变量的临床含义。因此,必须附上变量说明表。表中至少应包含:

  • 变量名。
  • 变量含义。
  • 取值范围。
  • 变量类型。
  • 编码说明。

例如,name代表姓名,没有固定取值范围。
性别变量可写明1为男性,2为女性,并注明是分类变量。
如果研究中新增了派生变量,比如依据收缩压和舒张压判断是否高血压,也要及时补入说明表。

变量说明表的作用,不只是解释变量,更是保证数据可追溯。

5. 临床数据清洗案例解析

5.1 案例一,重复录入导致样本数偏大

某临床研究在合并多个录入文件后,发现样本数比原始病例数多出若干例。检查后发现,部分个案在多人录入时被重复导入。
处理方式是先定义重复依据,再逐条核对,删除重复记录。
这个案例说明,样本数异常增加,首先要怀疑重复个案,而不是直接认为研究对象增多。

5.2 案例二,性别变量出现异常编码

在分类变量中,性别出现了除1和2以外的编码。
由于无法判断其临床含义,最终将该条记录重新核对。若无法确认来源,则按缺失或无效值处理。
这类问题在小样本研究中影响尤其明显,因为只要错一例,比例就可能明显波动。

5.3 案例三,年龄极端值是否删除

年龄变量中出现90岁,研究者一开始怀疑是错误录入。
但核对原始资料后发现,患者确实存在。
这个案例说明,极端值不等于异常值,异常值也不等于错误值。
处理时必须结合病历、量表和研究背景判断,而不能只看统计图。

5.4 案例四,缺失值比例过高

如果某个关键变量缺失超过10%,继续简单填补往往会降低数据可信度。
这时应优先判断缺失机制,再决定是否采用删除、分层分析或敏感性分析。
对于临床研究来说,数据完整性和统计效率必须平衡,不能只追求“补全”。

6. 写给医学生、医生和科研人员的实操建议

6.1 建立标准化流程

临床数据清洗不要靠个人经验临时处理。建议项目开始前就统一以下内容:

  • 编码规则。
  • 变量命名规则。
  • 缺失值标记规则。
  • 重复判定规则。
  • 异常值核查流程。

流程标准化,能显著减少后期返工。

6.2 锁库前必须完成三件事

锁定数据库前,至少要完成三件事:

  1. 复核异常值。
  2. 复核缺失值。
  3. 核对变量说明表是否与数据库一致。

完成后再锁库,后续分析才能保持一致。对于多作者合作项目,这一步尤为重要。

6.3 用专业工具提高效率

在临床数据清洗和分析衔接上,规范工具和规范模板非常重要。对医学生、医生和科研人员来说,若要减少导入错误、变量混乱、版本不一致的问题,使用标准化的数据整理工具和模板会更高效。解螺旋 提供的科研支持思路,就是帮助研究者把数据清洗、变量定义和后续分析衔接起来,减少低级错误,把更多时间留给真正的科研问题。

总结Conclusion

临床数据清洗不是形式步骤,而是临床研究可信度的基础。它包括数据导入、重复个案识别、异常值处理、缺失值分析、清洗验证、变量说明表建立和数据库锁定。
只要前期清洗规范,后续统计才更稳,结论才更可信。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料