引言Introduction

生存分析里,最容易被忽视的不是公式,而是截尾值。如果删失、失访、随访终止处理不当,KM曲线、Cox回归和结论都会偏。 对医学生、医生和科研人员来说,先分清截尾类型,再决定怎么纳入模型,往往比“会不会做统计”更重要。

临床研究随访流程图,包含入组、事件发生、失访、研究终止等节点,并标注截尾值位置

1. 什么是生存分析中的截尾值

1.1 截尾值不是“缺失值”

生存分析研究的是“事件是否发生”和“发生所需时间”。因此,数据同时包含结局和时间两个维度。截尾值是指结局事件未被完整观察到,但个体仍贡献部分随访信息。 它不是简单缺失,也不能当作普通连续变量处理。

在临床研究中,常见的结局包括死亡、复发、进展、移植排斥等。若研究结束时事件尚未发生,或者患者中途失访,就会出现截尾。此时只能知道“至少活到了某个时间点”,而不知道真实事件时间。

1.2 常见的截尾来源

截尾值主要来自三种情况。

  1. 失访,患者更换联系方式、拒绝随访,或者未继续就诊。
  2. 退出,患者因其他原因死亡,或主动退出研究。
  3. 终止,研究到期时事件仍未发生。

这些个体不能直接删掉。 因为它们仍然提供了从入组到最后一次观察的有效信息。忽略它们,会导致样本利用不充分,甚至引入偏倚。

1.3 右截尾最常见

在临床随访研究中,最常见的是右截尾。意思是,研究者只知道事件发生时间“大于某个观察时点”。例如,患者随访12个月时仍无复发,但之后失访。我们只能写成“>12个月”,而不能推断真实复发时间。

右截尾是生存分析的常态,不是异常。 这也是为什么Kaplan-Meier法和Cox回归要专门处理截尾数据,而不能用普通线性回归替代。

2. 截尾值处理不当,会带来哪些关键陷阱

2.1 直接删除会低估真实风险

很多初学者会把截尾个体直接删除,只分析“有事件的人”。这是常见错误。这样会让高风险人群和低风险人群的构成被扭曲,尤其在失访率较高时更明显。

例如,肿瘤研究中如果一组患者失访更多,而失访往往与病情加重相关,直接删除会让这一组看起来“生存更好”。结果不是更干净,而是更偏。

2.2 把截尾当作结局会严重失真

另一个错误是把“未发生事件”当成“事件未发生且永远不发生”。这会把观察截止时间误当作真实生存时间,明显夸大生存率。

在实际分析中,截尾个体的贡献是“截至最后观察时点仍未发生事件” ,而不是“事件一定不会发生”。这一区别决定了生存曲线的正确估计方式。

2.3 非随机截尾会破坏研究可信度

理想情况下,截尾应近似于随机,即与真实结局无关。但现实中,失访往往并不随机。病情重、经济负担高、依从性差的人更容易失访。这样就会产生信息性截尾,造成系统性偏倚。

如果截尾与预后因素相关,结论的可信度会明显下降。 这也是审稿人和临床读者非常关注的问题。研究报告中应尽量说明失访比例、失访原因和处理方法。

3. 截尾值如何在统计分析中正确处理

3.1 Kaplan-Meier法如何利用截尾信息

Kaplan-Meier生存曲线的核心思想是,只在事件发生时更新生存概率。截尾个体不会被当作事件,但会在其最后一次观察前,继续计入风险集。

换句话说,截尾不会直接拉低生存率,但会影响后续时间点的分母。 这正是KM法能正确处理随访不完整数据的原因。

在报告结果时,通常还应给出:

  • 中位生存时间。
  • 特定时间点生存率,如1年、3年、5年生存率。
  • Log-rank检验的P值。

这些指标比单纯描述“有多少人失访”更能反映数据质量。

3.2 Cox回归中如何看待截尾值

Cox回归用于分析影响生存结局的因素。它同样能处理右截尾数据。模型会利用个体在随访期间的信息,而不是要求每个人都有完整结局。

Cox回归的前提之一,是截尾机制独立于结局。 如果截尾不是随机的,模型估计的HR也可能偏离真实值。因此,在进入多因素分析前,研究者应先评估失访模式是否均衡。

实际写作中,建议将单因素和多因素Cox结果同时呈现,包括:

  • HR。
  • 95%CI。
  • P值。

如果某变量在单因素显著,但在多因素不显著,往往提示它受混杂因素影响,而不是“完全没有作用”。

3.3 截尾值还会影响样本量和统计功效

生存研究不只看总样本数,更看事件数。事件数不足,会直接削弱Cox模型稳定性。 截尾比例过高时,即使纳入很多患者,真正可用于比较的信息也有限。

因此,设计阶段就应尽量控制随访方案,减少不必要的失访。对于预测或预后标志物研究,这一点尤为重要。因为标志物的效应往往需要足够的事件数才能体现。

4. 临床研究中处理截尾值的实用策略

4.1 设计阶段先降低截尾率

最有效的策略,永远是前置管理。研究开始前,就应明确终点事件、随访频率和时间点。建议做到以下几点:

  1. 统一入组起点,减少时间偏倚。
  2. 设定固定随访节点,如每3个月或每6个月。
  3. 保留多种联系方式,降低失访。
  4. 记录失访原因,便于后续敏感性分析。

研究设计越规范,截尾值越可控。 这比事后补救更重要。

4.2 分析阶段要区分“正常截尾”和“异常失访”

不是所有截尾都等价。研究结束时未发生事件的患者属于行政截尾,这通常是正常的。真正需要警惕的是因疾病进展、治疗中断、严重并发症导致的失访。

建议在结果部分说明:

  • 总随访时间。
  • 中位随访时间。
  • 截尾人数和比例。
  • 失访原因分类。

如果失访比例较高,最好补充敏感性分析,检验结论是否稳定。

4.3 结果展示要透明

透明报告比“把数据处理得很漂亮”更重要。 生存曲线图中,通常应标出风险人数表。这样读者能看到每个时间点仍在观察的人数,判断后期曲线是否可靠。

同时,表格中应明确结局定义。例如:

  • OS,overall survival。
  • PFS,progression-free survival。
  • DFS,disease-free survival。

不同终点的截尾含义不同,不能混用。对医学生和年轻研究者来说,这一步尤其容易出错。

5. 论文写作中最常见的三类错误

5.1 终点定义不清

有些文章把“随访结束未死亡”直接写成“生存”。这是不严谨的。应明确是OS、PFS,还是其他终点。终点不同,截尾解释也不同。

5.2 把失访原因一笔带过

如果文中只写“若干例失访”,却不说明原因和比例,读者很难判断偏倚风险。尤其在回顾性研究中,失访分布常常影响最终结论。

5.3 忽视模型假设

KM和Cox都不是“拿来就能用”的工具。它们依赖删失独立等假设。若截尾明显不随机,需谨慎解释HR和P值,必要时结合分层分析或敏感性分析。

总结Conclusion

生存分析截尾值处理的核心,不是简单“保留”或“删除”,而是识别截尾类型,判断其是否影响结局解释,并在模型中正确纳入 。对临床研究而言,右截尾是常态,但非随机失访会带来偏倚。研究者应在设计阶段降低失访率,在分析阶段透明报告,并在写作中准确区分OS、PFS和截尾含义。

如果你正在做生存分析、预后模型或标志物研究,但在截尾值处理、KM曲线绘制、Cox回归结果整理上仍有疑问,可以借助解螺旋 的专业支持,减少统计陷阱,提高论文通过率和发表效率。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料