引言Introduction
Kaplan-Meier分析是临床预后研究的核心方法之一,但很多人容易在时间变量、结局变量、删失数据和曲线解读 上出错。对医学生、医生和科研人员来说,真正的难点不是“会点软件”,而是能否把数据整理对、把结果解释准。

1. Kaplan-Meier分析到底解决什么问题
1.1 先明确什么是生存结局
Kaplan-Meier分析用于估计事件发生前的生存概率 。这里的“事件”不一定是死亡,也可以是复发、进展、失访前的特定终点,前提是研究设计中已预先定义。
它回答的是:在不同时间点,仍然未发生事件的人还有多少。
在临床研究中,常见结局包括:
- 总生存期,事件通常定义为死亡。
- 无进展生存期,事件通常定义为进展或死亡。
- 无病生存期,事件通常定义为复发、转移或死亡。
1.2 为什么Kaplan-Meier比简单比例更适合随访研究
如果只统计“最终死亡人数/总人数”,会忽略随访时间差异。比如两组患者都死亡10人,但一组平均随访12个月,另一组平均随访48个月,临床含义完全不同。
Kaplan-Meier方法的优势在于,它把时间维度纳入分析。
它可以处理:
- 随访时间不一致。
- 中途失访。
- 研究结束时仍未发生事件的病例。
这也是它在肿瘤学、心血管、移植、慢病管理中被广泛使用的原因。
2. 规范应用Kaplan-Meier分析前,先把数据整理对
2.1 时间变量和状态变量必须分开
做Kaplan-Meier分析时,最基本的数据结构只有两类变量。
第一类是时间变量 。
它表示从起始时点到终点事件或最后随访的时间间隔。单位要统一,常见为月或天。
第二类是状态变量 。
它表示是否发生事件。通常采用二分类编码。比如:
- 1,发生事件。
- 0,删失或未发生事件。
注意,编码规则必须在全文和表格中保持一致。
这是很多初学者最常见的错误之一。
2.2 删失数据不能随意删除
删失是生存分析中的正常现象,不是“脏数据”。常见删失包括:
- 随访结束时未发生事件。
- 中途失访。
- 因其他原因退出研究。
在Kaplan-Meier分析中,删失个体会贡献其已观察到的随访时间,但不会被计为事件。
删失不是失败,它是生存分析必须保留的信息。
2.3 先做变量赋值,再进入统计软件
在实际数据整理中,分类变量要先完成赋值。比如:
- 性别,男=1,女=2。
- 吸烟,吸烟=1,不吸烟=0。
- 分期,I期=1,II期=2,III期=3,IV期=4。
连续变量则保留原始数值。比如年龄、随访月数等。
如果研究对象包含多个时间点或多种结局,还要先明确:
- 起始点。
- 终止点。
- 事件定义。
- 删失规则。
这四项不清楚,后面的曲线和P值都没有可靠基础。
3. Kaplan-Meier曲线是怎么计算出来的
3.1 核心思想是分段相乘
Kaplan-Meier法又称乘积极限法。它的基本思想很简单:
把每个时间点的生存概率逐段相乘,得到累计生存率。
在每个事件时间点,需要计算:
- 期初人数。
- 当期事件数。
- 当期删失数。
- 当期生存概率。
其直观表达是:
累计生存率 = 前一时点累计生存率 × 当期生存概率。
这就是KM曲线呈阶梯状下降的原因。
3.2 一个规范的数据处理顺序
在临床研究中,建议按以下步骤处理:
- 将生存时间从小到大排序。
- 区分事件和删失。
- 计算每个时间点的事件数和删失数。
- 计算期初风险集人数。
- 计算各时点生存概率。
- 得出累计生存率。
- 绘制Kaplan-Meier曲线。
如果某一时间点既有事件又有删失,通常先记录事件,再记录删失,具体以统计软件规则为准。
软件只是执行工具,真正决定结果的是前面的数据定义。
3.3 曲线阶梯越陡,不一定只是“生存差”
KM曲线下降快,说明事件发生更早或更多。但解读时不能只看形态,还要结合:
- 样本量。
- 事件数。
- 随访长度。
- 是否存在大量删失。
如果后期风险集人数很少,曲线末端的波动会更大。
因此,不能仅凭曲线末端的一个下跌就下结论。
4. Kaplan-Meier结果应该怎么看,才不容易误读
4.1 先看中位生存时间
中位生存时间是KM结果中最常用的指标之一。它指的是累计生存率下降到0.5时对应的时间点 。
它的临床意义很明确:
- 50%的研究对象已发生事件。
- 50%仍未发生事件。
如果曲线始终没有降到0.5,则中位生存时间可能无法估计,或需要报告“未达到”。
中位生存时间不是平均生存时间。
两者不能混用。
4.2 再看指定时间点生存率
临床论文中常常报告1年、3年、5年生存率。
KM法的优点之一,就是可以直接从曲线或生存表中提取这些节点的生存概率。
解读时要注意:
- 时间节点必须预先设定。
- 各组比较时应使用同一时间点。
- 若随访不足,远期生存率的稳定性会下降。
4.3 曲线比较不能只看“上下位置”
两组KM曲线谁在上面,通常提示生存更好。但正式结论必须依赖统计检验。
常用方法是Log-rank检验 。
它比较的是两组总体生存函数是否存在差异,适合组间事件风险随时间相对平稳的情况。
曲线分开,不等于差异一定显著。
P值显著,也不代表临床差异一定大。
还要结合HR、置信区间和绝对生存差异一起看。
5. Log-rank检验和临床意义怎么一起解读
5.1 Log-rank检验适合回答“有没有差别”
Log-rank检验的原假设是:各组生存曲线无差异。
如果P值小于0.05,提示差异具有统计学意义。
但临床写作中不能只写“P<0.05”。
还应补充:
- 哪一组生存更好。
- 差异持续发生在早期还是晚期。
- 是否存在临床可解释的背景因素。
5.2 结果报告要包含哪些内容
一篇规范的Kaplan-Meier结果,通常至少写清:
- 研究对象数量。
- 事件定义。
- 各组中位生存时间。
- 指定时间点生存率。
- Log-rank检验结果。
- 曲线差异的方向。
例如可按这种结构表达:
- A组中位生存时间为X个月。
- B组中位生存时间为Y个月。
- 两组生存曲线差异具有统计学意义,Log-rank检验P值为0.XXX。
如果只给一张曲线图而不解释统计结果,读者很难判断结论的可信度。
5.3 不要把KM分析当成多因素分析
KM分析只能做单因素分组比较 。
它不能同时调整年龄、性别、分期、治疗方式等混杂因素。
如果研究目标是评估独立预后因素,就需要进一步做Cox回归。
KM适合描述和比较,Cox适合校正和推断。
这是两者最重要的分工。
6. 临床研究中最常见的几个错误
6.1 把状态变量编码反了
有些软件默认“1=事件”,有些研究者却把“1=存活”。
这样会直接导致曲线含义颠倒。
输出前必须核对事件编码。
6.2 把删失当成事件
删失病例不应计入事件数。
如果把失访、研究结束未发病的人算作事件,生存率会被系统性低估。
6.3 忽略随访起点不一致
如果不同病例的起始时间定义不一致,比如有的从诊断开始算,有的从治疗开始算,KM结果就不可比。
起点必须统一。
这一点在肿瘤、术后、生存队列中尤其重要。
6.4 只报P值,不报时间指标
临床读者更关心“活多久”和“差多少”。
所以结果里应尽量同时报告:
- 中位生存时间。
- 1年、3年、5年生存率。
- 组间P值。
P值告诉你是否不同,生存率告诉你差多少。
7. 从研究到写作,如何让Kaplan-Meier分析更规范
7.1 方法学写作要写清楚的内容
在论文方法部分,建议明确说明:
- 生存终点定义。
- 时间起点和终点。
- 删失标准。
- Kaplan-Meier法用于估计生存曲线。
- Log-rank检验用于组间比较。
这样做的好处是,审稿人和读者可以快速判断研究设计是否严谨。
7.2 结果图和表的呈现建议
一张好的KM图应该包含:
- 时间轴。
- 生存率轴。
- 各组曲线。
- 风险人数表。
- 统计检验结果。
如果有条件,最好同步提供表格,列出:
- 各时间点生存率。
- 中位生存时间。
- 置信区间。
图负责直观,表负责精确。
两者结合,文章可信度更高。
7.3 让分析结果更容易转化为科研结论
KM分析真正的价值,不只是画出一条线,而是帮助研究者识别:
- 哪类患者预后更差。
- 哪个治疗策略更有优势。
- 哪些变量值得进入后续多因素模型。
如果你希望把这一步做得更稳妥,解螺旋品牌 提供的临床研究方法学内容和数据分析支持,可以帮助你把数据整理、KM曲线绘制和结果解读串成完整流程,减少因编码、删失和报告格式错误带来的返工。
总结Conclusion
Kaplan-Meier分析是临床生存研究中最基础,也最容易被误用的方法之一。它的关键不在于软件操作,而在于定义清楚事件、正确处理删失、规范计算生存概率,并用Log-rank检验完成组间比较 。
如果你正在做肿瘤、预后或随访研究,建议先把时间变量、状态变量和删失规则写清楚,再进入统计分析。这样得到的曲线、P值和中位生存时间,才真正可解释、可发表、可复现。想把KM分析做得更规范、更高效,可以进一步结合解螺旋品牌 的临床研究方法学资源,提升从数据整理到论文输出的整体质量。

- 引言Introduction
- 1. Kaplan-Meier分析到底解决什么问题
- 2. 规范应用Kaplan-Meier分析前,先把数据整理对
- 3. Kaplan-Meier曲线是怎么计算出来的
- 4. Kaplan-Meier结果应该怎么看,才不容易误读
- 5. Log-rank检验和临床意义怎么一起解读
- 6. 临床研究中最常见的几个错误
- 7. 从研究到写作,如何让Kaplan-Meier分析更规范
- 总结Conclusion






