引言Introduction

TPM是转录组分析里最常用的表达量单位之一,但很多人仍会把count、RPKM、FPKM和TPM混用。如果不理解TPM的计算逻辑,就很容易在可视化、跨样本比较和结果解读上出错。
转录组数据流程示意图,展示FASTQ到count、RPKM、FPKM、TPM的转换路径,突出“测序深度校正”和“基因长度校正”两个环节。

1. TPM为什么适合转录与表达分析

1.1 先解决两个核心偏差

在转录与表达分析中,原始count受两个因素影响最明显。第一是测序深度。第二是基因长度。测序越深,总count越大。基因越长,被读段覆盖的概率也越高。
这意味着,count只能作为起点,不能直接拿来比较不同基因,甚至不能简单比较不同样本。

TPM的价值就在于先处理这两个问题。它先校正基因长度,再校正样本测序量。这样得到的数值更适合做表达展示,也更适合不同样本之间的横向比较。

1.2 为什么TPM比RPKM和FPKM更常用

RPKM和FPKM都能校正长度和测序深度,但它们的一个常见问题是,不同样本之间的总和不固定。 这会影响跨样本比较。
TPM则不同。它把每个样本的总表达量统一到100万。也就是说,每个样本的TPM总和都等于1,000,000。 这使得不同样本之间的表达分布更容易比较。

从实践角度看,TPM更适合:

  • 基因表达图展示。
  • 热图和箱线图绘制。
  • 样本间表达模式对比。
  • 单细胞或bulk转录组的表达概览。

但要注意,TPM适合展示,不适合作为差异表达分析的输入。 差异分析通常仍应从count开始。

2. TPM的计算逻辑与公式

2.1 TPM本质上是“标准化后的相对丰度”

TPM的全称是transcripts per million。可以理解为,在每100万个转录本中,某个基因占多少份额。
它的计算分两步完成。

第一步,先按基因长度做标准化。
第二步,再按样本总量做标准化。

这两个步骤缺一不可。只做其中一步,都不能得到真正可比的TPM。

2.2 标准计算步骤

如果从count出发,TPM的基本思路是:

  1. 先计算每个基因的“长度校正值”。
  2. 将所有基因的长度校正值相加。
  3. 用某个基因的长度校正值除以总和。
  4. 再乘以100万。

用更直观的话说,就是:

  • 先把“长基因更容易被测到”的偏差去掉。
  • 再把不同样本测序量的差异压到同一尺度。

在RNA-seq中,这个处理尤其重要。因为一个基因如果很长,即使真实表达并不高,也可能得到更多reads。TPM通过长度归一化,尽量避免这种假性优势。

2.3 与RPKM、FPKM的关系

TPM和RPKM、FPKM的核心思想接近,但顺序不同。
RPKM/FPKM通常是先对测序深度和长度做校正,再在样本内部解释。TPM则更强调最终总量一致性 。这也是为什么TPM更适合跨样本表达展示。

可以简化理解为:

  • count 是原始信号。
  • RPKM/FPKM 是中间标准化结果。
  • TPM 是更适合展示和比较的表达量结果。

3. 从count到TPM的精准转换

3.1 关键前提:需要基因长度信息

要算TPM,不能只有count。还必须有基因长度。
在常见RNA-seq分析中,长度一般使用外显子长度之和,尤其是参考转录本或注释明确的情况下。没有长度信息,就无法正确进行TPM标准化。

这一点在TCGA和常规bulk RNA-seq中都很重要。因为不同基因长度差异很大,若不校正,结果会偏向长基因。

3.2 常见转换流程

一个标准的count转TPM流程通常包括:

  1. 获取原始count矩阵。
  2. 准备基因注释文件,提取基因长度。
  3. 对每个基因做长度归一化。
  4. 对每个样本把长度归一化后的值求和。
  5. 用单个基因的标准化值除以总和,再乘以100万。

这个流程看起来简单,但每一步都要保证注释版本一致。基因ID版本不一致、长度定义不一致,都会直接影响TPM准确性。

3.3 一个可理解的例子

假设样本A中某基因count为1,总count为1,000,000。
如果先不做长度校正,直接按比例计算,它在样本中的占比是1/1,000,000。
乘以100万后,TPM就是1。

这个例子说明,TPM并不是“绝对表达量”,而是标准化后的相对表达量。
它便于比较,但并不等于分子层面的真实转录本总数。

4. TPM适用场景与边界

4.1 适合做什么

TPM最适合用于表达展示和直观比较。尤其在以下场景中很常见:

  • 基因在不同样本中的表达热图。
  • 某条通路核心基因的表达趋势。
  • 单细胞中某些marker基因的表达展示。
  • 文章图表中的表达量可视化。

在这些场景中,TPM能提供较稳定、可解释的数值基础。当你的目标是“看表达模式”,TPM通常比原始count更合适。

4.2 不适合做什么

TPM不适合直接做差异表达分析。原因很明确。
差异分析关心的是统计分布,而不是简单的比例缩放。TPM虽然标准化了长度和总量,但没有充分解决样本组成差异和统计建模问题。

因此,DESeq2、edgeR、limma-voom等常规流程仍建议以count作为输入。
一句话总结就是:

  • 展示用TPM。
  • 统计检验用count。

4.3 单细胞转录组中的理解

在单细胞转录组中,表达矩阵常常会涉及UMI。UMI是去重后的分子计数。
如果只测到转录本的特定片段,而不是全长转录本,长度校正的意义会有所变化。此时要看建库方式和分析目标。不是所有单细胞数据都必须强行套用同一套TPM逻辑。

这也是为什么在实操中,必须先区分是全长转录本测序,还是3’端或5’端捕获型测序。不同技术路线,对表达量定义的要求不同。

5. 实操中最容易出错的地方

5.1 注释版本不一致

这是最常见的问题之一。
基因ID来自GRCh38还是GRCh37,基因长度取自哪套GTF/GFF,都会影响最终TPM。同一批原始数据,只要注释版本不同,结果就可能偏移。

所以在项目中要固定三件事:

  • 基因组版本。
  • 注释版本。
  • 长度定义方法。

5.2 把TPM当成绝对定量

TPM虽然比count更适合展示,但它仍然是相对指标。
它反映的是样本内部标准化后的占比,不是细胞中真实分子数的绝对值。
因此,在写论文或解读结果时,建议避免把TPM描述成“绝对表达量”。

5.3 忽略低表达和零值

在真实数据中,大量基因会出现0或接近0的表达。
如果直接进行图形展示,常常会导致分布偏斜。
常见做法是:

  • 先过滤低表达基因。
  • 必要时做log转换,如log2(TPM+1)。
  • 再进行可视化。

这样能减少极端值对图形的干扰。

6. 规范化结果如何服务科研分析

6.1 从数据到结论要保持一致

TPM的意义不只是“算出一个数”。它真正的价值在于让表达比较更稳定。
当你在比较不同基因、不同样本、不同条件时,统一的标准化策略决定了结论是否可靠。

如果标准化不一致,后续的生物学解释就会被放大误差。
这在科研写作、课题答辩和投稿审稿中都很常见。

6.2 图表展示要与统计分析分开

一个实用原则是,把“展示”和“检验”分开。
TPM用于画图。count用于统计。
这能让你的分析链条更清晰,也更符合主流转录组分析规范。

例如:

  • 用TPM画基因表达热图。
  • 用count做差异分析。
  • 再把差异基因的表达结果转换成TPM用于展示。

这样既专业,也更容易让审稿人接受。

6.3 高质量表达矩阵来自标准流程

无论是bulk RNA-seq还是单细胞转录组,表达矩阵的质量都决定下游分析上限。
TPM精准定量的核心,不只是公式,而是“注释准确、流程统一、用途明确”。

对于需要快速建立规范表达矩阵的团队,可以借助解螺旋的标准化数据处理思路,把count、长度注释和TPM转换流程一次性打通,减少手工计算误差,也提高项目推进效率。

总结Conclusion

TPM是转录与表达分析中非常实用的标准化方法。它通过先校正基因长度,再统一样本总量,解决了count难以直接比较的问题。
对于展示和跨样本表达比较,TPM通常优于RPKM和FPKM。 但在差异分析中,仍应优先使用count。理解这条边界,是做出可靠结论的前提。

如果你希望把TPM计算、表达矩阵整理和下游分析流程做得更规范,可以进一步了解解螺旋的生信支持方案。让标准化流程先行,往往能显著提升后续分析的准确性与效率。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料