引言Introduction

转录组比对是差异表达分析的起点。若原始数据质控、比对、计数任何一步出错,后面的DEG结果都会偏。很多初学者拿到fastq后就急着做差异分析,却忽略了比对率、唯一比对率和低表达过滤,这会直接影响结论可信度。先把比对做对,后面的差异分析才有意义。
RNA测序流程示意图,从fastq原始数据到比对、计数、差异分析的完整管线图,突出比对步骤

1. 转录组比对前,先确认数据是否可分析

1.1 原始数据的三个关键检查点

转录组比对不是直接把文件丢进软件就结束。先看数据是否满足分析条件。对医学生、医生和科研人员来说,最常见的问题不是“不会跑命令”,而是“输入数据本身有问题”。

建议先检查以下三项:

  • 测序类型是否明确,单端还是双端。
  • 是否保留原始fastq,文件是否完整。
  • 样本分组是否清楚,是否有生物学重复。

没有重复样本时,差异表达结果的统计稳定性会明显下降。 一般建议每组至少3个生物学重复,才能较稳妥地估计组内波动。

1.2 质控结果决定后续是否要修剪

在进入比对前,先做基础质控。重点看:

  • Q30比例。
  • 接头污染。
  • 序列长度分布。
  • 低质量碱基集中位置。

如果接头污染明显,或3’端质量下降严重,就应先做trim。
如果不处理这些问题,后续比对率可能下降,且多重比对增加,影响定量准确性。

2. 转录组比对的核心逻辑是什么

2.1 比对不是“找相同”,而是“定位来源”

转录组比对的本质,是把测序读段定位到参考基因组或转录本上。RNA-seq读段往往跨越外显子连接位点,因此不能简单使用普通DNA比对思路。

常见比对策略有两类:

  1. 比对到基因组。
    适合后续做表达定量、剪接分析、融合基因分析。

  2. 比对到转录本。
    更偏向快速定量,但对新剪接事件的发现能力有限。

如果目标是标准差异表达分析,通常更推荐“基因组比对 + 基因计数”的流程。

2.2 为什么转录组比对比DNA比对更复杂

RNA-seq数据存在几个典型特点:

  • 存在剪接。
  • 存在外显子连接。
  • 表达量高度不均。
  • 低丰度转录本容易丢失。

这意味着比对软件必须支持spliced alignment。常见工具包括STAR、HISAT2等。它们能识别跨外显子的读段,避免把真实转录本错判为无法比对。

3. 从比对到计数,标准流程怎么走

3.1 推荐的基础流程

一个规范的转录组比对流程通常如下:

  1. 原始数据质控。
  2. 去接头和低质量序列。
  3. 选择参考基因组和注释文件。
  4. 进行转录组比对。
  5. 统计比对质量。
  6. 生成基因层面的count矩阵。
  7. 进入差异表达分析。

比对本身不是终点,count矩阵才是差异分析的直接输入。

3.2 参考基因组和注释文件要配套

这是很多人最容易忽略的一步。参考基因组版本和GTF注释文件必须匹配。比如基因组是GRCh38,但注释却来自旧版本,后续可能出现:

  • 基因名对应错误。
  • 读段统计丢失。
  • 某些基因无法计数。

对于转录组比对,建议固定版本,并在项目全程保持一致。
同一项目中不要混用不同来源的参考文件。

3.3 比对完成后重点看哪些指标

比对结果出来后,不要只看“成功”两个字。至少要核查以下内容:

  • 总比对率。
  • 唯一比对率。
  • 多重比对率。
  • 错配比例。
  • 插入片段分布。
  • 比对到外显子、内含子和间隔区的比例。

如果唯一比对率过低,说明数据可能存在重复序列多、污染、物种不匹配或建库质量问题。
如果大量读段落在内含子或间隔区,要考虑样本来源、文库类型或注释文件是否有问题。

4. 差异表达基因分析,真正关键的不只是fold change

4.1 从count矩阵到DEG

完成转录组比对后,下一步是基因计数。计数矩阵中,每一行是一个基因,每一列是一个样本。这一步决定了后续差异分析的输入质量。

进入差异分析时,通常会使用DESeq2、edgeR或limma-voom。以DESeq2为例,模型会先估计标准化因子,再计算离散度,最后进行显著性检验。
它关注的不只是表达量差异,还包括样本间波动。

4.2 结果表里的几个核心字段

差异分析结果表通常包含:

  • baseMean,表示所有样本中标准化后的平均表达量。
  • log2FoldChange,表示表达倍数变化取对数后的结果。
  • pvalue,原始显著性水平。
  • padj,多重检验校正后的p值。

其中,padj比原始p值更适合用于正式筛选。
因为RNA-seq常同时检测上万基因,若不做多重校正,假阳性会明显增加。

4.3 常用筛选阈值怎么设

没有统一标准,但在实际研究中常见做法是:

  • padj < 0.05。
  • |log2FoldChange| > 1。

如果研究更强调稳定性,阈值可以更严格。
如果样本量小,建议谨慎扩大倍数阈值,避免漏掉潜在重要基因。

不要只盯着fold change。低表达基因即使倍数变化大,也可能缺乏生物学稳定性。

5. 转录组比对后,如何判断结果是否可信

5.1 先看样本层面的整体一致性

差异表达结果是否可靠,先看样本是否分群合理。常用方法包括:

  • PCA。
  • 样本相关性热图。
  • 聚类树。

如果同组样本不能聚在一起,或者批次效应明显,说明比对后的计数矩阵可能仍存在问题,或者实验设计本身存在干扰。

5.2 再看低表达和零计数基因

在DESeq2分析中,若某些基因在所有样本中count为0,后续结果会为空。
这不是报错,而是说明该基因根本没有检测到表达。

另一个常见情况是低表达基因没有给出矫正后的p值。
这通常是DESeq2在提示你,这类基因的统计证据不足,需要谨慎解释。

5.3 生物学解释要回到实验背景

差异表达分析不是排行榜。
真正有意义的结果,应该结合疾病状态、药物处理、时间梯度或组织来源来解释。

比如:

  • 炎症模型中,免疫相关基因上调是否符合机制。
  • 肿瘤样本中,增殖和细胞周期通路是否富集。
  • 药物处理后,代谢和应激反应是否发生改变。

统计显著不等于生物学重要。两者都要看。

6. 标准化的实战建议,减少转录组比对中的常见错误

6.1 建议固定一套可复现流程

为了让结果可复现,建议在项目中记录以下信息:

  • 软件版本。
  • 参考基因组版本。
  • 注释文件版本。
  • 质控参数。
  • 比对参数。
  • 计数方式。

这不仅方便复现,也方便论文写作和审稿回应。

6.2 不要忽略批次效应

如果样本来自不同批次、不同平台或不同实验员,即使比对很规范,也可能在下游分析中出现系统偏差。
建议在设计阶段就尽量平衡分组,必要时在统计模型中加入批次因素。

6.3 结果展示要简洁、可解释

常用展示包括:

  • 火山图,展示显著性和倍数变化。
  • 热图,展示高变基因表达模式。
  • PCA图,展示样本分离情况。

这些图不是装饰,而是验证分析逻辑的证据链。
图形越清晰,结论越容易被同行接受。

7. 用专业流程提升分析效率,解螺旋可帮助你少走弯路

如果你在转录组比对、DEG筛选、结果整理上反复踩坑,问题往往不是“不会分析”,而是缺少一套规范、可复用的流程。解螺旋的课程和实操内容,能把比对、计数、差异分析和结果解读串成完整链条,帮助你更快定位问题、提升分析效率,并把时间留给真正重要的生物学解释。

总结Conclusion

转录组比对是从原始测序数据走向差异表达基因的关键一步。它决定了读段能否被正确定位,也决定了后续count矩阵和DEG结果是否可信。先做好质控、参考文件匹配、比对质量评估,再进入差异分析,才是规范的RNA-seq分析路径。 如果你希望系统掌握这套流程,并减少实战中的常见错误,欢迎关注并学习解螺旋的相关课程与实操内容。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料