引言Introduction
转录组比对是差异表达分析的起点。若原始数据质控、比对、计数任何一步出错,后面的DEG结果都会偏。很多初学者拿到fastq后就急着做差异分析,却忽略了比对率、唯一比对率和低表达过滤,这会直接影响结论可信度。先把比对做对,后面的差异分析才有意义。

1. 转录组比对前,先确认数据是否可分析
1.1 原始数据的三个关键检查点
转录组比对不是直接把文件丢进软件就结束。先看数据是否满足分析条件。对医学生、医生和科研人员来说,最常见的问题不是“不会跑命令”,而是“输入数据本身有问题”。
建议先检查以下三项:
- 测序类型是否明确,单端还是双端。
- 是否保留原始fastq,文件是否完整。
- 样本分组是否清楚,是否有生物学重复。
没有重复样本时,差异表达结果的统计稳定性会明显下降。 一般建议每组至少3个生物学重复,才能较稳妥地估计组内波动。
1.2 质控结果决定后续是否要修剪
在进入比对前,先做基础质控。重点看:
- Q30比例。
- 接头污染。
- 序列长度分布。
- 低质量碱基集中位置。
如果接头污染明显,或3’端质量下降严重,就应先做trim。
如果不处理这些问题,后续比对率可能下降,且多重比对增加,影响定量准确性。
2. 转录组比对的核心逻辑是什么
2.1 比对不是“找相同”,而是“定位来源”
转录组比对的本质,是把测序读段定位到参考基因组或转录本上。RNA-seq读段往往跨越外显子连接位点,因此不能简单使用普通DNA比对思路。
常见比对策略有两类:
-
比对到基因组。
适合后续做表达定量、剪接分析、融合基因分析。 -
比对到转录本。
更偏向快速定量,但对新剪接事件的发现能力有限。
如果目标是标准差异表达分析,通常更推荐“基因组比对 + 基因计数”的流程。
2.2 为什么转录组比对比DNA比对更复杂
RNA-seq数据存在几个典型特点:
- 存在剪接。
- 存在外显子连接。
- 表达量高度不均。
- 低丰度转录本容易丢失。
这意味着比对软件必须支持spliced alignment。常见工具包括STAR、HISAT2等。它们能识别跨外显子的读段,避免把真实转录本错判为无法比对。
3. 从比对到计数,标准流程怎么走
3.1 推荐的基础流程
一个规范的转录组比对流程通常如下:
- 原始数据质控。
- 去接头和低质量序列。
- 选择参考基因组和注释文件。
- 进行转录组比对。
- 统计比对质量。
- 生成基因层面的count矩阵。
- 进入差异表达分析。
比对本身不是终点,count矩阵才是差异分析的直接输入。
3.2 参考基因组和注释文件要配套
这是很多人最容易忽略的一步。参考基因组版本和GTF注释文件必须匹配。比如基因组是GRCh38,但注释却来自旧版本,后续可能出现:
- 基因名对应错误。
- 读段统计丢失。
- 某些基因无法计数。
对于转录组比对,建议固定版本,并在项目全程保持一致。
同一项目中不要混用不同来源的参考文件。
3.3 比对完成后重点看哪些指标
比对结果出来后,不要只看“成功”两个字。至少要核查以下内容:
- 总比对率。
- 唯一比对率。
- 多重比对率。
- 错配比例。
- 插入片段分布。
- 比对到外显子、内含子和间隔区的比例。
如果唯一比对率过低,说明数据可能存在重复序列多、污染、物种不匹配或建库质量问题。
如果大量读段落在内含子或间隔区,要考虑样本来源、文库类型或注释文件是否有问题。
4. 差异表达基因分析,真正关键的不只是fold change
4.1 从count矩阵到DEG
完成转录组比对后,下一步是基因计数。计数矩阵中,每一行是一个基因,每一列是一个样本。这一步决定了后续差异分析的输入质量。
进入差异分析时,通常会使用DESeq2、edgeR或limma-voom。以DESeq2为例,模型会先估计标准化因子,再计算离散度,最后进行显著性检验。
它关注的不只是表达量差异,还包括样本间波动。
4.2 结果表里的几个核心字段
差异分析结果表通常包含:
- baseMean,表示所有样本中标准化后的平均表达量。
- log2FoldChange,表示表达倍数变化取对数后的结果。
- pvalue,原始显著性水平。
- padj,多重检验校正后的p值。
其中,padj比原始p值更适合用于正式筛选。
因为RNA-seq常同时检测上万基因,若不做多重校正,假阳性会明显增加。
4.3 常用筛选阈值怎么设
没有统一标准,但在实际研究中常见做法是:
- padj < 0.05。
- |log2FoldChange| > 1。
如果研究更强调稳定性,阈值可以更严格。
如果样本量小,建议谨慎扩大倍数阈值,避免漏掉潜在重要基因。
不要只盯着fold change。低表达基因即使倍数变化大,也可能缺乏生物学稳定性。
5. 转录组比对后,如何判断结果是否可信
5.1 先看样本层面的整体一致性
差异表达结果是否可靠,先看样本是否分群合理。常用方法包括:
- PCA。
- 样本相关性热图。
- 聚类树。
如果同组样本不能聚在一起,或者批次效应明显,说明比对后的计数矩阵可能仍存在问题,或者实验设计本身存在干扰。
5.2 再看低表达和零计数基因
在DESeq2分析中,若某些基因在所有样本中count为0,后续结果会为空。
这不是报错,而是说明该基因根本没有检测到表达。
另一个常见情况是低表达基因没有给出矫正后的p值。
这通常是DESeq2在提示你,这类基因的统计证据不足,需要谨慎解释。
5.3 生物学解释要回到实验背景
差异表达分析不是排行榜。
真正有意义的结果,应该结合疾病状态、药物处理、时间梯度或组织来源来解释。
比如:
- 炎症模型中,免疫相关基因上调是否符合机制。
- 肿瘤样本中,增殖和细胞周期通路是否富集。
- 药物处理后,代谢和应激反应是否发生改变。
统计显著不等于生物学重要。两者都要看。
6. 标准化的实战建议,减少转录组比对中的常见错误
6.1 建议固定一套可复现流程
为了让结果可复现,建议在项目中记录以下信息:
- 软件版本。
- 参考基因组版本。
- 注释文件版本。
- 质控参数。
- 比对参数。
- 计数方式。
这不仅方便复现,也方便论文写作和审稿回应。
6.2 不要忽略批次效应
如果样本来自不同批次、不同平台或不同实验员,即使比对很规范,也可能在下游分析中出现系统偏差。
建议在设计阶段就尽量平衡分组,必要时在统计模型中加入批次因素。
6.3 结果展示要简洁、可解释
常用展示包括:
- 火山图,展示显著性和倍数变化。
- 热图,展示高变基因表达模式。
- PCA图,展示样本分离情况。
这些图不是装饰,而是验证分析逻辑的证据链。
图形越清晰,结论越容易被同行接受。
7. 用专业流程提升分析效率,解螺旋可帮助你少走弯路
如果你在转录组比对、DEG筛选、结果整理上反复踩坑,问题往往不是“不会分析”,而是缺少一套规范、可复用的流程。解螺旋的课程和实操内容,能把比对、计数、差异分析和结果解读串成完整链条,帮助你更快定位问题、提升分析效率,并把时间留给真正重要的生物学解释。
总结Conclusion
转录组比对是从原始测序数据走向差异表达基因的关键一步。它决定了读段能否被正确定位,也决定了后续count矩阵和DEG结果是否可信。先做好质控、参考文件匹配、比对质量评估,再进入差异分析,才是规范的RNA-seq分析路径。 如果你希望系统掌握这套流程,并减少实战中的常见错误,欢迎关注并学习解螺旋的相关课程与实操内容。

- 引言Introduction
- 1. 转录组比对前,先确认数据是否可分析
- 2. 转录组比对的核心逻辑是什么
- 3. 从比对到计数,标准流程怎么走
- 4. 差异表达基因分析,真正关键的不只是fold change
- 5. 转录组比对后,如何判断结果是否可信
- 6. 标准化的实战建议,减少转录组比对中的常见错误
- 7. 用专业流程提升分析效率,解螺旋可帮助你少走弯路
- 总结Conclusion






