引言Introduction

差异表达基因分析看似简单,真正影响结果的往往是阈值选择、基因筛选和可视化顺序。如果差异基因选得不稳,后续热图、富集分析和结论都会被放大误差。
RNA-seq差异表达分析流程示意图,包含火山图、热图和后续分析节点,强调“筛选阈值影响下游结果”

1. 差异表达基因分析为什么不能只看结果

1.1 差异基因筛选决定下游分析质量

差异表达基因分析不是“跑出列表”就结束了。它实际上决定了后续所有分析的起点。无论是热图、韦恩图,还是KEGG、GO富集,输入基因集一旦偏差过大,结论就会偏移。

基础不牢,后续分析往往徒劳。 这不是夸张,而是RNA-seq分析中非常常见的情况。比如把阈值设得过严,可能只留下少数基因,导致信号不足。阈值过松,又会混入大量噪音,降低结果可信度。

1.2 常用筛选阈值与它的实际含义

在常规分析中,常见阈值是:

  • log2 fold change = ±1
  • p < 0.05

这意味着表达变化至少达到2倍,同时具备统计学意义。火山图中,横轴是log2 fold change,纵轴通常是 -log10(p) 或 p 值。横轴越远离0,说明倍数变化越大。纵轴越高,说明统计学意义越强。

阈值越严格,筛选出的差异表达基因越少。这个变化会直接影响后面图的形态,也会影响富集分析的通路覆盖范围。对于医学生和科研人员来说,最重要的不是“更多”,而是“更稳”。

1.3 典型问题是“筛选后就不再检查”

很多分析流程里,研究者一旦得到差异表达基因列表,就直接进入作图和富集。这样做风险很高。因为真正需要检查的包括:

  1. 阈值是否合理。
  2. 样本分组是否清晰。
  3. 是否已经完成基因ID转换。
  4. 是否只保留了需要的mRNA或蛋白编码基因。
  5. 是否存在批次效应或异常样本。

差异表达基因分析的第一原则,是先确认输入是否可靠,再谈下游解释。

2. 火山图:最快识别差异表达基因分布

2.1 火山图的核心信息

火山图是最常见的差异表达基因可视化方式之一。它本质上是一个二维散点图。每个点代表一个基因,横轴表示表达倍数变化,纵轴表示显著性。

通常颜色会这样区分:

  • 红色:上调且有统计学意义
  • 蓝色:下调且有统计学意义
  • 灰色:无显著变化

火山图最大的价值,不是展示“有哪些基因”,而是快速告诉你“这些差异基因分布得是否合理”。 如果两侧基因过少,说明阈值可能偏严。如果中间灰点过多,也可能提示整体差异较弱或样本分组效果有限。

2.2 火山图最容易出错的三个地方

第一,p值和padj混用。很多文章绘图时使用的是p值,但实际分析更常关注多重检验校正后的padj。两者不能随意替换。

第二,log2FC方向理解错误。正值通常表示上调,负值表示下调,但前提是分组顺序清晰。分组定义不同,火山图左右方向也会随之变化。

第三,标签过多。火山图一般只标注少量重点基因,比如最显著的上调和下调基因。标太多会让图变乱,也降低可读性。

2.3 一个更稳妥的绘图思路

常见流程可以概括为三步:

  1. 读取差异分析结果。
  2. 计算显著性标记,按阈值区分上调、下调和不显著。
  3. 绘制散点并标注重点基因。

在实际R绘图中,通常会先对padj做负对数转换,再用ggplot2或ggpubr进行分层显示。图上分界线的设置应与筛选阈值一致,避免“图上看着显著,列表里却不一致”的问题。

2.4 火山图在论文中的作用

火山图适合放在结果部分前半段。它能回答三个问题:

  • 差异表达基因是否足够集中在两侧。
  • 上调和下调基因是否平衡。
  • 重点候选基因是否落在高显著区域。

对于临床转化或机制研究,火山图还可以作为候选基因筛选的起点。它为后续验证实验提供优先级参考,比如qPCR、WB或免疫组化。

3. 热图:把差异表达基因放回样本背景中看

3.1 热图比火山图更接近“真实分组效果”

如果说火山图看的是“基因差异”,那热图看的是“样本与基因的整体模式”。热图通常会选取显著差异表达基因,展示这些基因在不同样本中的表达分布。

热图的优势在于,它能直观看出样本是否被差异基因清晰区分。 如果分组正确,控制组和模型组往往会形成相对稳定的聚类。若聚类混乱,就要回头检查样本质量、标准化方式或阈值设置。

3.2 热图绘制前必须做的准备

热图不是直接拿差异基因列表就能画。正式绘制前,至少要完成以下步骤:

  • 筛选显著差异表达基因。
  • 去除未显著变化的基因。
  • 取出这些基因在样本中的表达矩阵。
  • 准备分组注释信息。
  • 必要时完成基因ID转换。

尤其是Ensembl ID转symbol这一步,不能省。 否则图上只有一串编号,既不利于读图,也不利于论文展示。对于只分析mRNA的场景,还应先从注释文件中提取对应信息,再与差异基因取交集。

3.3 热图中最值得关注的不是颜色,而是聚类

很多人看热图只看红蓝颜色,但真正重要的是聚类结果。聚类能反映两个层面:

  1. 样本之间是否按分组聚在一起。
  2. 基因表达模式是否具有一致性。

如果模型组和对照组能够明显分开,说明差异表达基因具备较好的判别能力。若样本混杂严重,则提示分析流程可能存在问题。热图不是装饰图,它是对分组和差异信号的二次验证。

3.4 论文展示时如何提高热图可读性

热图展示不宜过于拥挤。常见做法有两种:

  • 展示全部显著差异基因。
  • 只展示最具代表性的前50个上调和前50个下调基因。

第二种更适合正文图,第一种更适合补充材料。对于临床样本量较小、差异信号较弱的研究,选取代表性基因往往更容易突出模式。

同时,建议保留样本注释栏,比如control与model。这样读者可以直接对应分组信息,不需要来回查表。

4. 从火山图到热图,如何形成完整分析闭环

4.1 差异表达基因分析的正确顺序

一个更规范的流程应当是:

  1. 完成差异表达分析。
  2. 用火山图检查总体分布。
  3. 筛选显著差异表达基因。
  4. 用热图验证样本分离情况。
  5. 再进入富集分析和候选基因筛选。

这个顺序不能反。 如果先做富集或筛图,再回头调整阈值,就会引入选择偏差。对科研论文来说,这种偏差会直接影响结论可信度。

4.2 差异表达基因分析中的两个常见误区

第一个误区是只看显著性,不看效应量。p值很小,不代表变化幅度一定足够大。第二个误区是只看倍数变化,不看统计学意义。倍数大但样本波动大,同样不可靠。

因此,差异表达基因的筛选应该同时考虑倍数变化和统计学显著性。 这也是火山图和热图要结合使用的原因。一个看宏观分布,一个看样本层面一致性。

4.3 什么时候应该重新调整阈值

以下情况值得回调阈值或重新检查数据:

  • 火山图几乎没有显著点。
  • 上下调基因极不平衡。
  • 热图分组无法区分。
  • 富集结果过于零散,缺乏一致生物学主题。
  • 关键候选基因在多个图中都不稳定。

这时不要急着继续下游分析。应先检查标准化、批次效应、分组标签和阈值设置。对于差异表达基因分析来说,修正输入,比修补输出更重要。

4.4 用更高效的流程减少返工

在实际项目中,建议把火山图、热图和差异基因筛选放在同一分析框架内统一处理。这样可以保证图和表一致,减少重复修改。对于需要课程复现、论文绘图或批量项目管理的研究者,规范化流程尤其重要。

如果你希望把差异表达基因分析做得更稳定、更适合发表,可以借助解螺旋的规范化分析与作图服务,直接统一阈值、图表和结果输出。这样不仅能减少重复返工,也能让火山图和热图在逻辑上保持一致。

总结Conclusion

差异表达基因分析不是单纯筛列表,而是一个从阈值、统计检验到图形验证的完整过程。火山图负责快速识别整体分布,热图负责验证样本分组和表达模式。 两者结合,才能让结果更可信。

对医学生、医生和科研人员来说,最重要的是保持流程一致。先稳住差异表达基因筛选,再做图,再进入下游分析。这样得到的结论才更适合论文发表和机制解释。若你希望进一步提升分析效率和可发表性,可以考虑使用解螺旋的专业支持,让差异表达基因分析更规范、更省时,也更容易产出高质量结果。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料