引言Introduction

差异基因筛选看似简单,真正难点在于阈值、分组和可视化是否一致。火山图能快速定位显著变化基因,热图能验证样本分组与表达模式是否稳定。如果这一步做错,后续通路分析、GSEA 和标志物筛选都会被带偏。 火山图与热图并列展示,左侧标出上调、下调和无显著变化区域,右侧为样本分组聚类热图,强调二者联动筛选差异基因的流程图。

1. 为什么差异基因筛选不能只看火山图

1.1 火山图解决“哪些基因显著变化”

火山图最直观。横轴是 fold change,纵轴通常是 -log10(P value) 或调整后 P 值。它回答的是“变化幅度大不大,统计学上显不显著”。
常用阈值是 log2FC ≥ 1 或 ≤ -1,再结合 P < 0.05。也有研究使用 1.5 或 2 作为 fold change cutoff。阈值越严格,筛出的基因越少,特异性更高,但可能漏掉部分真实信号。

对于医学生和科研人员来说,关键不是盲目追求“多”,而是让阈值和研究目的匹配。

  • 机制探索可适当放宽阈值。
  • 生物标志物筛选建议更严格。
  • 多队列整合时,阈值应尽量统一,避免批次间不可比。

1.2 热图解决“这些基因是否稳定区分样本”

热图不是火山图的替代品。它更像验证工具。
如果筛出的差异基因能在热图中把病例组和对照组明显分开,说明这批基因具有较好的区分度。
反之,如果火山图上显著,但热图聚类混乱,提示信号可能不稳定,或受批次效应影响。

热图常用于查看 top genes 的表达模式。它可以帮助你判断:

  1. 差异基因是否集中在同一组样本中。
  2. 分组是否合理。
  3. 是否存在离群样本或批次偏移。

2. 从原始数据到显著基因的标准流程

2.1 先完成数据整理和分组

在 GEO 数据分析中,第一步不是画图,而是完成数据上传、平台匹配和分组信息设置。
例如在多 GSE 数据整合时,不同数据集可能来自不同平台,如 U74A version two array、mouse 430A、Mouse Gene 1.0 ST array。平台不同,ID 类型和标准化方式就必须对应调整。

常见流程包括:

  • 上传数据集。
  • 指定物种。
  • 选择平台 ID 或基因 ID。
  • 设置缺失值处理和标准化。
  • 按 class 完成病例组、对照组分组。

这一步的核心是统一分析框架。只有分组准确,后面的差异分析才有意义。

2.2 再设定统计阈值

差异基因筛选通常基于两个条件:

  • 倍数变化,常用 log2FC。
  • 显著性检验,常用 P value 或 adjusted P value。

推荐优先使用调整后 P 值,因为它更适合多重检验场景。
尤其是在一次性筛选上万基因时,未经校正的 P value 很容易高估显著性。

一个实用原则是:

  • log2FC 设为 ±1,适合初筛。
  • 调整后 P < 0.05,适合控制假阳性。
  • 如果样本量小,可先做探索性分析,再进行验证。

3. 火山图显著基因筛选的实操要点

3.1 先看整体分布,再定阈值

画火山图前,先确认数据是否经过标准化。
如果数据未标准化,不同样本的表达范围可能偏移,火山图会失真。
标准化后,再观察上下调基因是否呈合理分布。

火山图中一般会出现三类点:

  • 红色点,显著上调。
  • 蓝色点,显著下调。
  • 灰色点,无显著变化。

当红蓝两侧呈对称分布时,通常说明组间差异较为平衡。
如果某一侧异常集中,要检查是否存在样本偏倚、批次效应或分组错误。

3.2 用双阈值筛出可用于下游分析的基因

实操中,常见筛选规则是:

  1. 设定 log2FC ≥ 1 或 ≤ -1。
  2. 设定 adjusted P < 0.05。
  3. 同时满足两项条件的基因,定义为差异基因。

这类基因可直接用于:

  • 热图绘制。
  • GO 和 KEGG 富集分析。
  • PPI 网络构建。
  • 机器学习特征筛选。

火山图显著基因筛选的本质,是用统计学证据和效应量共同控制假阳性。
只看倍数,不看 P 值,会引入噪音。只看 P 值,不看倍数,会得到很多生物学意义有限的基因。

4. 热图如何验证火山图筛出的基因

4.1 选取 top 基因绘制表达热图

火山图给你一个“候选列表”,热图负责“验证模式”。
通常会选取前 20、50 或 100 个差异基因绘制热图,具体数量取决于样本数和研究目的。

热图需要关注三个层面:

  • 基因层面,是否存在一致的上调或下调趋势。
  • 样本层面,病例与对照能否聚类分开。
  • 结构层面,是否有离群样本干扰整体模式。

热图的价值不在于漂亮,而在于能否证明筛选出的差异基因具有稳定分群能力。

4.2 观察聚类结果判断结果可靠性

如果热图中病例组和对照组可以明显分离,说明差异信号较强。
如果两组样本交叉严重,就要回头检查:

  • 分组标签是否正确。
  • 是否存在批次效应。
  • 是否筛选阈值过宽。
  • 是否样本数过少。

在多数据集合并分析中,批次校正尤其重要。
即使火山图提示大量显著基因,如果热图显示不同批次样本聚成一团,而不是按生物分组聚类,结果仍需谨慎解释。

5. 常见错误和如何避免

5.1 只看单一数据集,不做交叉验证

单个 GSE 数据集得到的差异基因,容易受平台和样本量影响。
如果条件允许,建议结合多个数据集做荟萃分析,减少偶然性。

5.2 阈值设置前后不一致

很多问题不是出在算法,而是出在阈值不统一。
比如火山图用 log2FC = 1.5,但热图筛选却用 log2FC = 1,最后得到的基因集合不一致,图和结论就会脱节。

5.3 忽视调整后 P 值

在高通量数据中,调整后 P 值比原始 P 值更适合做正式报告。
如果只报告原始 P 值,审稿人通常会质疑多重比较控制是否充分。

6. 从筛选到下游分析,如何让结果更完整

6.1 差异基因筛选后要做什么

完成火山图和热图后,通常还会继续做:

  • GO 富集分析。
  • KEGG 通路分析。
  • GSEA。
  • PPI 网络。
  • 标志物验证。

这说明差异基因筛选不是终点,而是起点。
前期筛得准,后面每一步都会更稳。

6.2 结果汇报建议写法

在论文或汇报中,建议明确写出:

  • 数据集来源。
  • 平台信息。
  • 分组方式。
  • 阈值标准。
  • 筛得的上调和下调基因数量。
  • 热图是否支持分组分离。

这样更符合 E-E-A-T 逻辑,也更方便同行复现。

总结Conclusion

火山图负责“筛”,热图负责“验”。两者联动,才能把差异基因筛选做得更稳、更可复现。对于火山图显著基因筛选,最重要的是统一阈值、控制多重检验、检查聚类是否合理。
如果你需要更高效地完成 GEO 数据分析、差异基因筛选和图表输出,可以借助解螺旋的专业工具与服务,把重复性工作标准化,减少手工失误,让你更专注于结果解读和论文产出。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料