引言Introduction
差异基因筛选看似简单,真正难点在于阈值、分组和可视化是否一致。火山图能快速定位显著变化基因,热图能验证样本分组与表达模式是否稳定。如果这一步做错,后续通路分析、GSEA 和标志物筛选都会被带偏。 
1. 为什么差异基因筛选不能只看火山图
1.1 火山图解决“哪些基因显著变化”
火山图最直观。横轴是 fold change,纵轴通常是 -log10(P value) 或调整后 P 值。它回答的是“变化幅度大不大,统计学上显不显著”。
常用阈值是 log2FC ≥ 1 或 ≤ -1,再结合 P < 0.05。也有研究使用 1.5 或 2 作为 fold change cutoff。阈值越严格,筛出的基因越少,特异性更高,但可能漏掉部分真实信号。
对于医学生和科研人员来说,关键不是盲目追求“多”,而是让阈值和研究目的匹配。
- 机制探索可适当放宽阈值。
- 生物标志物筛选建议更严格。
- 多队列整合时,阈值应尽量统一,避免批次间不可比。
1.2 热图解决“这些基因是否稳定区分样本”
热图不是火山图的替代品。它更像验证工具。
如果筛出的差异基因能在热图中把病例组和对照组明显分开,说明这批基因具有较好的区分度。
反之,如果火山图上显著,但热图聚类混乱,提示信号可能不稳定,或受批次效应影响。
热图常用于查看 top genes 的表达模式。它可以帮助你判断:
- 差异基因是否集中在同一组样本中。
- 分组是否合理。
- 是否存在离群样本或批次偏移。
2. 从原始数据到显著基因的标准流程
2.1 先完成数据整理和分组
在 GEO 数据分析中,第一步不是画图,而是完成数据上传、平台匹配和分组信息设置。
例如在多 GSE 数据整合时,不同数据集可能来自不同平台,如 U74A version two array、mouse 430A、Mouse Gene 1.0 ST array。平台不同,ID 类型和标准化方式就必须对应调整。
常见流程包括:
- 上传数据集。
- 指定物种。
- 选择平台 ID 或基因 ID。
- 设置缺失值处理和标准化。
- 按 class 完成病例组、对照组分组。
这一步的核心是统一分析框架。只有分组准确,后面的差异分析才有意义。
2.2 再设定统计阈值
差异基因筛选通常基于两个条件:
- 倍数变化,常用 log2FC。
- 显著性检验,常用 P value 或 adjusted P value。
推荐优先使用调整后 P 值,因为它更适合多重检验场景。
尤其是在一次性筛选上万基因时,未经校正的 P value 很容易高估显著性。
一个实用原则是:
- log2FC 设为 ±1,适合初筛。
- 调整后 P < 0.05,适合控制假阳性。
- 如果样本量小,可先做探索性分析,再进行验证。
3. 火山图显著基因筛选的实操要点
3.1 先看整体分布,再定阈值
画火山图前,先确认数据是否经过标准化。
如果数据未标准化,不同样本的表达范围可能偏移,火山图会失真。
标准化后,再观察上下调基因是否呈合理分布。
火山图中一般会出现三类点:
- 红色点,显著上调。
- 蓝色点,显著下调。
- 灰色点,无显著变化。
当红蓝两侧呈对称分布时,通常说明组间差异较为平衡。
如果某一侧异常集中,要检查是否存在样本偏倚、批次效应或分组错误。
3.2 用双阈值筛出可用于下游分析的基因
实操中,常见筛选规则是:
- 设定 log2FC ≥ 1 或 ≤ -1。
- 设定 adjusted P < 0.05。
- 同时满足两项条件的基因,定义为差异基因。
这类基因可直接用于:
- 热图绘制。
- GO 和 KEGG 富集分析。
- PPI 网络构建。
- 机器学习特征筛选。
火山图显著基因筛选的本质,是用统计学证据和效应量共同控制假阳性。
只看倍数,不看 P 值,会引入噪音。只看 P 值,不看倍数,会得到很多生物学意义有限的基因。
4. 热图如何验证火山图筛出的基因
4.1 选取 top 基因绘制表达热图
火山图给你一个“候选列表”,热图负责“验证模式”。
通常会选取前 20、50 或 100 个差异基因绘制热图,具体数量取决于样本数和研究目的。
热图需要关注三个层面:
- 基因层面,是否存在一致的上调或下调趋势。
- 样本层面,病例与对照能否聚类分开。
- 结构层面,是否有离群样本干扰整体模式。
热图的价值不在于漂亮,而在于能否证明筛选出的差异基因具有稳定分群能力。
4.2 观察聚类结果判断结果可靠性
如果热图中病例组和对照组可以明显分离,说明差异信号较强。
如果两组样本交叉严重,就要回头检查:
- 分组标签是否正确。
- 是否存在批次效应。
- 是否筛选阈值过宽。
- 是否样本数过少。
在多数据集合并分析中,批次校正尤其重要。
即使火山图提示大量显著基因,如果热图显示不同批次样本聚成一团,而不是按生物分组聚类,结果仍需谨慎解释。
5. 常见错误和如何避免
5.1 只看单一数据集,不做交叉验证
单个 GSE 数据集得到的差异基因,容易受平台和样本量影响。
如果条件允许,建议结合多个数据集做荟萃分析,减少偶然性。
5.2 阈值设置前后不一致
很多问题不是出在算法,而是出在阈值不统一。
比如火山图用 log2FC = 1.5,但热图筛选却用 log2FC = 1,最后得到的基因集合不一致,图和结论就会脱节。
5.3 忽视调整后 P 值
在高通量数据中,调整后 P 值比原始 P 值更适合做正式报告。
如果只报告原始 P 值,审稿人通常会质疑多重比较控制是否充分。
6. 从筛选到下游分析,如何让结果更完整
6.1 差异基因筛选后要做什么
完成火山图和热图后,通常还会继续做:
- GO 富集分析。
- KEGG 通路分析。
- GSEA。
- PPI 网络。
- 标志物验证。
这说明差异基因筛选不是终点,而是起点。
前期筛得准,后面每一步都会更稳。
6.2 结果汇报建议写法
在论文或汇报中,建议明确写出:
- 数据集来源。
- 平台信息。
- 分组方式。
- 阈值标准。
- 筛得的上调和下调基因数量。
- 热图是否支持分组分离。
这样更符合 E-E-A-T 逻辑,也更方便同行复现。
总结Conclusion
火山图负责“筛”,热图负责“验”。两者联动,才能把差异基因筛选做得更稳、更可复现。对于火山图显著基因筛选,最重要的是统一阈值、控制多重检验、检查聚类是否合理。
如果你需要更高效地完成 GEO 数据分析、差异基因筛选和图表输出,可以借助解螺旋的专业工具与服务,把重复性工作标准化,减少手工失误,让你更专注于结果解读和论文产出。

- 引言Introduction
- 1. 为什么差异基因筛选不能只看火山图
- 2. 从原始数据到显著基因的标准流程
- 3. 火山图显著基因筛选的实操要点
- 4. 热图如何验证火山图筛出的基因
- 5. 常见错误和如何避免
- 6. 从筛选到下游分析,如何让结果更完整
- 总结Conclusion






