引言Introduction
在医学转录组分析中,火山图看似只是“出图”步骤,实则直接决定差异基因名单。参数设得太松,假阳性多。设得太严,真正有信号的基因又会被漏掉。参数选择不当,会让后续热图、富集分析、标志物筛选全部偏离方向。 
1. 火山图为什么是差异分析的第一道门槛
1.1 火山图本质上是在筛选“有变化且有统计学意义”的基因
火山图是二维散点图。横轴通常是 log2 fold change ,代表表达倍数变化。纵轴通常是 -log10(p value) ,代表统计学显著性。横轴看变化幅度,纵轴看可信度。 两者结合,才能把真正值得继续研究的基因挑出来。
在医学转录组中,火山图常用于区分上调、下调和无显著变化基因。一般来说,红色区域代表上调且显著,蓝色区域代表下调且显著,灰色区域代表未达到阈值的基因。这个图并不只是“好看”,而是在帮你定义后续分析的输入集合。
1.2 差异基因名单一变,下游结果就会跟着变
很多人把火山图参数当成展示问题,其实它是分析问题。差异基因筛选是后续所有下游分析的基础。 如果基础不稳,热图、GO、KEGG、PPI、GSEA,甚至候选基因验证,都会受影响。
常见下游分析依赖的就是这批差异基因。比如:
- 热图,用来展示样本间模式。
- 富集分析,用来解释生物学过程。
- PPI网络,用来筛选核心节点。
- 预后分析,用来找临床相关标志物。
因此,火山图参数不是“随便定”。它决定你最终看到的是噪音,还是信号。
2. 参数如何设,才不会把分析带偏
2.1 最常用的阈值是 log2FC = ±1 和 p < 0.05
在转录组文章里,最常见的筛选条件是 log2FC ≥ 1 或 ≤ -1 ,同时 p < 0.05 。log2FC=1 表示表达量约变化 2 倍。这个阈值兼顾了变化幅度和统计学意义,因此被广泛使用。
但这只是常规起点,不是固定标准。不同研究目的,阈值可以不同。比如:
- 想尽量全面捕捉候选基因,可适当放宽。
- 想优先筛高可信标志物,可适当收紧。
- 样本量较小,通常更要注意假阳性控制。
- 样本量较大,统计显著但生物学意义不一定强。
真正合理的阈值,必须结合样本量、研究目的和后续验证能力一起判断。
2.2 p值、校正p值和fold change要一起看
火山图里最容易出现的问题,是只看 p 值,不看倍数变化。也有人反过来,只看倍数,不看显著性。这两种做法都不完整。
更稳妥的做法是同时考虑:
- 统计学显著性,优先使用校正后的 p 值。
- 表达变化幅度,避免只留下微小波动。
- 研究场景,决定阈值宽严。
如果是多重比较后的转录组分析,校正后的 p 值通常更稳妥。因为基因数量多,单看原始 p 值容易放大偶然性。对医学研究来说,可信度比“基因数多”更重要。
2.3 阈值越严格,不一定越好
很多初学者会认为,阈值越严格,结果越可靠。事实没这么简单。阈值变严格后,入选基因会减少,图上红点和蓝点也会变少。这样虽然更“干净”,但也可能漏掉真实存在、但效应较弱的关键基因。
相反,如果阈值过松,虽然能得到更多基因,但噪音会明显增加。后续富集分析可能出现路径泛化,热图也会变得杂乱。阈值的本质,是在敏感性和特异性之间做平衡。
3. 参数变化会如何影响火山图和下游结果
3.1 阈值放宽时,候选基因会明显增加
当你把 log2FC 从 1 调到 0.5,或者把 p 值阈值从 0.05 放宽到 0.1,火山图中被标记为显著的点会明显增多。表面上看,这是“信息更多”,但实际意味着混入更多边界基因。
这会带来几个后果:
- 差异基因数量增加。
- 富集分析结果更分散。
- 热图模式更复杂。
- 后续验证压力增大。
如果研究目标是发表机制文章,过宽的阈值常常会削弱结果的可信度。
3.2 阈值收紧时,结果更稳,但可能丢失生物学线索
如果把阈值设得很严,比如 log2FC ≥ 2 且 p < 0.01,入选基因会明显减少。这样做的好处是结果更纯净,适合寻找高置信度基因。但缺点也很明确。一些具有真实生物学意义、但变化幅度不大的基因,会被直接排除。
这在医学转录组中尤其常见。因为很多关键调控分子,本身表达变化并不大,但在通路层面作用明显。只盯着大倍数变化,可能会错过真正重要的调控节点。
3.3 仅靠火山图还不够,热图和分组图要一起看
火山图只是第一步。差异基因筛完后,通常还要配合热图和分组图查看表达模式。热图能看样本聚类是否清晰,分组图能看单个基因在不同样本中的分布是否合理。
建议的基本检查顺序是:
- 先看火山图,确认差异方向和数量。
- 再看热图,确认样本分组是否稳定。
- 最后看箱线图或小提琴图,确认关键基因的分布差异。
如果火山图筛出来的基因在热图里完全没有分层感,说明参数或数据质量可能存在问题。
4. 医学转录组中更稳妥的参数选择思路
4.1 不要照搬文献,要根据数据特征调整
很多文章会直接写“以 p < 0.05 和 |log2FC| > 1 为阈值”。这个写法没错,但不能机械照搬。因为不同队列的数据结构不同,疾病类型不同,样本量也不同。参数选择必须服务于你的研究设计。
建议先问三个问题:
- 你的样本量是否足够?
- 你的研究目标是探索,还是验证?
- 你后面是否有实验验证条件?
如果是探索性研究,可以适度放宽阈值,但要保留后续验证。
如果是机制研究或标志物筛选,建议更强调特异性。
如果是临床转化方向,最好优先保证可重复性。
4.2 差异基因筛选要和下游分析目标一致
火山图筛基因,最终不是为了“挑出最多的基因”,而是为了服务下游分析。不同目标,筛选逻辑不同。
例如:
- 做通路富集时,需要一定数量的稳定差异基因。
- 做关键基因验证时,更适合选择高倍数、高显著性的基因。
- 做预后模型时,还要考虑与临床结局的关联。
- 做多组学整合时,筛选标准还要与其他层数据兼容。
如果筛选目标不清晰,火山图参数再漂亮也没有意义。
4.3 先固定分析流程,再调整阈值
实际工作中,最推荐的是先统一前处理流程,再微调阈值。也就是说,先保证标准化、批次处理、样本质控、ID转换等基础环节正确,再做差异分析。否则,参数调得再精细,也是在放大前面流程中的误差。
一个更稳的思路是:
- 先用常规阈值出第一版结果。
- 检查差异基因数量是否合理。
- 再结合热图和生物学问题微调参数。
- 最后再进入富集和验证。
参数不是一次定死,而是随着分析目标逐步校准。
5. 解螺旋如何帮助你把火山图分析做稳
5.1 让参数选择更可控,减少重复返工
在医学转录组分析里,很多时间其实浪费在重复调整参数、反复重画图、重新导出结果上。尤其是当差异基因筛选条件改动后,火山图、热图、下游富集都要重新跑一遍。流程一乱,效率就会大幅下降。
使用 解螺旋 ,可以更高效地整理分析流程,减少参数反复试错带来的时间损耗。把差异基因筛选、可视化和后续分析串起来,才能真正提高工作效率。
5.2 更适合医学生、医生和科研人员的标准化需求
对于需要快速产出结果的人来说,最重要的不是“会不会画图”,而是“能不能稳定、规范地做完一整套分析”。解螺旋的价值就在于帮助你把火山图、热图、分组分析等步骤更标准化地完成,减少因为格式、阈值和流程不统一导致的返工。
如果你正在做医学转录组项目,用解螺旋把差异分析流程规范化,能更快定位真正有价值的候选基因。 这对后续发表、答辩和课题推进都更有帮助。
总结Conclusion
火山图不是简单的可视化图。它是医学转录组差异分析的入口。参数设定会直接影响差异基因数量、下游富集结果、热图模式和候选基因筛选。 常用阈值如 log2FC = ±1、p < 0.05 可以作为起点,但不应机械照搬。更重要的是结合样本量、研究目标和验证条件,做出平衡判断。
如果你希望减少重复试错,提升分析效率,并让火山图筛选结果更适合后续研究,建议使用 解螺旋 来规范你的转录组分析流程。这样更稳,也更接近可发表的标准。

- 引言Introduction
- 1. 火山图为什么是差异分析的第一道门槛
- 2. 参数如何设,才不会把分析带偏
- 3. 参数变化会如何影响火山图和下游结果
- 4. 医学转录组中更稳妥的参数选择思路
- 5. 解螺旋如何帮助你把火山图分析做稳
- 总结Conclusion






