引言Introduction

火山图看起来只是差异分析的一个输出图,但阈值一旦设错,后续筛出的基因集合就会整体偏移 。这会直接影响热图、交集分析、富集分析,甚至临床预测模型。对医学生、医生和科研人员来说,理解火山图阈值,不是“会画图”,而是决定研究是否可靠。
一张典型火山图示意图,标出log2FC横轴、-log10(p)纵轴,以及红色上调、蓝色下调、灰色无差异区域。

1. 火山图阈值为什么是差异分析的第一道关口

1.1 火山图本质上是在做“双重筛选”

火山图通常同时使用两个指标。一个是倍数变化 ,常见为 log2 fold change。另一个是统计学显著性 ,常见为 p 值或调整后 p 值。
只有同时满足这两个条件的基因,才会被认为是“既有变化,又有可信度”的差异基因。

这意味着,阈值不是附属参数,而是筛选规则本身。
如果只看 p 值,可能会得到很多变化很小的基因。
如果只看倍数变化,又可能把样本波动大的假阳性带进去。
所以火山图阈值决定了差异基因名单的边界。

1.2 阈值设定会改变后续所有结果

差异基因筛选不是终点,而是起点。
它后面通常接着这些分析:

  • 热图,展示差异基因在样本中的分布。
  • 交集分析,寻找多个数据集共同基因。
  • GO、KEGG、GSEA 富集分析,解释生物学功能。
  • PPI 网络,寻找核心调控节点。
  • 预测模型,构建诊断或预后标志物。

如果第一步筛选过严,后续可用基因数量会显著减少。
如果第一步筛选过松,后续分析会被噪音干扰。
所以火山图阈值不是“一个小设置”,而是整个分析链条的起点。

1.3 差异基因选取不稳,后续分析就会失真

很多研究里,真正影响结果的不是算法本身,而是差异基因列表是否稳定。
同一份数据,换一个阈值,基因数量可能从几十个变成几百个。
这种变化会直接改变富集结果和核心基因结论。

基础不牢,后续分析徒劳。
这句话对生信研究尤其适用。
因为后面的很多图,都是建立在火山图筛出来的基因集之上。

2. 火山图常用阈值怎么设

2.1 常见标准是 log2FC 和 p 值双阈值

最常见的设置是:

  • log2FC = ±1
  • p < 0.05

其中 log2FC=1 代表表达量变化约为 2 倍。
log2FC=-1 代表表达量下降到原来的 1/2。
这是一套在文献中非常常见的经验阈值。

它的优点是直观,适合初步筛选。
它的缺点是偏经验化,未必适合所有数据类型。

如果数据噪音较大,或者样本量较小,单纯使用 p<0.05 可能不够稳健。
在转录组中,很多研究会进一步考虑调整后 p 值 ,以降低多重检验带来的假阳性风险。

2.2 严格阈值会减少基因数量

阈值越严格,入选基因越少。
这是最直接的结果。

例如:

  • 把 log2FC 从 0.5 提高到 1,入选基因会减少。
  • 把 p<0.05 收紧到 p<0.01,入选基因也会减少。
  • 同时提高倍数和显著性要求,数量通常会进一步下降。

这对后续分析的影响非常明显。
基因数量少时,热图可能过于稀疏。
交集分析容易出现“没有共同基因”或“共同基因太少”的情况。
富集分析也可能因为基因集太小而不稳定。

2.3 过松阈值会引入大量边缘基因

如果阈值设置过松,情况又相反。
比如 log2FC 设得很低,p 值要求也不严格,就可能纳入很多变化幅度有限的基因。
这些基因未必有稳定生物学意义。

过松的阈值会扩大假阳性风险。
在下游分析中,这会表现为:

  • 富集到很多泛化通路。
  • 核心基因不稳定。
  • 不同数据集之间难以复现。
  • 预测模型在外部验证中表现下降。

所以阈值不能只追求“筛得多”。
更重要的是筛得对。

3. 阈值设置要结合数据特点和研究目的

3.1 不同研究目的,阈值逻辑不同

如果研究目标是发现候选标志物,通常希望差异基因更稳健。
这时可以适当使用更严格的阈值。
如果研究目标是尽量覆盖潜在通路信号,阈值可以相对放宽。

常见思路是:

  • 探索性分析 ,可适度放宽阈值,保证后续通路分析有足够基因。
  • 验证性分析 ,应更重视稳健性和可重复性。
  • 模型构建阶段 ,通常优先考虑稳定、可解释、可验证的基因。

同一个阈值,不一定适合所有研究场景。

3.2 样本量和平台类型会影响阈值选择

样本量小的时候,统计波动更大。
这时如果阈值过严,可能把真实信号排除掉。
如果样本量大,统计功效更强,可以更严格地筛选。

平台类型也很重要。
芯片数据和 RNA-seq 数据在表达量分布、噪音水平、归一化方式上都不同。
所以阈值不能机械照搬。

最可靠的做法,是把阈值和数据质量一起看。
包括:

  • 样本分组是否清晰。
  • 归一化是否完成。
  • 批次效应是否控制。
  • 差异结果是否在生物学上合理。

3.3 需要兼顾统计学和生物学意义

差异分析不是单纯找“显著”。
真正有价值的基因,通常还要满足生物学可解释性。
所以阈值设置时,建议同时问自己两个问题:

  1. 这个变化是否足够大。
  2. 这个变化是否足够可靠。

如果只追求统计显著,容易得到一长串基因。
如果只追求倍数变化,容易忽略样本间波动。
两者平衡,才是合理阈值。

4. 阈值一变,后续分析会出现什么连锁反应

4.1 热图会先受到影响

热图通常展示筛选后的差异基因在各样本中的表达模式。
如果阈值过严,热图上的基因数量减少,图会更简洁,但信息量也可能不足。
如果阈值过松,热图中基因过多,模式反而不清晰。

因此热图的可读性,本质上取决于火山图筛出的基因集合。
火山图筛选不合理,热图就很难看出真正的分组差异。

4.2 交集分析结果会波动很大

多个数据集做交集时,最怕的就是阈值不一致。
一个数据集用 log2FC=1,另一个用 log2FC=0.2,结果不具可比性。
即使同一阈值,不同数据集由于样本和噪音不同,交集数量也可能差很多。

这会直接影响后续“共同差异基因”的可信度。
交集少,不一定说明没有生物学意义,也可能是阈值过严。
交集多,也不一定好,可能是阈值过松。

4.3 富集分析对基因集大小非常敏感

GO、KEGG、GSEA 等分析,都依赖输入基因集。
基因集太少,统计稳定性会下降。
基因集太杂,结果会变得模糊。

实际中常见的问题是:

  • 差异基因太少,富集不到明确通路。
  • 差异基因太多,通路结果过于泛化。
  • 同一个项目,换阈值后通路方向发生变化。

这说明,富集结果不是“自动正确”的,它取决于前面的筛选质量。

5. 如何更稳妥地设定火山图阈值

5.1 先用默认阈值,再做敏感性观察

一个实用做法是先用常见阈值起步。
例如先看 log2FC=±1,p<0.05 的结果。
然后观察基因数量、火山图分布、热图聚类和通路富集是否合理。

如果结果过少,可以适度放宽。
如果结果过多且杂乱,可以适当收紧。
不要一开始就把阈值调到极端。

5.2 记录阈值选择依据

科研写作中,阈值不能只写“按常规设置”。
最好说明依据,例如:

  • 基于既往文献。
  • 基于数据分布特征。
  • 基于后续分析所需基因规模。
  • 基于多重检验控制策略。

这样做有两个好处。
第一,方法学更透明。
第二,读者更容易判断结果是否可靠。

5.3 保持全流程一致性

同一研究中,最好保持所有数据集的筛选逻辑一致。
否则不同图之间很难横向比较。
尤其是多队列整合研究,如果不同队列阈值不统一,后续的交集和验证会受到影响。

建议在分析前就固定:

  • 表达矩阵处理方式。
  • 统计检验方法。
  • p 值标准。
  • log2FC 标准。
  • 是否使用调整后 p 值。

一旦设定,尽量不要在结果之间来回切换。

6. 对医学生和科研人员来说,火山图阈值不是形式问题

6.1 它决定的是研究起点质量

很多人把火山图当作一张“展示图”。
其实它是整个差异分析的门槛。
门槛设高了,信号会被压缩。
门槛设低了,噪音会涌入。

阈值设置,本质上是在控制信号与噪音的比例。

6.2 结论可信度从这里开始建立

后续无论是机制研究,还是临床模型,最终都要回到一个问题。
你的候选基因,是不是从一开始就选对了。
如果筛选逻辑不稳,后面再复杂的分析,也只是把偏差放大。

这也是为什么在实际项目中,差异分析往往需要反复调参。
不是为了“凑图”,而是为了让结果更符合研究目标和数据现实。

6.3 借助专业工具可以提高效率和规范性

如果你希望更高效地完成差异分析、火山图绘制、热图输出和后续筛选,建议使用流程更规范的平台和服务。
例如解螺旋 可以帮助研究者把阈值设置、差异筛选和下游分析串成完整流程,减少重复试错,让结果更适合发表和答辩。
把阈值设对,后面的每一步才有意义。

总结Conclusion

火山图阈值设定不是一个附属参数,而是差异基因分析的核心起点。
它直接影响基因数量、热图表现、交集结果、富集分析和模型构建。
阈值过严会丢失信号,过松会引入噪音。真正合理的做法,是结合数据特点、研究目的和后续分析需求,建立稳定一致的筛选标准。
如果你正在做转录组、芯片或多队列整合分析,想让差异基因结果更稳、更可解释、更适合投稿,可以借助解螺旋 把阈值选择和下游分析流程化,提高效率,也提升研究质量。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料