引言Introduction

单细胞差异基因筛选看似简单,真正难的是阈值。设得太松,噪音会混进来。设得太严,真实信号被过滤掉。一旦差异基因选错,后续火山图、热图、聚类解释都会失真。 单细胞分析流程图,突出差异基因筛选、火山图、热图和下游分析之间的关系,背景为科研电脑屏幕和基因表达矩阵。

1. 为什么差异基因筛选是单细胞分析的起点

1.1 阈值不是形式,而是分析边界

在单细胞转录组分析中,差异基因是很多下游结果的入口。无论是细胞类型标记物筛选,还是通路富集,都会先经过这一步。差异基因选取不稳,后面的分析往往只是对噪音做解释。

常见的筛选指标有两个。一个是 fold change,通常用 log2FC 表示。另一个是显著性水平,常见为 p 值或校正后的 p 值。很多流程会使用 log2FC = ±1 和 p < 0.05 作为基础阈值。这里的 log2FC = 1 表示表达量变化达到 2 倍。

但这只是起点,不是标准答案。不同样本深度、批次效应、细胞数量、测序平台,都会改变阈值的实际效果。阈值不是越严格越好,而是要和研究目的匹配。

1.2 单细胞数据比 bulk 更依赖阈值平衡

单细胞数据存在掉零现象,表达稀疏,技术噪音更明显。很多基因在部分细胞里为 0,不代表真的不表达。也有些基因只在小群体中出现,生物学意义很强,却容易被简单阈值漏掉。

因此,单细胞差异基因筛选不能只看“显著”两个字。还要看:

  • 细胞群之间是否有足够样本量。
  • 基因表达是否具有一致方向。
  • 结果是否能被图形和生物学背景支持。

如果阈值只追求少而精,可能会错过关键标记基因。 如果阈值太宽,后续富集分析会被大量弱信号干扰。

2. 火山图、热图和象限图分别回答什么问题

2.1 火山图适合快速判断显著性和倍数变化

做完单细胞差异基因后,最常见的第一张图就是火山图。它是二维图。横轴是 log2 fold change,纵轴通常是 -log10(p) 或 p 值。图中常见配色是:

  • 红色,表示上调且有统计学意义。
  • 蓝色,表示下调且有统计学意义。
  • 灰色,表示无显著变化。

火山图的价值不在于“好看”,而在于快速判断阈值是否合理。 如果红蓝点过少,说明阈值可能过严。若大量点都进入显著区,说明筛选条件可能过松。

实际操作中,建议先观察整体分布,再决定是否保留默认阈值。对于样本量较小或异质性较高的数据,单纯使用固定 p < 0.05 可能不够稳妥,最好结合多重检验校正结果一起看。

2.2 热图适合验证表达模式是否稳定

热图的核心作用,是检查差异基因在各细胞群中的表达是否具有一致模式。它能回答一个问题,这些基因真的是“分群标记”,还是只是统计上显著。

如果热图中某些基因在目标群体中稳定高表达,在其他群体中明显降低,这类基因更适合进入后续解释。反过来,如果表达模式杂乱,组内波动大,即使 p 值显著,也要谨慎使用。

热图还适合检查筛选基因是否过多。若一屏都是弱差异基因,图会失去可解释性。常见做法是从差异基因中再挑选前 20 到 50 个进行展示,保证图形信息密度适中。

2.3 象限图能补充“方向性”和“稳定性”

象限图常见于箱线图或小提琴图。它比火山图更接近原始表达分布,适合看单个基因在不同组中的表达差异。它能帮助判断一个差异基因到底是“少数高表达驱动”,还是“整体群体偏移”。

在单细胞场景中,这一步尤其重要。因为很多基因的差异并不是连续平移,而是表达细胞比例变化。象限图能更直观看出:

  • 哪些细胞群表达集中。
  • 是否存在少量极高表达细胞。
  • 组间差异是否稳定。

对于医学生和科研人员来说,这一步能减少“统计显著,但生物学不成立”的情况。

3. 阈值怎么设,才不会让后续分析翻车

3.1 先明确研究目标,再定阈值

阈值设定没有统一模板。先问自己,研究目标是什么。

如果目标是找高可信标记基因,可优先使用更严格条件,例如:

  • log2FC ≥ 1
  • p < 0.05
  • 尽量结合校正后的 p 值

如果目标是尽量保留候选基因,用于后续验证或探索性分析,可以适当放宽 fold change,但要保留严格的统计控制。探索性分析可以宽,结论性分析必须严。

这也是很多项目容易翻车的地方。前期为了“多找点基因”放宽筛选,后面却拿这些基因直接做通路解释和文章结论。结果往往不稳定。

3.2 阈值改变会直接影响下游所有分析

阈值调严,选中的基因数会减少。阈值调松,基因数会增加,但背景噪音也会上升。这个变化会连锁影响:

  • 火山图的点分布。
  • 热图的聚类结果。
  • 富集分析的通路排名。
  • 标记基因的可信度。

基础不牢,后续分析徒劳。 这句话在单细胞数据里尤其成立。因为很多后续结论都是建立在差异基因集合之上的。集合一旦偏了,解释再完整也站不稳。

一个实用做法是,在正式分析前做小规模敏感性测试。比如分别比较:

  1. log2FC = 0.5 和 1.0 的结果。
  2. p < 0.05 和更严格校正阈值的结果。
  3. 不同细胞亚群的差异基因稳定性。

如果候选基因在不同阈值下仍然反复出现,可信度通常更高。

3.3 不要只看数量,要看可重复性

差异基因筛选的目标不是“多”。而是“稳”。真正有价值的单细胞差异基因,应该在表达方向、细胞群分布和统计显著性上同时成立。

建议重点检查三件事:

  • 同一基因在多个重复样本中是否一致。
  • 组间差异是否被少数离群细胞驱动。
  • 结果能否在热图或小提琴图中复现。

如果一个基因只在单一比较中显著,换一个参数就消失,通常需要谨慎。相反,若它在多个阈值下都稳定存在,后续优先级应更高。

4. 实战中如何让筛选结果更可靠

4.1 先做质控,再做差异分析

差异基因筛选前,质控必须到位。低质量细胞、线粒体比例过高的细胞、文库大小异常的细胞,都可能放大假阳性。单细胞流程里常见的做法,是先统计每个细胞的文库大小、基因数、线粒体比例,再根据阈值过滤。

如果前面的质控做得不稳,后面的差异分析会被拖累。差异基因不是修复质控问题的工具。 它只能反映处理后的数据状态。

4.2 结合多种图一起判断

不要只依赖一张火山图。更稳妥的策略是联用三种图:

  • 火山图,看整体分布。
  • 热图,看表达模式。
  • 象限图或小提琴图,看单基因分布。

这三种图分别回答不同问题。组合起来,才能减少误判。对于重点基因,还可以查看其在不同细胞亚群中的表达比例,而不是只看平均值。

4.3 给阈值保留解释空间

在论文和汇报中,最好说明阈值选择依据。比如:

  • 采用 log2FC = 1 作为生物学上较有意义的倍数变化。
  • 采用 p < 0.05 控制统计显著性。
  • 结合热图和表达分布确认候选基因稳定性。

这种写法比直接报一个阈值更完整。因为评审和同行更关心你为什么这样设,而不是你设了什么。

最后,如果你希望把单细胞差异基因筛选做得更稳、更快,建议使用成熟的分析支持工具。比如解螺旋可以帮助你把差异基因筛选、图形展示和下游分析流程串起来,减少重复试错,让阈值设置更有依据,也更容易把结果做实。

总结Conclusion

单细胞差异基因筛选的关键,不是记住某个固定阈值,而是理解阈值如何影响后续全部分析。log2FC、p 值、热图和象限图要一起看,才能避免把噪音当信号。 对医学生、医生和科研人员来说,最重要的是让筛选结果可解释、可重复、可验证。

如果你正在做单细胞转录组分析,建议先把质控、阈值和可视化三步做扎实,再进入富集和标记物验证。这样,后续结论才更稳。若想提升流程效率并减少参数反复调试,可以进一步了解解螺旋的相关支持方案。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料