引言Introduction

DEG分析做完后,很多人卡在下一步。只看上调、下调基因名单,往往解释不了生物学机制。GSEA可以把全基因排序纳入分析,帮助你从通路层面读懂差异信号。
科研人员在电脑前查看基因表达热图、富集曲线和通路网络示意图,突出“从DEG到GSEA”的分析流程。

1. 先理解DEG分析和GSEA的关系

1.1 DEG分析解决什么问题

DEG分析的核心,是找出两组样本之间表达有显著差异的基因。常见输出包括 log2FoldChangep valuepadj它回答的是“哪些基因变了”。

但只看 DEG 列表有局限。
第一,阈值会丢掉边界基因。
第二,单个基因的变化不一定代表通路活性。
第三,真实机制通常是多个基因协同变化,而不是某一个基因单独驱动。

1.2 GSEA为什么适合接在DEG分析后面

GSEA,全称 Gene Set Enrichment Analysis。它的优势是不只看显著差异基因,而是使用全基因排序结果做富集判断 。这让结果更完整,也更贴近真实生物学过程。

在实际研究中,常见顺序是:

  1. 先做 DEG 分析,得到差异表达统计量。
  2. 再将基因按 log2FoldChange 或其他排序指标排序。
  3. 用 GSEA 检查某条通路是否整体偏向排序前端或后端。

这一步的价值在于,它能验证 DEG 背后的功能方向。
例如,GO 或 pathway 已提示细胞周期异常,再用 GSEA 复核,结论通常更稳。

1.3 GSEA结果里最该看什么

GSEA 输出表中,最常用的几个指标是:

  • NES ,标准化富集分数,便于不同基因集之间比较。
  • p.adjust ,多重检验校正后的显著性。
  • qvalue ,FDR 相关指标。
  • set size ,基因集大小。
  • leading edge ,对富集贡献最大的核心基因区域。

其中,NES 的正负方向很重要。正值表示该通路偏向上调端,负值表示偏向下调端。
这比单纯看 P 值更有解释力。

2. 三步完成GSEA富集分析

2.1 第一步,准备排序基因列表

根据上游知识库,GSEA通常从 DEG 结果开始。做法是把基因 ID 转换为统一标准,比如 ENSEMBL 转 ENTREZID,再按 log2FoldChange 排序。

常见要点有三个:

  • 统一基因 ID。
  • 去掉重复映射。
  • 将排序向量按降序排列。

排序列表是 GSEA 的输入核心,排序是否正确,直接决定结果是否可信。

如果输入方向混乱,后面的 NES 方向也会被影响。
因此,建议在正式分析前先检查:

  • 上调基因是否位于排序前端。
  • 下调基因是否位于排序后端。
  • 关键标志基因是否符合预期。

2.2 第二步,选择gene set并运行GSEA

GSEA需要 .gmt 注释文件,通常来自 MSigDB。
常用流程是:

  1. 下载对应物种的 .gmt 文件。
  2. 读取 gene set。
  3. 运行 GSEA。
  4. 导出结果表。

这里的逻辑很直接。你不是在问单个基因是否显著,而是在问一组基因是否整体富集。

在结果解读中,推荐优先关注:

  • p.adjust < 0.05
  • qvalue 较低
  • NES 绝对值较大
  • leading edge 清晰

如果一个通路显著,但 NES 很小,生物学解释通常要更谨慎。
如果 set size 太小,稳定性也会下降。
这两点都值得筛查。

2.3 第三步,读懂GSEA的经典可视化

GSEA最常见的图是 enrichment plot,也就是大家常说的风形图。
它通常包含四部分:

  • 绿色或红色的富集曲线。
  • 下方黑色竖线,代表基因在排序列表中的位置。
  • 中间的排序统计量分布。
  • 右上角或图中注释的 NES、P 值等信息。

风形图的本质,是看基因集是否集中出现在排序列表的前端或后端。

如果曲线在左侧达到峰值,说明该基因集偏向排序前端。
如果峰值在右侧,则偏向排序后端。
曲线越陡、峰值越清楚,通常说明富集信号越明确。

3. 风形图和山峦图怎么读

3.1 风形图的关键参数

读风形图时,建议先看这四个点:

  1. 峰值位置。
  2. 曲线方向。
  3. 竖线密度。
  4. leading edge 区域。

竖线越集中,说明该基因集中的成员越多地分布在排序列表某一侧。
这通常意味着通路层面存在协同变化。

如果结合 NES 解读,结论会更完整:

  • NES > 0,通路向上调端富集。
  • NES < 0,通路向下调端富集。
  • p.adjust 小,说明统计学支持更强。

3.2 leading edge为什么重要

leading edge 是 GSEA 里非常实用的概念。
它表示对富集贡献最大的核心基因子集
很多人只看通路名,但真正做机制研究时,leading edge 更接近后续验证目标。

你可以把它理解为:

  • 通路层面的“核心驱动区”。
  • 后续 qPCR、Western blot、功能实验的候选基因池。
  • 连接富集结果和实验验证的桥梁。

如果要从 GSEA 结果里挑后续验证基因,优先看 leading edge,而不是只看整条通路名称。

3.3 山峦图适合看什么

上游知识库中还提到 ridgeplot,也就是山峦图。
它常用于同时展示多个基因集的分布情况。
相比单张风形图,山峦图更适合做横向比较。

常见用途包括:

  • 展示 top 4 通路。
  • 比较多个通路的富集强度。
  • 辅助判断不同通路的分布宽度和峰值差异。

山峦图的优势在于,它能把多个 GSEA 结果放在一张图里,方便快速筛选重点通路。

3.4 读图时最容易犯的错误

风形图和山峦图都很直观,但误读也常见。
常见问题有:

  • 只看 P 值,不看 NES 方向。
  • 只看通路名,不看 leading edge。
  • 忽略 set size。
  • 把“显著”直接等同于“有机制意义”。

更稳妥的做法是,把统计学和生物学同时看。
显著只是第一步,能否解释表型,才是重点。

4. GSVA与差异比较,如何把GSEA结果落到样本层面

4.1 GSVA和GSEA的区别

GSEA和GSVA都和基因集有关,但应用场景不同。
GSEA更偏向组间排序富集。GSVA更偏向每个样本的通路打分。

简单说:

  • GSEA看“这组基因是否整体富集”。
  • GSVA看“每个样本在某条通路上的活性有多高”。

对于医学生、医生和科研人员来说,这种区分很重要。
因为很多文章需要的不只是“通路显著”,还需要“不同分组样本的通路活性差异”。

4.2 GSVA后如何做差异分析

根据知识库流程,GSVA 得到的是通路得分矩阵,之后可用 limma 做差异分析。
常见做法是构建设计矩阵,再进行组间比较。

这类分析的优点很明确:

  • 能把通路分数转成统计学差异。
  • 便于画热图和分组箱线图。
  • 便于筛选最有解释力的通路。

当你想比较高低分组、治疗前后、病例与对照时,GSVA很适合补足GSEA的样本层信息。

4.3 热图和箱线图怎么辅助解释

热图适合看整体模式。
箱线图适合看组间差异。
二者结合,结论会更完整。

建议关注:

  • 热图中是否出现清晰分组。
  • 箱线图中组间差异是否方向一致。
  • 多个样本是否存在离群点。
  • 是否与临床分组逻辑一致。

如果 GSEA 指向某条通路异常,而 GSVA 在样本层面也显示一致差异,这个结论的可信度会明显提高。

5. 用解螺旋提升DEG分析后的结果转化

5.1 为什么很多人卡在这里

很多项目不是不会做 DEG,而是做完后不知道怎么继续。
常见困境是:

  • DEG 列表太长,难以下手。
  • GSEA 图看得懂,但不知道怎么组织成结果段落。
  • 需要把通路结果和样本差异图整合进论文。

这时候,工具链和表达规范都很重要。
分析流程清晰,结果才容易写进文章,也更容易通过审稿。

5.2 解螺旋能帮你把分析流程做完整

如果你想把 DEG 分析、GSEA 富集、风形图解读、GSVA 差异比较串成一套可复用流程,解螺旋 可以帮助你更高效地完成整理、分析和结果表达。

它更适合需要快速推进项目的人群,比如:

  • 医学生的课程作业和毕业设计。
  • 临床科研中的机制初筛。
  • 需要规范出图和结果汇报的研究人员。

把解螺旋作为分析和表达的辅助工具,可以减少重复试错,把时间更多留给机制解释和实验设计。

总结Conclusion

DEG分析只是起点。
真正能提升论文质量的,是把差异基因放回通路和样本层面去解释。GSEA能回答“哪些通路整体改变了”,风形图能帮助你判断富集方向,GSVA则能进一步落到每个样本的活性差异。
如果你正在做 DEG 分析后续的富集与可视化,建议按“排序列表, GSEA, 风形图, GSVA差异”这条主线推进。这样更稳,也更容易形成可发表的结果。想进一步提高效率,可以借助解螺旋 把流程标准化,少走弯路。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料