引言Introduction
DEG分析做完后,很多人卡在下一步。只看上调、下调基因名单,往往解释不了生物学机制。GSEA可以把全基因排序纳入分析,帮助你从通路层面读懂差异信号。

1. 先理解DEG分析和GSEA的关系
1.1 DEG分析解决什么问题
DEG分析的核心,是找出两组样本之间表达有显著差异的基因。常见输出包括 log2FoldChange、p value、padj。它回答的是“哪些基因变了”。
但只看 DEG 列表有局限。
第一,阈值会丢掉边界基因。
第二,单个基因的变化不一定代表通路活性。
第三,真实机制通常是多个基因协同变化,而不是某一个基因单独驱动。
1.2 GSEA为什么适合接在DEG分析后面
GSEA,全称 Gene Set Enrichment Analysis。它的优势是不只看显著差异基因,而是使用全基因排序结果做富集判断 。这让结果更完整,也更贴近真实生物学过程。
在实际研究中,常见顺序是:
- 先做 DEG 分析,得到差异表达统计量。
- 再将基因按
log2FoldChange或其他排序指标排序。 - 用 GSEA 检查某条通路是否整体偏向排序前端或后端。
这一步的价值在于,它能验证 DEG 背后的功能方向。
例如,GO 或 pathway 已提示细胞周期异常,再用 GSEA 复核,结论通常更稳。
1.3 GSEA结果里最该看什么
GSEA 输出表中,最常用的几个指标是:
- NES ,标准化富集分数,便于不同基因集之间比较。
- p.adjust ,多重检验校正后的显著性。
- qvalue ,FDR 相关指标。
- set size ,基因集大小。
- leading edge ,对富集贡献最大的核心基因区域。
其中,NES 的正负方向很重要。正值表示该通路偏向上调端,负值表示偏向下调端。
这比单纯看 P 值更有解释力。
2. 三步完成GSEA富集分析
2.1 第一步,准备排序基因列表
根据上游知识库,GSEA通常从 DEG 结果开始。做法是把基因 ID 转换为统一标准,比如 ENSEMBL 转 ENTREZID,再按 log2FoldChange 排序。
常见要点有三个:
- 统一基因 ID。
- 去掉重复映射。
- 将排序向量按降序排列。
排序列表是 GSEA 的输入核心,排序是否正确,直接决定结果是否可信。
如果输入方向混乱,后面的 NES 方向也会被影响。
因此,建议在正式分析前先检查:
- 上调基因是否位于排序前端。
- 下调基因是否位于排序后端。
- 关键标志基因是否符合预期。
2.2 第二步,选择gene set并运行GSEA
GSEA需要 .gmt 注释文件,通常来自 MSigDB。
常用流程是:
- 下载对应物种的
.gmt文件。 - 读取 gene set。
- 运行 GSEA。
- 导出结果表。
这里的逻辑很直接。你不是在问单个基因是否显著,而是在问一组基因是否整体富集。
在结果解读中,推荐优先关注:
p.adjust < 0.05qvalue较低NES绝对值较大leading edge清晰
如果一个通路显著,但 NES 很小,生物学解释通常要更谨慎。
如果 set size 太小,稳定性也会下降。
这两点都值得筛查。
2.3 第三步,读懂GSEA的经典可视化
GSEA最常见的图是 enrichment plot,也就是大家常说的风形图。
它通常包含四部分:
- 绿色或红色的富集曲线。
- 下方黑色竖线,代表基因在排序列表中的位置。
- 中间的排序统计量分布。
- 右上角或图中注释的 NES、P 值等信息。
风形图的本质,是看基因集是否集中出现在排序列表的前端或后端。
如果曲线在左侧达到峰值,说明该基因集偏向排序前端。
如果峰值在右侧,则偏向排序后端。
曲线越陡、峰值越清楚,通常说明富集信号越明确。
3. 风形图和山峦图怎么读
3.1 风形图的关键参数
读风形图时,建议先看这四个点:
- 峰值位置。
- 曲线方向。
- 竖线密度。
- leading edge 区域。
竖线越集中,说明该基因集中的成员越多地分布在排序列表某一侧。
这通常意味着通路层面存在协同变化。
如果结合 NES 解读,结论会更完整:
NES > 0,通路向上调端富集。NES < 0,通路向下调端富集。p.adjust小,说明统计学支持更强。
3.2 leading edge为什么重要
leading edge 是 GSEA 里非常实用的概念。
它表示对富集贡献最大的核心基因子集 。
很多人只看通路名,但真正做机制研究时,leading edge 更接近后续验证目标。
你可以把它理解为:
- 通路层面的“核心驱动区”。
- 后续 qPCR、Western blot、功能实验的候选基因池。
- 连接富集结果和实验验证的桥梁。
如果要从 GSEA 结果里挑后续验证基因,优先看 leading edge,而不是只看整条通路名称。
3.3 山峦图适合看什么
上游知识库中还提到 ridgeplot,也就是山峦图。
它常用于同时展示多个基因集的分布情况。
相比单张风形图,山峦图更适合做横向比较。
常见用途包括:
- 展示 top 4 通路。
- 比较多个通路的富集强度。
- 辅助判断不同通路的分布宽度和峰值差异。
山峦图的优势在于,它能把多个 GSEA 结果放在一张图里,方便快速筛选重点通路。
3.4 读图时最容易犯的错误
风形图和山峦图都很直观,但误读也常见。
常见问题有:
- 只看 P 值,不看 NES 方向。
- 只看通路名,不看 leading edge。
- 忽略 set size。
- 把“显著”直接等同于“有机制意义”。
更稳妥的做法是,把统计学和生物学同时看。
显著只是第一步,能否解释表型,才是重点。
4. GSVA与差异比较,如何把GSEA结果落到样本层面
4.1 GSVA和GSEA的区别
GSEA和GSVA都和基因集有关,但应用场景不同。
GSEA更偏向组间排序富集。GSVA更偏向每个样本的通路打分。
简单说:
- GSEA看“这组基因是否整体富集”。
- GSVA看“每个样本在某条通路上的活性有多高”。
对于医学生、医生和科研人员来说,这种区分很重要。
因为很多文章需要的不只是“通路显著”,还需要“不同分组样本的通路活性差异”。
4.2 GSVA后如何做差异分析
根据知识库流程,GSVA 得到的是通路得分矩阵,之后可用 limma 做差异分析。
常见做法是构建设计矩阵,再进行组间比较。
这类分析的优点很明确:
- 能把通路分数转成统计学差异。
- 便于画热图和分组箱线图。
- 便于筛选最有解释力的通路。
当你想比较高低分组、治疗前后、病例与对照时,GSVA很适合补足GSEA的样本层信息。
4.3 热图和箱线图怎么辅助解释
热图适合看整体模式。
箱线图适合看组间差异。
二者结合,结论会更完整。
建议关注:
- 热图中是否出现清晰分组。
- 箱线图中组间差异是否方向一致。
- 多个样本是否存在离群点。
- 是否与临床分组逻辑一致。
如果 GSEA 指向某条通路异常,而 GSVA 在样本层面也显示一致差异,这个结论的可信度会明显提高。
5. 用解螺旋提升DEG分析后的结果转化
5.1 为什么很多人卡在这里
很多项目不是不会做 DEG,而是做完后不知道怎么继续。
常见困境是:
- DEG 列表太长,难以下手。
- GSEA 图看得懂,但不知道怎么组织成结果段落。
- 需要把通路结果和样本差异图整合进论文。
这时候,工具链和表达规范都很重要。
分析流程清晰,结果才容易写进文章,也更容易通过审稿。
5.2 解螺旋能帮你把分析流程做完整
如果你想把 DEG 分析、GSEA 富集、风形图解读、GSVA 差异比较串成一套可复用流程,解螺旋 可以帮助你更高效地完成整理、分析和结果表达。
它更适合需要快速推进项目的人群,比如:
- 医学生的课程作业和毕业设计。
- 临床科研中的机制初筛。
- 需要规范出图和结果汇报的研究人员。
把解螺旋作为分析和表达的辅助工具,可以减少重复试错,把时间更多留给机制解释和实验设计。
总结Conclusion
DEG分析只是起点。
真正能提升论文质量的,是把差异基因放回通路和样本层面去解释。GSEA能回答“哪些通路整体改变了”,风形图能帮助你判断富集方向,GSVA则能进一步落到每个样本的活性差异。
如果你正在做 DEG 分析后续的富集与可视化,建议按“排序列表, GSEA, 风形图, GSVA差异”这条主线推进。这样更稳,也更容易形成可发表的结果。想进一步提高效率,可以借助解螺旋 把流程标准化,少走弯路。

- 引言Introduction
- 1. 先理解DEG分析和GSEA的关系
- 2. 三步完成GSEA富集分析
- 3. 风形图和山峦图怎么读
- 4. GSVA与差异比较,如何把GSEA结果落到样本层面
- 5. 用解螺旋提升DEG分析后的结果转化
- 总结Conclusion






