引言Introduction

生信富集分析基础是很多论文写作的起点。很多医学生、医生和科研人员都有同样的困惑。差异基因找出来了,下一步该做什么。如何把一串基因变成可解释的生物学结论。富集分析就是把分散信号汇总成通路和功能。
科研人员在电脑前查看基因列表、通路图和火山图,画面突出“差异基因到通路解释”的分析流程

1. 生信富集分析基础是什么

1.1 为什么要做富集分析

生信分析中,差异表达基因往往数量很多。单看基因列表,很难直接回答“这些基因共同参与了什么”。这时就需要富集分析。它的作用是把基因按功能归类,再判断某些功能项或通路是否显著集中。

富集分析的核心价值有三点。

  1. 降低解释难度。
  2. 提升结果的生物学指向性。
  3. 帮助后续实验聚焦关键通路。

从论文逻辑看,富集分析常出现在差异分析之后。它承接“谁变了”,进一步回答“为什么变”。这也是生信富集分析基础最重要的定位。

1.2 富集分析的基本输入

常见输入有两类。第一类是差异基因列表。第二类是按表达变化排序的全基因集。前者多用于GO和KEGG。后者常用于GSEA和GSVA。

在正式分析前,输入数据必须清楚。包括数据来源、物种、基因类型、筛选阈值和背景集。如果输入不规范,富集结果很容易失真。 这也是方法部分必须写细的原因。

2. 常用富集分析方法详解

2.1 GO富集分析

GO富集分析是最常见的方法之一。GO分为三个层面:生物过程,细胞组分,分子功能。它回答的是基因“参与什么过程”“位于哪里”“发挥什么功能”。

GO分析适合用于描述差异基因的功能特征。比如免疫反应、细胞周期、氧化应激、细胞外基质重塑等。如果研究目标是机制初筛,GO通常是第一步。

写作时建议说明以下信息:

  • 使用的R包,如clusterProfiler。
  • GO数据库和物种注释版本。
  • 富集阈值,如P值或调整后P值。
  • 展示方式,如柱状图或气泡图。

2.2 KEGG富集分析

KEGG更强调通路。它关注基因是否集中在某条代谢、信号转导或疾病相关通路中。与GO相比,KEGG更利于形成“机制链条”。

例如,差异基因可能富集在PI3K-Akt、MAPK、NF-κB等通路。这类结果更适合连接后续实验验证。 因为通路名本身就具有明确的生物学语义。

需要注意的是,KEGG富集结果不等于因果关系。它只能说明这些基因在该通路中出现频率更高,不能直接证明通路被激活或抑制。写论文时应避免过度推断。

2.3 GSEA分析

GSEA与GO、KEGG的思路不同。它不是先筛差异基因,再做富集。而是把全部基因按某个表型相关指标排序,观察某个基因集在排序列表中的分布趋势。

这种方法的优势是减少阈值依赖。对于变化幅度不大,但整体趋势一致的通路,GSEA更敏感。当你怀疑某条通路“整体轻度变化”时,GSEA比单纯差异基因富集更合适。

GSEA常用指标包括NES、P值和FDR。写作时要注明基因集来源,如MSigDB,以及排序依据,如log2FC、t值或相关性统计量。

2.4 GSVA分析

GSVA与GSEA都属于基因集层面的分析,但侧重点不同。GSVA更适合比较样本间通路活性差异。它把基因集转化为样本层面的评分,便于后续组间比较、相关性分析和临床关联分析。

在肿瘤、免疫浸润、亚型分层等研究中,GSVA很常见。它可以把“基因表达差异”转成“通路活性差异”。这一步对临床分组分析尤其有价值。

3. 富集分析怎么做才规范

3.1 先分清分析对象

做富集分析前,先明确研究对象。是差异表达基因,还是排序后的全部基因。是mRNA,还是lncRNA、miRNA、circRNA。对象不同,方法选择也不同。

一般来说可以这样理解:

  • 差异基因集合,优先考虑GO、KEGG。
  • 全基因排序,优先考虑GSEA。
  • 样本通路评分比较,优先考虑GSVA。

方法选择错了,结果再漂亮也不稳。

3.2 再统一阈值和背景集

阈值要写清楚。常见包括P值、调整后P值、FDR和log2FC。背景集也要明确。背景集决定“富集是否显著”,是统计学判断的重要基础。

如果是芯片数据,还要注意探针注释。若是RNA-seq数据,则要说明基因ID转换方式。这些细节决定结果是否可复现。

3.3 结果可视化要服务于结论

富集分析不仅是算结果,还要会展示。常见图形包括:

  • 柱状图。适合展示Top条目。
  • 气泡图。适合同时展示富集程度和基因数。
  • 经典GSEA曲线图。适合展示某条通路的整体偏移。
  • 热图。适合展示样本间GSVA评分差异。

图不是越多越好,而是要围绕结论。图表的目标是让读者一眼看懂你想证明什么。

4. 生信富集分析基础中的常见误区

4.1 把富集结果等同于机制证明

这是最常见的问题。富集分析只是提示“相关”。它不是最终机制证据。真正的机制证明还需要实验验证,比如qPCR、Western blot、敲低敲除或功能实验。

所以写作时要保持克制。可以写“提示可能参与”“可能与……相关”,不要直接下结论。

4.2 只看P值,不看生物学意义

有些条目统计学显著,但生物学解释很弱。也有些条目P值边缘显著,但与疾病机制高度相关。富集分析不能只追求显著性,还要结合疾病背景。

对于医学生和临床科研人员来说,这一点尤其重要。因为文章最后要落到疾病分子机制、诊断标志物或治疗靶点上。

4.3 方法描述不完整

方法部分写得越清楚,文章越可信。至少要交代:

  1. 数据来源。
  2. 基因筛选标准。
  3. 使用的软件和R包。
  4. 富集数据库和版本。
  5. 显著性阈值。
  6. 可视化方式。

生信富集分析基础不只是“会跑图”,更是“会写清楚”。 这直接影响论文可重复性。

5. 写文章时如何组织富集分析结果

5.1 结果顺序建议

常见写法是先差异分析,再做GO/KEGG,再做GSEA或GSVA。这样逻辑最顺。若研究强调通路活性变化,也可以把GSVA前置。

一个较稳妥的顺序是:

  • 先找差异分子。
  • 再做功能富集。
  • 再做通路验证。
  • 最后连接临床或实验。

这种结构便于读者理解,也符合论文叙事习惯。

5.2 结果表述要具体

不要只写“显著富集于多个通路”。要写清楚具体条目、方向和意义。比如“差异基因主要富集于炎症反应、细胞外基质组织和PI3K-Akt信号通路”。这样的表达更专业,也更符合E-E-A-T要求。

如果能进一步说明这些条目与疾病表型的关系,文章会更有说服力。这也是富集分析从结果展示走向机制解释的关键一步。

总结Conclusion

生信富集分析基础的重点,不是单纯记住方法名,而是理解每种方法的适用场景。GO看功能,KEGG看通路,GSEA看整体排序趋势,GSVA看样本通路活性。把方法选对,把阈值写清,把图表做准,才能让结果真正服务于论文。

如果你正在做材料与方法、结果图展示或生信论文写作,建议把流程标准化。解螺旋品牌提供的生信写作与分析支持,可以帮助你更高效地完成从数据整理到图表表达的全过程。 对医学生、医生和科研人员来说,这能显著减少试错时间,让富集分析更规范、更可复现。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料