引言Introduction

KEGG富集分析结果表看似简单,但很多人会在ID、物种、p值和背景基因上出错,导致解读偏差。如果你只会看显著性,却不懂字段含义,就很难把富集结果真正用于机制推断。 一张KEGG富集结果表格截图,重点标出ID、Description、Gene ratio、Bg ratio、p值、adjust p值等字段,并配有物种标签说明。

KEGG富集分析是转录组、蛋白组和差异基因功能解释的常用步骤。它和GO分析、GSEA常一起使用,形成平行验证。先读懂字段,再谈通路生物学意义,才是规范的分析顺序。

1. KEGG富集分析先看什么

1.1 先确认物种和ID是否匹配

KEGG结果表最先要看的,是ID列和物种来源。ID前缀通常能直接提示物种。 例如人类常见为hsa,小鼠为mmu,大鼠为rno。这个细节非常关键。

如果物种注释错配,后面的通路解释就会偏离实际。比如你拿小鼠差异基因去做人类KEGG注释,很多通路会出现映射异常,或者显著通路数量明显减少。物种一致性,是KEGG富集分析的前提。

常见检查点有三个。

  1. 输入基因ID是否和数据库一致。
  2. 物种是否与实验对象一致。
  3. 通路ID前缀是否符合预期。

1.2 Description决定你在看哪条通路

第二列通常是Description,也就是通路名称。它直接告诉你富集到的是什么生物学过程。比如细胞周期、糖酵解、炎症反应、凋亡等。

Description不是“结果总结”,而是后续机制解释的入口。 如果一组差异基因富集到“ECM-receptor interaction”或“PI3K-Akt signaling pathway”,你就需要回到实验背景,判断这些通路是否与表型一致。

这里要注意,通路名称看起来像“结论”,但不能单独下结论。它只说明该通路相关基因在你的差异基因中出现得更多,是否真正驱动表型,还要结合表达方向、关键基因和实验验证。

2. 核心统计字段怎么读

2.1 Gene ratio和Bg ratio分别代表什么

Gene ratio和Bg ratio是KEGG富集中最容易被误读的两列。Gene ratio指的是你的输入基因中,有多少比例落在该通路上。 Bg ratio指的是背景基因中,有多少比例属于该通路。

举个例子。
如果你有1270个差异基因,其中79个被注释到某条通路,那么Gene ratio可以理解为79/1270。
如果背景中有8842个基因,其中232个属于该通路,那么Bg ratio可以理解为232/8842。

这两个比例的意义在于比较。只有当输入基因在某通路中的占比,明显高于背景占比时,富集才更有解释价值。 这也是超几何检验的核心思想。

2.2 p值、adjust p值和q value怎么选

p值表示观察到当前富集程度的概率。越小,说明该通路在随机情况下出现的可能性越低。
但在KEGG富集里,通常会同时检验很多通路,所以必须考虑多重比较校正。

优先看adjust p值,其次再看p值。
如果结果表里同时有q value,也可以一起参考。q value和adjust p值本质上都属于校正后的显著性指标。实际分析中,常用阈值是adjust p < 0.05,具体标准可根据样本量和研究设计调整。

需要强调的是,不要只看p值小,就认定通路一定可靠。 如果校正后不显著,说明结果的稳健性不足,结论要谨慎。

2.3 Count、geneID与富集强度的关系

Count表示富集到某条通路的输入基因数。它和Gene ratio相关,但不完全等同。因为Gene ratio还受输入基因总数影响,而Count是绝对数量。

geneID则列出具体富集到该通路的基因名称或ID。这个字段非常重要,因为它决定了你后续能否回到基因层面解释机制。真正有价值的KEGG富集,不是停留在通路名称,而是能定位到具体驱动基因。

如果某条通路显著,但只有1到2个基因命中,就要谨慎看待。数量太少时,统计稳定性和生物学解释力都可能不足。

3. KEGG富集结果常见误区

3.1 只看显著,不看背景和基因集大小

很多初学者只看adjust p值,把最小的通路直接当作重点。这个方法不够严谨。通路显著不等于通路重要。

还要结合背景基因数、基因集大小和命中基因数一起判断。

  • 背景过小,结果可能不稳定。
  • 通路基因集过大,容易得到“泛化显著”。
  • 命中基因太少,解释力不足。

KEGG分析常设置minGSSize和maxGSSize,就是为了过滤过小或过大的基因集。这个参数设置得当,结果才更可靠。

3.2 把KEGG当成单一结论来源

KEGG和GO本质上是两套注释体系,关注点不同。GO更偏向功能、过程和定位,KEGG更偏向信号通路和代谢网络。做了GO还做KEGG,本质上是做平行验证。

对于机制研究,建议至少结合三类分析。

  1. GO富集,回答“基因在做什么”。
  2. KEGG富集,回答“基因通过哪条通路发挥作用”。
  3. GSEA,回答“整体表达趋势是否一致”。

这样得到的证据链更完整,也更符合科研写作中的逻辑要求。

3.3 忽略输入基因ID转换

KEGG富集通常要求标准化的基因ID,很多时候是ENTREZ ID。如果输入的是Symbol,必须先转换。 常见做法是用bitr进行ID转换,或者通过其他注释工具完成映射。

转换时要注意两点。

  • 转换后丢失的基因要记录。
  • 一个基因对应多个ID时,要统一处理规则。

如果不处理好ID转换,结果中会出现漏注释或重复计数,直接影响富集结论。

4. 结果解读时怎么建立证据链

4.1 从通路到机制,不能只停留在列表

KEGG富集的价值,不在于列出一串通路名字,而在于帮助你缩小机制范围。比如某研究中差异基因集中在炎症、免疫和细胞黏附相关通路,那么你就可以进一步思考,这些过程是否共同解释了表型变化。

更规范的做法是按三个层次解读。

  1. 统计层面,看校正后显著性。
  2. 通路层面,看是否与研究问题一致。
  3. 基因层面,看关键基因是否支持该通路方向。

只有这三个层次都成立,KEGG富集才真正有说服力。

4.2 与实验设计保持一致

如果你的研究是肿瘤、免疫、代谢或神经方向,KEGG结果的优先级也会不同。比如代谢研究更关注糖酵解、脂代谢、氧化磷酸化。免疫研究则更关注细胞因子、抗原呈递和T细胞信号通路。

这意味着,同一个KEGG结果,在不同课题中权重不同。 不要机械地把所有显著通路都写进论文结果部分。应该挑选与研究假设最相关的通路,并结合关键基因展开讨论。

5. 写论文和做汇报时怎么表达

5.1 结果描述要精炼但完整

写作时建议按“通路名称, 显著性, 命中基因”三要素组织语言。比如可以写成:差异基因显著富集于某信号通路,adjust p < 0.05,提示该过程可能与表型变化相关。

不要只写“KEGG富集分析显示多个通路显著富集”。 这种表述太空泛,缺少信息密度。更好的方式是点出最关键的2到5条通路,再说明它们和实验背景的关系。

5.2 图表展示要服务于读者理解

常见图形包括气泡图、柱状图和通路网络图。气泡图最适合展示富集强度、显著性和命中基因数的综合信息。柱状图更适合快速对比通路排名。网络图则适合展示多个通路之间的关联。

图不是装饰,而是帮助读者快速判断证据强弱。 建议优先展示校正后显著的前10到20条通路,并在图注中说明物种、阈值和背景设置。

总结Conclusion

KEGG富集分析的核心,不是“有没有显著通路”,而是你是否真正读懂了每一列字段的生物学和统计学含义 。从ID和物种匹配,到Description、Gene ratio、Bg ratio,再到p值、adjust p值、q value和Count,每一步都影响最终结论。只要字段理解准确,KEGG结果就能成为机制解释的重要证据。

如果你正在整理转录组或差异基因分析结果,建议把KEGG、GO和GSEA结合起来看,形成更完整的证据链。对于需要更高效完成富集分析、结果整理和论文表达的研究者,可以借助解螺旋来提升分析效率和写作质量。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料