引言Introduction
KEGG富集分析结果表看似简单,但很多人会在ID、物种、p值和背景基因上出错,导致解读偏差。如果你只会看显著性,却不懂字段含义,就很难把富集结果真正用于机制推断。 
KEGG富集分析是转录组、蛋白组和差异基因功能解释的常用步骤。它和GO分析、GSEA常一起使用,形成平行验证。先读懂字段,再谈通路生物学意义,才是规范的分析顺序。
1. KEGG富集分析先看什么
1.1 先确认物种和ID是否匹配
KEGG结果表最先要看的,是ID列和物种来源。ID前缀通常能直接提示物种。 例如人类常见为hsa,小鼠为mmu,大鼠为rno。这个细节非常关键。
如果物种注释错配,后面的通路解释就会偏离实际。比如你拿小鼠差异基因去做人类KEGG注释,很多通路会出现映射异常,或者显著通路数量明显减少。物种一致性,是KEGG富集分析的前提。
常见检查点有三个。
- 输入基因ID是否和数据库一致。
- 物种是否与实验对象一致。
- 通路ID前缀是否符合预期。
1.2 Description决定你在看哪条通路
第二列通常是Description,也就是通路名称。它直接告诉你富集到的是什么生物学过程。比如细胞周期、糖酵解、炎症反应、凋亡等。
Description不是“结果总结”,而是后续机制解释的入口。 如果一组差异基因富集到“ECM-receptor interaction”或“PI3K-Akt signaling pathway”,你就需要回到实验背景,判断这些通路是否与表型一致。
这里要注意,通路名称看起来像“结论”,但不能单独下结论。它只说明该通路相关基因在你的差异基因中出现得更多,是否真正驱动表型,还要结合表达方向、关键基因和实验验证。
2. 核心统计字段怎么读
2.1 Gene ratio和Bg ratio分别代表什么
Gene ratio和Bg ratio是KEGG富集中最容易被误读的两列。Gene ratio指的是你的输入基因中,有多少比例落在该通路上。 Bg ratio指的是背景基因中,有多少比例属于该通路。
举个例子。
如果你有1270个差异基因,其中79个被注释到某条通路,那么Gene ratio可以理解为79/1270。
如果背景中有8842个基因,其中232个属于该通路,那么Bg ratio可以理解为232/8842。
这两个比例的意义在于比较。只有当输入基因在某通路中的占比,明显高于背景占比时,富集才更有解释价值。 这也是超几何检验的核心思想。
2.2 p值、adjust p值和q value怎么选
p值表示观察到当前富集程度的概率。越小,说明该通路在随机情况下出现的可能性越低。
但在KEGG富集里,通常会同时检验很多通路,所以必须考虑多重比较校正。
优先看adjust p值,其次再看p值。
如果结果表里同时有q value,也可以一起参考。q value和adjust p值本质上都属于校正后的显著性指标。实际分析中,常用阈值是adjust p < 0.05,具体标准可根据样本量和研究设计调整。
需要强调的是,不要只看p值小,就认定通路一定可靠。 如果校正后不显著,说明结果的稳健性不足,结论要谨慎。
2.3 Count、geneID与富集强度的关系
Count表示富集到某条通路的输入基因数。它和Gene ratio相关,但不完全等同。因为Gene ratio还受输入基因总数影响,而Count是绝对数量。
geneID则列出具体富集到该通路的基因名称或ID。这个字段非常重要,因为它决定了你后续能否回到基因层面解释机制。真正有价值的KEGG富集,不是停留在通路名称,而是能定位到具体驱动基因。
如果某条通路显著,但只有1到2个基因命中,就要谨慎看待。数量太少时,统计稳定性和生物学解释力都可能不足。
3. KEGG富集结果常见误区
3.1 只看显著,不看背景和基因集大小
很多初学者只看adjust p值,把最小的通路直接当作重点。这个方法不够严谨。通路显著不等于通路重要。
还要结合背景基因数、基因集大小和命中基因数一起判断。
- 背景过小,结果可能不稳定。
- 通路基因集过大,容易得到“泛化显著”。
- 命中基因太少,解释力不足。
KEGG分析常设置minGSSize和maxGSSize,就是为了过滤过小或过大的基因集。这个参数设置得当,结果才更可靠。
3.2 把KEGG当成单一结论来源
KEGG和GO本质上是两套注释体系,关注点不同。GO更偏向功能、过程和定位,KEGG更偏向信号通路和代谢网络。做了GO还做KEGG,本质上是做平行验证。
对于机制研究,建议至少结合三类分析。
- GO富集,回答“基因在做什么”。
- KEGG富集,回答“基因通过哪条通路发挥作用”。
- GSEA,回答“整体表达趋势是否一致”。
这样得到的证据链更完整,也更符合科研写作中的逻辑要求。
3.3 忽略输入基因ID转换
KEGG富集通常要求标准化的基因ID,很多时候是ENTREZ ID。如果输入的是Symbol,必须先转换。 常见做法是用bitr进行ID转换,或者通过其他注释工具完成映射。
转换时要注意两点。
- 转换后丢失的基因要记录。
- 一个基因对应多个ID时,要统一处理规则。
如果不处理好ID转换,结果中会出现漏注释或重复计数,直接影响富集结论。
4. 结果解读时怎么建立证据链
4.1 从通路到机制,不能只停留在列表
KEGG富集的价值,不在于列出一串通路名字,而在于帮助你缩小机制范围。比如某研究中差异基因集中在炎症、免疫和细胞黏附相关通路,那么你就可以进一步思考,这些过程是否共同解释了表型变化。
更规范的做法是按三个层次解读。
- 统计层面,看校正后显著性。
- 通路层面,看是否与研究问题一致。
- 基因层面,看关键基因是否支持该通路方向。
只有这三个层次都成立,KEGG富集才真正有说服力。
4.2 与实验设计保持一致
如果你的研究是肿瘤、免疫、代谢或神经方向,KEGG结果的优先级也会不同。比如代谢研究更关注糖酵解、脂代谢、氧化磷酸化。免疫研究则更关注细胞因子、抗原呈递和T细胞信号通路。
这意味着,同一个KEGG结果,在不同课题中权重不同。 不要机械地把所有显著通路都写进论文结果部分。应该挑选与研究假设最相关的通路,并结合关键基因展开讨论。
5. 写论文和做汇报时怎么表达
5.1 结果描述要精炼但完整
写作时建议按“通路名称, 显著性, 命中基因”三要素组织语言。比如可以写成:差异基因显著富集于某信号通路,adjust p < 0.05,提示该过程可能与表型变化相关。
不要只写“KEGG富集分析显示多个通路显著富集”。 这种表述太空泛,缺少信息密度。更好的方式是点出最关键的2到5条通路,再说明它们和实验背景的关系。
5.2 图表展示要服务于读者理解
常见图形包括气泡图、柱状图和通路网络图。气泡图最适合展示富集强度、显著性和命中基因数的综合信息。柱状图更适合快速对比通路排名。网络图则适合展示多个通路之间的关联。
图不是装饰,而是帮助读者快速判断证据强弱。 建议优先展示校正后显著的前10到20条通路,并在图注中说明物种、阈值和背景设置。
总结Conclusion
KEGG富集分析的核心,不是“有没有显著通路”,而是你是否真正读懂了每一列字段的生物学和统计学含义 。从ID和物种匹配,到Description、Gene ratio、Bg ratio,再到p值、adjust p值、q value和Count,每一步都影响最终结论。只要字段理解准确,KEGG结果就能成为机制解释的重要证据。
如果你正在整理转录组或差异基因分析结果,建议把KEGG、GO和GSEA结合起来看,形成更完整的证据链。对于需要更高效完成富集分析、结果整理和论文表达的研究者,可以借助解螺旋来提升分析效率和写作质量。

- 引言Introduction
- 1. KEGG富集分析先看什么
- 2. 核心统计字段怎么读
- 3. KEGG富集结果常见误区
- 4. 结果解读时怎么建立证据链
- 5. 写论文和做汇报时怎么表达
- 总结Conclusion






