引言Introduction
做生信分析时,很多人只看GO,不看KEGG,结果容易漏掉关键信息。GO回答“基因做什么”,KEGG回答“这些基因参与哪条通路” 。如果你要判断差异基因是否真的指向同一生物学过程,平行验证非常重要。
1. 为什么GO和KEGG要一起看
1.1 两套注释体系,互为补充
GO和KEGG不是重复分析,而是两个维度的解释框架。GO更偏向功能分类,KEGG更偏向通路网络。同一批差异基因同时在GO和KEGG中富集,说明结果更稳健。
在论文解读中,这种做法相当于做了两次独立验证。一个从功能出发,一个从通路出发。两者方向一致,可信度就更高。
1.2 平行验证比单一结果更有说服力
很多文章的核心问题,不在于有没有富集结果,而在于能不能证明这个结果不是偶然。GO、KEGG、GSEA是常见的三类分析工具,组合使用能让证据链更完整。
对医学生、医生和科研人员来说,这一步很关键。它决定了你后续是进入机制验证,还是停留在“有显著性”的层面。
1.3 什么时候必须做KEGG
如果研究涉及信号转导、代谢重编程、炎症反应、细胞周期或疾病机制,KEGG几乎是必做项。因为它更容易把差异基因串成路径。
例如,某些基因在GO里分散在多个条目中,但在KEGG中会集中到同一条通路。这类结果更适合用于机制假设构建。
2. KEGG富集结果怎么看
2.1 先看表格字段,避免误读
KEGG富集结果通常先从标准化表格读起。常见字段包括ID、description、gene ratio、BG ratio、p value、adjust p value、q value、gene ID和count。
其中,ID是KEGG pathway编号,前缀常带物种信息。人常见HSA,小鼠是MMU,大鼠是RNO。物种错配会直接导致注释偏差。
2.2 description、gene ratio和BG ratio分别代表什么
description就是通路名称。它告诉你这一组基因被富集到了哪条通路,比如细胞骨架、炎症反应或代谢相关通路。
gene ratio反映的是你的差异基因中,有多少比例落入该通路。BG ratio则是背景基因中,多少比例属于该通路。前者看“命中率”,后者看“背景占比”,两者一起看更合理。
举个例子。若1270个差异基因中有79个进入某条通路,这就是gene ratio的来源。若背景集中有8842个基因,通路中总共有232个基因,则对应BG ratio。这样能避免只看绝对数造成的误判。
2.3 统计学优先看adjust p value
p value、adjust p value和q value的意义与GO类似。实际解读时,优先看adjust p value,其次才是p value。
原因很简单。KEGG富集通常同时检验很多通路,若不做多重校正,假阳性会明显增多。对科研论文来说,校正后的结果更适合进入正文和图注。
3. KEGG富集分析代码的思路与常见流程
3.1 先明确输入数据
做KEGG富集分析代码前,先准备好差异基因列表。一般需要基因ID统一规范化,如ENTREZ ID、SYMBOL或Ensembl ID。ID不统一,是很多KEGG分析失败的根源。
如果使用R包,常见流程是先做ID转换,再进行富集分析,再整理结果和作图。不同数据库的ID体系不同,不能直接混用。
3.2 常见分析步骤
一个标准的KEGG富集分析代码流程通常包括以下几步。
- 导入差异基因。
- 统一基因ID。
- 选择背景基因集。
- 运行富集分析。
- 按adjust p排序。
- 输出结果表。
- 绘制气泡图或柱状图。
背景基因集一定要定义清楚。 如果背景选错,富集方向可能被放大或削弱,最后影响结论。
3.3 结果可视化要服务于论文表达
KEGG结果不只是“跑出来”,还要“看得懂”。常见图形包括dotplot、barplot和network图。它们适合展示通路数量、显著性和命中基因数。
论文写作中,优先选择能直接体现adjust p value和gene ratio的图。这样读者一眼就能判断哪些通路值得进一步验证。
4. 论文中如何用KEGG支撑机制推断
4.1 从通路富集回到生物学问题
KEGG的价值,不在于列出很多通路,而在于把通路和疾病表型联系起来。如果多个差异基因集中在同一条通路,说明该通路可能是研究对象的关键中介。
例如,炎症相关研究常见NF-κB、MAPK、PI3K-Akt等通路富集。代谢研究常见糖酵解、脂代谢、氧化磷酸化相关条目。重要的是,要结合实验背景解释,而不是机械套用。
4.2 不要把富集结果当因果关系
KEGG富集只能说明“相关”,不能直接证明“因果”。这是很多初学者最容易犯的错误。富集结果是机制假设的起点,不是终点。
因此,后续通常需要PPI网络、qPCR、Western blot、干预实验或动物模型来验证。文章里如果GO、KEGG、GSEA三者方向一致,再配合实验验证,整体说服力会明显增强。
4.3 与GO结果配合,形成完整证据链
GO偏功能,KEGG偏路径,GSEA偏全局趋势。三者合用,能形成从“基因集合”到“生物过程”再到“通路变化”的完整链条。
这就是平行验证的核心价值。 它不是简单堆砌分析,而是用不同证据体系支持同一个结论。对高质量生信文章来说,这一步非常重要。
5. 写作和审稿中最常见的几个问题
5.1 物种注释错误
这是最基础、也最致命的问题。人、鼠、大鼠的KEGG ID前缀不同,注释库也不同。如果把鼠数据错配成人类数据库,结果再显著也没有意义。
5.2 只报通路名,不报统计量
很多文章只写“某某通路显著富集”,却不写adjust p value、count和gene ratio。这样可重复性差,也不利于审稿判断。
5.3 过度解释单一通路
如果只有一条通路显著,不要轻易下定论。最好结合GO、PPI和独立实验一起看。单一KEGG结果只能提示方向,不能单独定义机制。
6. 如何把KEGG结果写进论文正文
6.1 结果描述要简洁、准确
写作时建议用“富集到”“提示”“可能参与”这类客观表达。不要用过强的因果措辞,除非已有功能实验支持。
可参考的表述方式是:差异基因主要富集于某些信号转导、代谢或疾病相关通路,提示该模型可能通过相关生物过程发生改变。
6.2 图注和结果段落要一致
正文中提到的通路名称、排序逻辑和显著性阈值,必须和图表一致。图文不一致,是审稿中很常见的问题。
如果你在图中用的是adjust p < 0.05,就不要在正文里只写p < 0.05。标准不一致会削弱论文严谨性。
6.3 结果要服务于后续实验
KEGG不是孤立存在的。它应该引出下一步验证对象。比如,优先挑选富集显著、与表型相关、且有文献支持的通路,进入qPCR或蛋白验证。
这样写,文章逻辑就会非常顺:差异基因筛选,GO/KEGG平行验证,锁定候选通路,再做机制实验。
总结Conclusion
KEGG富集分析的核心,不只是看哪些通路显著,而是判断这些通路是否能和GO结果形成一致证据。GO、KEGG、GSEA联用,才能把生信结论从“可能相关”推进到“值得验证”。
在实际分析中,先看物种ID,再看description、gene ratio、BG ratio和adjust p value,最后结合实验背景解释,才是更稳妥的路径。如果你需要更高效地完成KEGG富集分析代码和结果整理,可以借助解螺旋的专业支持,把分析流程、图表输出和论文表达一次性打通。

- 引言Introduction
- 1. 为什么GO和KEGG要一起看
- 2. KEGG富集结果怎么看
- 3. KEGG富集分析代码的思路与常见流程
- 4. 论文中如何用KEGG支撑机制推断
- 5. 写作和审稿中最常见的几个问题
- 6. 如何把KEGG结果写进论文正文
- 总结Conclusion






