引言Introduction

生信分析里,最耗时的往往不是统计本身,而是把单图做准、做统一、做成能发表的套图 。很多医学生、医生和科研人员都会卡在这里:图能出,但逻辑不连贯,格式不统一,结果也难复现。
科研人员在电脑前查看火山图、热图、GSEA和网络图,旁边标注“单图到套图”的流程示意

1. 为什么单图阶段最容易出问题

1.1 单图不是终点,而是分析起点

在生信文章里,火山图、热图、象线图、GSEA图、PPI图,都不是孤立存在的。它们通常对应同一条证据链。单图做对了,后面的套图才有统一逻辑。
如果前期分组、命名、阈值、数据来源不一致,后面拼图时就会出现问题。常见情况包括:

  • 样本分组前后不一致。
  • TPM、FPKM、count混用。
  • 图注里写法不统一。
  • 颜色、字体、坐标轴风格不一致。

这些问题看起来小,但会直接影响论文的专业度。对审稿人来说,图的规范性本身就是可信度的一部分。

1.2 先看懂图,再谈复现

很多初学者一上来就想复刻整套结果,但忽略了“图背后的意义”。实际上,生信文章的核心通常可以拆成四步:

  • ,找差异表达。
  • ,做功能富集。
  • ,看网络关系。
  • ,分析临床意义。

这套逻辑对肿瘤和非肿瘤研究都适用。区别在于,肿瘤研究更常见的是 KM 曲线、Cox 回归和 ROC 分析。非肿瘤研究则可能更多使用 ROC 或分组比较图来体现应用价值。

2. 统计分析如何支撑出图

2.1 差异分析决定火山图和热图

火山图和热图是最基础的结果图,但它们依赖前面的统计判断。差异分析最重要的是三个变量:

  1. 分组是否清晰。
  2. 统计阈值是否明确。
  3. 数据是否经过一致预处理。

例如,在肿瘤与正常组织比较时,常需要先明确样本来源。TCGA 数据常与 GTEx 补足正常组织样本。若不说明来源,后续图的可解释性会下降。差异分析不是为了出图,而是为了证明分子确实存在表达变化。

2.2 富集分析要服务机制解释

GO、KEGG、GSEA 不是简单的“补图”。它们回答的是机制问题。差异分子集中在哪些生物过程,涉及哪些信号通路,是否呈现一致的功能偏移,这些都要靠富集分析支撑。

常见表达方式包括:

  • GO 说明生物学过程、细胞组分、分子功能。
  • KEGG 说明通路层面的变化。
  • GSEA 适合检测整体表达趋势,而不只看阈值筛选后的基因。

如果差异分析告诉你“变了”,富集分析就是解释“为什么变、可能怎么变”。

2.3 网络分析补足“联”的证据

网络分析的价值在于把单个分子放回系统里看。常见包括 PPI 网络、相关性网络、免疫细胞关联分析。对于肿瘤研究,这一步尤其重要,因为疾病机制往往不是单基因驱动,而是网络协同变化。

实际写作时,建议明确说明:

  • 网络构建来源。
  • 节点和边的定义。
  • 相关性阈值。
  • 是否经过中心节点筛选。

这样读者才能判断网络图是否可靠,而不是只看“图是否好看”。

3. 从单图到套图的标准化流程

3.1 统一数据口径,避免后期返工

套图能不能高效完成,关键不在作图软件,而在前期规范。建议从一开始就建立统一模板,至少包含:

  • 研究对象名称。
  • 分组名称。
  • 数据类型。
  • 统计方法。
  • 显著性阈值。
  • 图标题和图注格式。

比如同一篇文章里,如果有的图写“Normal”,有的图写“control”,有的图写“para-tumor”,视觉上会显得不专业。统一命名,是套图转化最便宜也最有效的一步。

3.2 图形风格要保持一致

套图的高级感,主要来自一致性,而不是复杂度。建议统一以下元素:

  • 字体。
  • 字号。
  • 配色。
  • 线条粗细。
  • 坐标轴样式。
  • 图例位置。

如果火山图、热图、GSEA图和PPI图来自不同工具,最好在最终排版前进行统一调整。这样可以避免“每张图都像独立项目”的割裂感。

3.3 先单图复现,再批量拼图

高效做法不是一开始就追求大套图,而是先把关键单图逐个复现。通常顺序可以是:

  1. 差异表达图。
  2. 富集分析图。
  3. 网络图。
  4. 临床相关图。
  5. 预后相关图。

这个顺序符合论文叙事逻辑。先证明“有差异”,再解释“为什么差异”,再说明“与临床有什么关系”。图的顺序,本质上就是证据链顺序。

4. 常见图形的复现重点

4.1 火山图和热图

火山图重点看阈值。一般要说明 log2FC 和 P 值的筛选标准。热图重点看样本聚类和基因聚类是否与分组一致。两者经常一起出现,因为它们分别回答“哪些变了”和“变成什么样”。

复现时建议注意:

  • 火山图标注上下调基因数量。
  • 热图保留样本分组信息。
  • 颜色梯度不要过度花哨。
  • 图注中写清数据来源和标准化方法。

4.2 GSEA、GO、KEGG图

这类图强调统计结果和生物学解释的对应关系。GSEA 常看 NES、P 值和 FDR。GO、KEGG 则常看富集条目排序和显著性。如果结果只是“显著”,但没有说明富集到什么方向,图的价值会大幅下降。

建议在正文里保留三层信息:

  • 统计显著性。
  • 核心条目。
  • 与疾病表型的关联。

4.3 网络图和临床图

PPI 图、免疫相关图、KM 曲线、Cox 回归图,属于“联”和“靠”的核心部分。它们决定文章是否从机制走向临床意义。尤其在肿瘤研究中,KM 和 Cox 往往是审稿人重点关注的部分。

这里要特别注意:

  • 生存分析要交代事件定义。
  • 分组方式要与前文一致。
  • 单变量和多变量分析要区分。
  • 风险比和置信区间要写完整。

5. 让套图更快完成的实操原则

5.1 先搭框架,再填图

很多人画图慢,是因为每张图都从零开始。更高效的方式是先建立整篇文章的图形框架,再逐张补齐。框架至少包括:

  • 主结果图。
  • 验证图。
  • 机制图。
  • 临床图。
  • 补充图。

这样可以提前规划每张图的比例、方向和内容层级,减少重复修改。

5.2 保留可编辑源文件

做生信图时,不要只保存成图片。要保留原始数据表、统计脚本和可编辑源文件。这样后面一旦需要改分组、改阈值、改配色,就不会重新从头来过。可复现,是科研图表最重要的底线。

5.3 图注要和图面同步

图做得再好,如果图注不完整,文章质量也会被拉低。图注至少应包含:

  • 数据集名称。
  • 样本量。
  • 分组方式。
  • 统计方法。
  • 显著性标记说明。

这不仅方便审稿人,也方便后续答辩和汇报。

6. AI 时代的生信作图趋势

从单图到套图的转化,正在被 AI 重塑。过去很多步骤需要人工逐个完成,现在可以通过更高效的流程实现批量分析、批量制图和批量排版。
但要注意,AI 提速不等于自动正确。统计逻辑、分组逻辑和临床解释,仍然必须由研究者自己把关。
这也是为什么系统化工具更重要。像解螺旋这样的专业平台,更适合帮助研究者把单图流程标准化,把套图制作流程模板化,减少重复劳动,把时间留给结果解释和文章打磨。

总结Conclusion

生信数据统计与作图的关键,不在于“能不能画出一张图”,而在于能不能把单图变成有逻辑、有一致性、可复现的套图 。从差异分析到富集分析,再到网络分析和临床分析,每一步都要围绕同一条证据链展开。
如果你正在做论文、课题或汇报,建议先把单图规范化,再推进套图整合。想进一步提升生信作图效率和复现质量,可以关注解螺旋,把复杂流程做成高效、稳定、可复制的研究路径。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料