引言Introduction
生信分析里,最耗时的往往不是统计本身,而是把单图做准、做统一、做成能发表的套图 。很多医学生、医生和科研人员都会卡在这里:图能出,但逻辑不连贯,格式不统一,结果也难复现。

1. 为什么单图阶段最容易出问题
1.1 单图不是终点,而是分析起点
在生信文章里,火山图、热图、象线图、GSEA图、PPI图,都不是孤立存在的。它们通常对应同一条证据链。单图做对了,后面的套图才有统一逻辑。
如果前期分组、命名、阈值、数据来源不一致,后面拼图时就会出现问题。常见情况包括:
- 样本分组前后不一致。
- TPM、FPKM、count混用。
- 图注里写法不统一。
- 颜色、字体、坐标轴风格不一致。
这些问题看起来小,但会直接影响论文的专业度。对审稿人来说,图的规范性本身就是可信度的一部分。
1.2 先看懂图,再谈复现
很多初学者一上来就想复刻整套结果,但忽略了“图背后的意义”。实际上,生信文章的核心通常可以拆成四步:
- 挑 ,找差异表达。
- 圈 ,做功能富集。
- 联 ,看网络关系。
- 靠 ,分析临床意义。
这套逻辑对肿瘤和非肿瘤研究都适用。区别在于,肿瘤研究更常见的是 KM 曲线、Cox 回归和 ROC 分析。非肿瘤研究则可能更多使用 ROC 或分组比较图来体现应用价值。
2. 统计分析如何支撑出图
2.1 差异分析决定火山图和热图
火山图和热图是最基础的结果图,但它们依赖前面的统计判断。差异分析最重要的是三个变量:
- 分组是否清晰。
- 统计阈值是否明确。
- 数据是否经过一致预处理。
例如,在肿瘤与正常组织比较时,常需要先明确样本来源。TCGA 数据常与 GTEx 补足正常组织样本。若不说明来源,后续图的可解释性会下降。差异分析不是为了出图,而是为了证明分子确实存在表达变化。
2.2 富集分析要服务机制解释
GO、KEGG、GSEA 不是简单的“补图”。它们回答的是机制问题。差异分子集中在哪些生物过程,涉及哪些信号通路,是否呈现一致的功能偏移,这些都要靠富集分析支撑。
常见表达方式包括:
- GO 说明生物学过程、细胞组分、分子功能。
- KEGG 说明通路层面的变化。
- GSEA 适合检测整体表达趋势,而不只看阈值筛选后的基因。
如果差异分析告诉你“变了”,富集分析就是解释“为什么变、可能怎么变”。
2.3 网络分析补足“联”的证据
网络分析的价值在于把单个分子放回系统里看。常见包括 PPI 网络、相关性网络、免疫细胞关联分析。对于肿瘤研究,这一步尤其重要,因为疾病机制往往不是单基因驱动,而是网络协同变化。
实际写作时,建议明确说明:
- 网络构建来源。
- 节点和边的定义。
- 相关性阈值。
- 是否经过中心节点筛选。
这样读者才能判断网络图是否可靠,而不是只看“图是否好看”。
3. 从单图到套图的标准化流程
3.1 统一数据口径,避免后期返工
套图能不能高效完成,关键不在作图软件,而在前期规范。建议从一开始就建立统一模板,至少包含:
- 研究对象名称。
- 分组名称。
- 数据类型。
- 统计方法。
- 显著性阈值。
- 图标题和图注格式。
比如同一篇文章里,如果有的图写“Normal”,有的图写“control”,有的图写“para-tumor”,视觉上会显得不专业。统一命名,是套图转化最便宜也最有效的一步。
3.2 图形风格要保持一致
套图的高级感,主要来自一致性,而不是复杂度。建议统一以下元素:
- 字体。
- 字号。
- 配色。
- 线条粗细。
- 坐标轴样式。
- 图例位置。
如果火山图、热图、GSEA图和PPI图来自不同工具,最好在最终排版前进行统一调整。这样可以避免“每张图都像独立项目”的割裂感。
3.3 先单图复现,再批量拼图
高效做法不是一开始就追求大套图,而是先把关键单图逐个复现。通常顺序可以是:
- 差异表达图。
- 富集分析图。
- 网络图。
- 临床相关图。
- 预后相关图。
这个顺序符合论文叙事逻辑。先证明“有差异”,再解释“为什么差异”,再说明“与临床有什么关系”。图的顺序,本质上就是证据链顺序。
4. 常见图形的复现重点
4.1 火山图和热图
火山图重点看阈值。一般要说明 log2FC 和 P 值的筛选标准。热图重点看样本聚类和基因聚类是否与分组一致。两者经常一起出现,因为它们分别回答“哪些变了”和“变成什么样”。
复现时建议注意:
- 火山图标注上下调基因数量。
- 热图保留样本分组信息。
- 颜色梯度不要过度花哨。
- 图注中写清数据来源和标准化方法。
4.2 GSEA、GO、KEGG图
这类图强调统计结果和生物学解释的对应关系。GSEA 常看 NES、P 值和 FDR。GO、KEGG 则常看富集条目排序和显著性。如果结果只是“显著”,但没有说明富集到什么方向,图的价值会大幅下降。
建议在正文里保留三层信息:
- 统计显著性。
- 核心条目。
- 与疾病表型的关联。
4.3 网络图和临床图
PPI 图、免疫相关图、KM 曲线、Cox 回归图,属于“联”和“靠”的核心部分。它们决定文章是否从机制走向临床意义。尤其在肿瘤研究中,KM 和 Cox 往往是审稿人重点关注的部分。
这里要特别注意:
- 生存分析要交代事件定义。
- 分组方式要与前文一致。
- 单变量和多变量分析要区分。
- 风险比和置信区间要写完整。
5. 让套图更快完成的实操原则
5.1 先搭框架,再填图
很多人画图慢,是因为每张图都从零开始。更高效的方式是先建立整篇文章的图形框架,再逐张补齐。框架至少包括:
- 主结果图。
- 验证图。
- 机制图。
- 临床图。
- 补充图。
这样可以提前规划每张图的比例、方向和内容层级,减少重复修改。
5.2 保留可编辑源文件
做生信图时,不要只保存成图片。要保留原始数据表、统计脚本和可编辑源文件。这样后面一旦需要改分组、改阈值、改配色,就不会重新从头来过。可复现,是科研图表最重要的底线。
5.3 图注要和图面同步
图做得再好,如果图注不完整,文章质量也会被拉低。图注至少应包含:
- 数据集名称。
- 样本量。
- 分组方式。
- 统计方法。
- 显著性标记说明。
这不仅方便审稿人,也方便后续答辩和汇报。
6. AI 时代的生信作图趋势
从单图到套图的转化,正在被 AI 重塑。过去很多步骤需要人工逐个完成,现在可以通过更高效的流程实现批量分析、批量制图和批量排版。
但要注意,AI 提速不等于自动正确。统计逻辑、分组逻辑和临床解释,仍然必须由研究者自己把关。
这也是为什么系统化工具更重要。像解螺旋这样的专业平台,更适合帮助研究者把单图流程标准化,把套图制作流程模板化,减少重复劳动,把时间留给结果解释和文章打磨。
总结Conclusion
生信数据统计与作图的关键,不在于“能不能画出一张图”,而在于能不能把单图变成有逻辑、有一致性、可复现的套图 。从差异分析到富集分析,再到网络分析和临床分析,每一步都要围绕同一条证据链展开。
如果你正在做论文、课题或汇报,建议先把单图规范化,再推进套图整合。想进一步提升生信作图效率和复现质量,可以关注解螺旋,把复杂流程做成高效、稳定、可复制的研究路径。

- 引言Introduction
- 1. 为什么单图阶段最容易出问题
- 2. 统计分析如何支撑出图
- 3. 从单图到套图的标准化流程
- 4. 常见图形的复现重点
- 5. 让套图更快完成的实操原则
- 6. AI 时代的生信作图趋势
- 总结Conclusion






