引言Introduction

在生信差异分析里,很多人会先做PCA,却发现分组仍然“挤在一起”。这时,tSNE可视化 常被用来进一步观察样本是否真的分离,以及异质性是否被隐藏。对医学生、医生和科研人员来说,理解它的适用场景,比盲目套图更重要。
一张生信分析工作流示意图,展示PCA、tSNE、UMAP与箱线图在差异分析中的位置。

1. 先理解tSNE在生信中的角色

1.1 tSNE不是差异分析本身,而是差异结构的展示工具

tSNE,全称t-distributed Stochastic Neighbor Embedding,核心用途是把高维表达数据压缩到二维或三维空间 ,保留局部邻近关系。它适合看样本是否形成簇,是否存在混杂,是否有批次效应。

但要注意,tSNE不能替代统计检验 。它不能直接告诉你哪些基因显著上调或下调。真正的差异表达,仍要依赖标准化、建模和检验方法。tSNE更像是“可视化放大镜”。

1.2 为什么tSNE常出现在生信差异分析流程中

在转录组、单细胞、肿瘤分型等场景中,研究者往往先看整体结构,再做基因层面的差异比较。tSNE的价值主要体现在三点。

  • 观察 Normal、Tumor、Paratumor 是否自然分离。
  • 检查样本是否存在明显离群点。
  • 辅助判断数据处理是否合理,比如归一化后是否仍有批次偏移。

如果PCA提示不明显,tSNE有时能揭示更复杂的局部结构。 但它也可能因为参数设置不同而呈现差异,因此必须谨慎解释。

2. tSNE可视化前,数据准备必须规范

2.1 输入数据要先完成标准化和样本整理

tSNE对输入矩阵很敏感。一般建议使用已经完成标准化或批次校正的数据。例如表达矩阵、TPM矩阵、归一化后的count矩阵等。原始count不建议直接用于tSNE展示。

在实操中,常见步骤包括:

  1. 清空环境,避免旧对象干扰。
  2. 加载分析包。
  3. 读取表达矩阵。
  4. 整理分组信息。
  5. 按样本顺序对齐表达矩阵和分组表。

样本顺序不一致,是很多图画错的根源。 如果表达矩阵列名和分组表ID没有完全对应,图像即使画出来,也没有意义。

2.2 分组信息要准确,尤其是多队列整合时

当数据来自多个GEO或TCGA队列时,分组字段常不统一。比如一个数据集用source_name_ch1标记组织类型,另一个用characteristics_ch1.2。这时需要先人工核对样本注释,再统一成 Normal、Tumor、Paratumor 等标准组别。

在这一步中,建议重点检查:

  • 分组字段是否含有空格、大小写差异。
  • 同一队列是否存在多个注释版本。
  • 是否有样本被误分到错误组别。
  • 合并后是否保留了原始样本顺序。

tSNE图的可信度,首先取决于分组表是否可靠。

3. tSNE的典型绘图逻辑与参数理解

3.1 先降维,再结合分组上色

在R中,tSNE通常对“样本 × 特征”的矩阵进行处理。对于表达矩阵,实际使用时常要转置,使每个样本成为一行。结果得到二维坐标后,再将分组信息拼接进去,使用ggplot2绘图。

常见图形要素包括:

  • 散点,表示每个样本。
  • 颜色,表示分组。
  • 椭圆,表示组内分布范围。
  • 主题样式,提升可读性。

图中最重要的不是“好不好看”,而是“组与组是否有清晰边界”。

3.2 perplexity、随机种子和重复性要重视

tSNE有几个关键参数,其中最常被提到的是perplexity。它可以理解为对局部邻域大小的平衡设置。样本量不同,合适的值也不同。一般来说,样本较少时不宜设得过高。

另外,tSNE带有随机性。同样的数据,若不固定set.seed(),结果可能每次略有变化。 这也是它和PCA的重要区别之一。

建议你在使用tSNE时注意:

  • 固定随机种子,保证可重复。
  • 不要只试一个参数就下结论。
  • 样本量较少时,优先结合PCA一起看。
  • 不要把tSNE距离远近直接解释为生物学距离大小。

3.3 tSNE的局限性不能忽视

tSNE很强,但不是万能。它主要保留局部邻近,不强调全局结构。也就是说,图上两个簇离得远,不代表它们真实差异一定更大。反过来,两个簇靠近,也不代表完全相似。

tSNE适合辅助判断,不适合单独作为结论依据。 在论文和汇报中,最好同时给出统计检验结果,比如差异基因、箱线图、小提琴图、热图等。

4. tSNE在差异分析中的高阶应用场景

4.1 用于多队列整合后的结构检查

在GEO和TCGA联合分析中,常见问题是平台不同、批次不同、样本来源不同。此时tSNE可以帮助观察整合后的数据是否仍然被技术因素主导。

如果正常与肿瘤样本能形成相对清晰分群,说明处理流程较为合理。若样本聚类主要按队列而不是按生物学分组,则提示可能仍存在批次效应。

这一步非常关键,因为后续差异基因分析建立在分组可信的前提上。

4.2 用于异质性分析和亚群识别

在肿瘤研究中,Tumor组往往不是单一群体,而是包含多个亚型或状态。tSNE可将这些隐藏结构更直观地展示出来。尤其在单细胞转录组中,它几乎是标准可视化手段之一。

如果同一肿瘤组内部出现明显分叉,可能意味着:

  • 肿瘤异质性明显。
  • 样本中混入不同分化状态。
  • 组织来源或临床分层不同。
  • 存在技术噪音或批次偏差。

tSNE的价值,不只是在“分开正常和肿瘤”,更在于发现肿瘤内部的复杂性。

4.3 与PCA、UMAP联合使用更稳妥

在实际生信项目中,建议将三者配合使用。

  • PCA,适合快速看整体方差。
  • tSNE,适合看局部邻域和簇结构。
  • UMAP,适合在保留局部结构的同时兼顾一定全局关系。

单看一张图容易误判,三者交叉验证更可靠。 如果PCA、tSNE、UMAP结论一致,可信度更高。如果三者结果不一致,就需要回到数据预处理和分组定义重新检查。

5. tSNE图之后,如何接上真正的差异比较

5.1 先确认分组,再做基因层面的统计

tSNE只是结构展示。真正的差异分析,还需要落到基因上。常见做法包括:

  • 选定目标基因,画箱线图或小提琴图。
  • 计算组间差异,使用Wilcoxon检验或其他合适方法。
  • 对多基因结果进行FDR校正。
  • 结合火山图和热图展示整体模式。

不要把“图上分开了”直接等同于“分子机制成立了”。 图只是证据链的一部分。

5.2 结合单基因展示更利于发表与汇报

在课程中的示例里,类似SYNGR2这样的基因,可以通过箱线图或配对图展示组间表达差异。对于肿瘤与正常样本,若P值显著,还能进一步补充机制讨论。

这类图的价值在于:

  • 直观展示表达水平。
  • 支持统计学结论。
  • 与tSNE形成“整体结构+单基因验证”的组合证据。

高质量生信图,不是单张图漂亮,而是证据链完整。

5.3 常见错误是把tSNE当成终点

很多初学者会在tSNE分组分开后就停止分析。实际上,这只是起点。后面还应继续:

  1. 做差异表达分析。
  2. 做富集分析。
  3. 做PPI或网络分析。
  4. 结合临床信息验证。
  5. 必要时做外部队列验证。

这样才能把“看起来分开”变成“有统计支持、可重复、可解释”的结论。

6. 实战中如何提升tSNE图的可读性

6.1 图形细节要服务于结论

tSNE图的颜色、透明度、椭圆和图例都应服务于阅读效率。建议统一配色,避免过多颜色干扰。组别少时,双色或三色最清晰。组别多时,优先保证对比度和一致性。

可读性优化建议:

  • 使用统一主题,如theme_bw()
  • 点大小适中,避免遮挡。
  • 椭圆透明度适中。
  • 图例命名清晰,直接写Normal、Tumor、Paratumor。

6.2 图注要交代数据来源和参数

在论文、PPT或汇报中,tSNE图最好说明以下内容:

  • 数据来源,例如GEO或TCGA。
  • 标准化方式。
  • 主要参数,例如perplexity。
  • 样本分组规则。
  • 是否进行了批次校正。

没有上下文的tSNE图,信息量是不完整的。

6.3 结果解释要克制

tSNE图能展示趋势,但不能夸大。正确的表达方式是“样本在二维空间中呈现分群趋势”或“组间分离较明显”,而不是直接说“证明了机制”。后者需要更多实验和统计支撑。

总结Conclusion

tSNE可视化在生信差异分析中,最重要的作用是帮助研究者快速识别样本结构、分组趋势和潜在异质性。它适合与PCA、UMAP、箱线图、小提琴图和差异表达分析联动使用。真正专业的做法,不是只会画图,而是能判断图背后的数据是否可信。

如果你希望把tSNE可视化、分组比较、差异分析和整套生信图谱流程系统串起来,建议使用更高效的工具和课程化方案。解螺旋 可以帮助你更快完成从数据整理到图形输出的关键步骤,减少重复试错,把时间留给真正的科研问题。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料