引言Introduction
在生信差异分析里,很多人会先做PCA,却发现分组仍然“挤在一起”。这时,tSNE可视化 常被用来进一步观察样本是否真的分离,以及异质性是否被隐藏。对医学生、医生和科研人员来说,理解它的适用场景,比盲目套图更重要。

1. 先理解tSNE在生信中的角色
1.1 tSNE不是差异分析本身,而是差异结构的展示工具
tSNE,全称t-distributed Stochastic Neighbor Embedding,核心用途是把高维表达数据压缩到二维或三维空间 ,保留局部邻近关系。它适合看样本是否形成簇,是否存在混杂,是否有批次效应。
但要注意,tSNE不能替代统计检验 。它不能直接告诉你哪些基因显著上调或下调。真正的差异表达,仍要依赖标准化、建模和检验方法。tSNE更像是“可视化放大镜”。
1.2 为什么tSNE常出现在生信差异分析流程中
在转录组、单细胞、肿瘤分型等场景中,研究者往往先看整体结构,再做基因层面的差异比较。tSNE的价值主要体现在三点。
- 观察 Normal、Tumor、Paratumor 是否自然分离。
- 检查样本是否存在明显离群点。
- 辅助判断数据处理是否合理,比如归一化后是否仍有批次偏移。
如果PCA提示不明显,tSNE有时能揭示更复杂的局部结构。 但它也可能因为参数设置不同而呈现差异,因此必须谨慎解释。
2. tSNE可视化前,数据准备必须规范
2.1 输入数据要先完成标准化和样本整理
tSNE对输入矩阵很敏感。一般建议使用已经完成标准化或批次校正的数据。例如表达矩阵、TPM矩阵、归一化后的count矩阵等。原始count不建议直接用于tSNE展示。
在实操中,常见步骤包括:
- 清空环境,避免旧对象干扰。
- 加载分析包。
- 读取表达矩阵。
- 整理分组信息。
- 按样本顺序对齐表达矩阵和分组表。
样本顺序不一致,是很多图画错的根源。 如果表达矩阵列名和分组表ID没有完全对应,图像即使画出来,也没有意义。
2.2 分组信息要准确,尤其是多队列整合时
当数据来自多个GEO或TCGA队列时,分组字段常不统一。比如一个数据集用source_name_ch1标记组织类型,另一个用characteristics_ch1.2。这时需要先人工核对样本注释,再统一成 Normal、Tumor、Paratumor 等标准组别。
在这一步中,建议重点检查:
- 分组字段是否含有空格、大小写差异。
- 同一队列是否存在多个注释版本。
- 是否有样本被误分到错误组别。
- 合并后是否保留了原始样本顺序。
tSNE图的可信度,首先取决于分组表是否可靠。
3. tSNE的典型绘图逻辑与参数理解
3.1 先降维,再结合分组上色
在R中,tSNE通常对“样本 × 特征”的矩阵进行处理。对于表达矩阵,实际使用时常要转置,使每个样本成为一行。结果得到二维坐标后,再将分组信息拼接进去,使用ggplot2绘图。
常见图形要素包括:
- 散点,表示每个样本。
- 颜色,表示分组。
- 椭圆,表示组内分布范围。
- 主题样式,提升可读性。
图中最重要的不是“好不好看”,而是“组与组是否有清晰边界”。
3.2 perplexity、随机种子和重复性要重视
tSNE有几个关键参数,其中最常被提到的是perplexity。它可以理解为对局部邻域大小的平衡设置。样本量不同,合适的值也不同。一般来说,样本较少时不宜设得过高。
另外,tSNE带有随机性。同样的数据,若不固定set.seed(),结果可能每次略有变化。 这也是它和PCA的重要区别之一。
建议你在使用tSNE时注意:
- 固定随机种子,保证可重复。
- 不要只试一个参数就下结论。
- 样本量较少时,优先结合PCA一起看。
- 不要把tSNE距离远近直接解释为生物学距离大小。
3.3 tSNE的局限性不能忽视
tSNE很强,但不是万能。它主要保留局部邻近,不强调全局结构。也就是说,图上两个簇离得远,不代表它们真实差异一定更大。反过来,两个簇靠近,也不代表完全相似。
tSNE适合辅助判断,不适合单独作为结论依据。 在论文和汇报中,最好同时给出统计检验结果,比如差异基因、箱线图、小提琴图、热图等。
4. tSNE在差异分析中的高阶应用场景
4.1 用于多队列整合后的结构检查
在GEO和TCGA联合分析中,常见问题是平台不同、批次不同、样本来源不同。此时tSNE可以帮助观察整合后的数据是否仍然被技术因素主导。
如果正常与肿瘤样本能形成相对清晰分群,说明处理流程较为合理。若样本聚类主要按队列而不是按生物学分组,则提示可能仍存在批次效应。
这一步非常关键,因为后续差异基因分析建立在分组可信的前提上。
4.2 用于异质性分析和亚群识别
在肿瘤研究中,Tumor组往往不是单一群体,而是包含多个亚型或状态。tSNE可将这些隐藏结构更直观地展示出来。尤其在单细胞转录组中,它几乎是标准可视化手段之一。
如果同一肿瘤组内部出现明显分叉,可能意味着:
- 肿瘤异质性明显。
- 样本中混入不同分化状态。
- 组织来源或临床分层不同。
- 存在技术噪音或批次偏差。
tSNE的价值,不只是在“分开正常和肿瘤”,更在于发现肿瘤内部的复杂性。
4.3 与PCA、UMAP联合使用更稳妥
在实际生信项目中,建议将三者配合使用。
- PCA,适合快速看整体方差。
- tSNE,适合看局部邻域和簇结构。
- UMAP,适合在保留局部结构的同时兼顾一定全局关系。
单看一张图容易误判,三者交叉验证更可靠。 如果PCA、tSNE、UMAP结论一致,可信度更高。如果三者结果不一致,就需要回到数据预处理和分组定义重新检查。
5. tSNE图之后,如何接上真正的差异比较
5.1 先确认分组,再做基因层面的统计
tSNE只是结构展示。真正的差异分析,还需要落到基因上。常见做法包括:
- 选定目标基因,画箱线图或小提琴图。
- 计算组间差异,使用Wilcoxon检验或其他合适方法。
- 对多基因结果进行FDR校正。
- 结合火山图和热图展示整体模式。
不要把“图上分开了”直接等同于“分子机制成立了”。 图只是证据链的一部分。
5.2 结合单基因展示更利于发表与汇报
在课程中的示例里,类似SYNGR2这样的基因,可以通过箱线图或配对图展示组间表达差异。对于肿瘤与正常样本,若P值显著,还能进一步补充机制讨论。
这类图的价值在于:
- 直观展示表达水平。
- 支持统计学结论。
- 与tSNE形成“整体结构+单基因验证”的组合证据。
高质量生信图,不是单张图漂亮,而是证据链完整。
5.3 常见错误是把tSNE当成终点
很多初学者会在tSNE分组分开后就停止分析。实际上,这只是起点。后面还应继续:
- 做差异表达分析。
- 做富集分析。
- 做PPI或网络分析。
- 结合临床信息验证。
- 必要时做外部队列验证。
这样才能把“看起来分开”变成“有统计支持、可重复、可解释”的结论。
6. 实战中如何提升tSNE图的可读性
6.1 图形细节要服务于结论
tSNE图的颜色、透明度、椭圆和图例都应服务于阅读效率。建议统一配色,避免过多颜色干扰。组别少时,双色或三色最清晰。组别多时,优先保证对比度和一致性。
可读性优化建议:
- 使用统一主题,如
theme_bw()。 - 点大小适中,避免遮挡。
- 椭圆透明度适中。
- 图例命名清晰,直接写Normal、Tumor、Paratumor。
6.2 图注要交代数据来源和参数
在论文、PPT或汇报中,tSNE图最好说明以下内容:
- 数据来源,例如GEO或TCGA。
- 标准化方式。
- 主要参数,例如perplexity。
- 样本分组规则。
- 是否进行了批次校正。
没有上下文的tSNE图,信息量是不完整的。
6.3 结果解释要克制
tSNE图能展示趋势,但不能夸大。正确的表达方式是“样本在二维空间中呈现分群趋势”或“组间分离较明显”,而不是直接说“证明了机制”。后者需要更多实验和统计支撑。
总结Conclusion
tSNE可视化在生信差异分析中,最重要的作用是帮助研究者快速识别样本结构、分组趋势和潜在异质性。它适合与PCA、UMAP、箱线图、小提琴图和差异表达分析联动使用。真正专业的做法,不是只会画图,而是能判断图背后的数据是否可信。
如果你希望把tSNE可视化、分组比较、差异分析和整套生信图谱流程系统串起来,建议使用更高效的工具和课程化方案。解螺旋 可以帮助你更快完成从数据整理到图形输出的关键步骤,减少重复试错,把时间留给真正的科研问题。

- 引言Introduction
- 1. 先理解tSNE在生信中的角色
- 2. tSNE可视化前,数据准备必须规范
- 3. tSNE的典型绘图逻辑与参数理解
- 4. tSNE在差异分析中的高阶应用场景
- 5. tSNE图之后,如何接上真正的差异比较
- 6. 实战中如何提升tSNE图的可读性
- 总结Conclusion






