引言Introduction

空间转录组把“位置”和“表达”同时带回来,但聚类做不好,结果很容易混成一团。对医学生、医生和科研人员来说,真正的难点不是拿到数据,而是如何把空间表达信号分成有生物学意义的区域。空间转录组聚类的核心,是把组织结构、细胞组成和空间邻域一起读懂。
一张组织切片上叠加空间点位和颜色分区的示意图,展示不同聚类区域在组织中的空间分布

1. 空间转录组聚类到底在解决什么问题

1.1 从“表达矩阵”回到“组织结构”

传统转录组会丢失空间信息。空间转录组保留了位点坐标,所以它不只是看某个基因高不高,还要看这些高表达信号在组织里是否成片出现。聚类的目的,是把相邻且表达模式相近的 spot 或区域归为一类。

这一步很关键。因为一个 spot 往往不是单细胞,而是多个细胞的混合信号。以常见平台为例,spot 直径约 55 微米,细胞直径约 10 到 50 微米。这意味着空间转录组的基础单位,通常是“细胞团”而不是单细胞。
所以,空间转录组聚类本质上是在做区域分割,而不是简单的细胞分型。

1.2 为什么生信分析不能只看聚类结果

很多初学者拿到聚类图后,第一反应是“颜色分开了,就是结果出来了”。这不够。聚类只是起点。后续还要回答三个问题。

  1. 这些 cluster 是否稳定。
  2. 这些 cluster 是否对应真实解剖结构。
  3. 这些 cluster 是否能解释疾病机制。

如果聚类只是在技术噪声上分组,就没有生物学价值。 因此,空间转录组分析必须和组织学、免疫染色、单细胞参考图谱联合验证。这样结果才更可信,也更容易写进高质量论文。

2. 空间转录组聚类的主流方法

2.1 基于表达相似性的传统聚类

最常见的方法,仍然是先做归一化,再基于高变基因构建降维空间,最后聚类。常用思路包括 PCA、UMAP、t-SNE 后接 K-means、Louvain 或 Leiden。
这种方法简单,适合作为第一版分析。优点是快,门槛低。缺点也明显。它主要依赖表达相似性,对空间邻近关系利用不足。

在组织结构复杂的场景里,单纯表达聚类可能把本应相邻的功能区分开,也可能把不相邻但表达相近的区域混在一起。对于肿瘤、炎症和发育组织,这种偏差尤其明显。

2.2 融合空间信息的聚类方法

为了弥补上述问题,越来越多方法把空间坐标纳入模型。思路很直接。除了比较基因表达,还比较点位之间的空间距离。表达相似,不代表一定属于同一结构;空间接近,才更可能共享局部微环境。

这类方法在空间转录组里更实用。因为组织天然具有层次结构。比如肿瘤边缘、肿瘤核心、间质区、坏死区,往往不是靠单纯表达就能准确分开的。空间约束加入后,聚类边界更平滑,也更符合病理学观察。

2.3 图模型和深度学习方法

近年来,空间转录组聚类越来越依赖图模型。做法是把 spot 当作节点,把相邻 spot 连接成图,再联合表达信息和邻接关系进行分区。
这种方法的优势是能捕捉局部组织连续性。它特别适合识别边界模糊、过渡带明显的组织区域。

深度学习方法进一步强化了这一点。它们不仅考虑局部空间邻域,还会学习更复杂的非线性模式。对于高通量数据,尤其是肿瘤异质性强、样本数较多的项目,这类方法更有潜力。但也要注意,模型越复杂,越需要稳定的参数设置和独立验证。

3. 做好空间转录组聚类的关键步骤

3.1 数据预处理决定下限

聚类结果好不好,前面的预处理占很大比重。至少要完成以下步骤。

  • 质控,去掉低 UMI、低基因数和异常 spot。
  • 归一化,消除测序深度差异。
  • 批次校正,处理不同切片或不同患者之间的技术差异。
  • 选择高变基因,减少噪声干扰。

如果前处理不规范,后面的聚类再高级,也只是放大误差。 尤其在临床样本里,切片质量、组织坏死、RNA 降解都会影响结果。

3.2 特征选择要结合组织背景

空间转录组不是单纯找“变化最大的基因”。更合理的做法,是优先保留与组织结构、免疫浸润、上皮-间质转化、代谢状态相关的特征。
如果研究肿瘤,可以重点关注细胞周期、ECM 重塑、炎症反应和免疫抑制相关基因。
如果研究神经或发育组织,则应更重视分区标志物和发育通路。

好的特征选择,不是多,而是准。 这一步会直接影响 cluster 的可解释性。

3.3 聚类数不能只靠机器自动给出

很多平台会自动输出多个 cluster,但“几个类最好”不能只看软件默认值。一般要结合以下标准判断。

  1. 是否与已知组织结构一致。
  2. 是否具有清晰的 marker gene。
  3. 是否在相邻切片或重复样本中可复现。
  4. 是否能解释病理变化。

如果 cluster 数太少,异质性会被抹平。
如果 cluster 数太多,容易过分切碎,失去宏观结构。
空间转录组聚类的目标,是找到“足够细,但不过度拆分”的区域。

4. 空间转录组聚类的生信实践要点

4.1 先看空间,再看表达

很多人习惯先做热图和降维图,再看空间图。实际上顺序最好反过来。先把 cluster 画回组织切片,看它是否符合解剖结构。然后再检查 marker 基因。
这样更容易发现问题,比如某个 cluster 是否跨越了不合理的组织边界,或者是否只是边缘效应。

空间图是第一验证,marker 是第二验证。 两者对不上,就要回头检查参数。

4.2 与单细胞参考图谱联用

由于多数 spot 不是单细胞,空间转录组常常需要单细胞转录组来辅助注释。单细胞提供细胞类型参考,空间转录组提供位置关系。两者结合后,才能从“区域”进一步推断“细胞组成”。
这也是目前很多高分文章的标准思路。先用单细胞确定亚群,再把亚群映射回空间,最后分析细胞邻域和互作。

单细胞负责“是什么”,空间转录组负责“在哪里”。 这句话很重要。

4.3 结果呈现要强调可解释性

写文章时,不要只展示聚类图。建议至少包含以下内容。

  • 组织切片染色图。
  • 空间聚类图。
  • 关键 marker 的空间表达图。
  • 与单细胞注释一致性的证据。
  • 通路富集或细胞互作分析。

这套组合能明显提升论文完整度。对于医生和科研人员来说,也更容易把数据和病理现象联系起来。

5. 常见误区与修正思路

5.1 把聚类当成终点

最常见的误区,就是把聚类结果直接当结论。实际上,聚类只是“分区”。真正有价值的是分区背后的机制。
比如,某个肿瘤区域为何免疫排斥,某个间质区域为何富集成纤维细胞,某个边缘区域为何出现代谢重编程。只有把聚类和机制结合,文章才有深度。

5.2 忽略技术平台差异

不同平台的 spot 尺寸、捕获效率、分辨率不同,聚类逻辑也不同。不能把不同技术的结果简单类比。
分析前要确认平台类型、spot 密度、测序深度和样本处理方式。否则,同样的参数在不同数据上可能产生完全不同的 cluster 数量和边界。

5.3 过度依赖“漂亮图”

空间转录组很容易做出好看的图,但图好看不等于结果可靠。评估标准应该是稳定性、重复性和生物学解释力。
真正好的结果,通常能经得起多种参数、多个样本和独立验证的考验。

6. 如何把空间转录组聚类做成高质量文章

6.1 从临床问题出发

最容易出成果的,不是追热点,而是围绕明确临床问题设计分析。比如分型、预后、免疫治疗反应、药物耐受、局部侵袭模式。
空间转录组聚类的价值,在于把“病灶内部结构差异”变成可量化证据。

6.2 以“区域差异”推动“机制发现”

聚类之后,继续做差异分析和通路富集。
重点关注以下层面。

  • 免疫浸润差异。
  • 基质重塑差异。
  • 增殖和凋亡差异。
  • 代谢通路差异。
  • 细胞互作差异。

只有把区域分群和功能变化串起来,空间转录组才真正完成了从图到结论的跃迁。

6.3 让分析服务于发表

对于缺乏完整生信基础的团队,最常见的问题不是“没有数据”,而是“不会把数据变成结构化结论”。这时,专业支持非常重要。
像解螺旋这样的生信服务,可以帮助完成空间转录组的聚类优化、单细胞整合、图表解读和文章逻辑梳理。把数据分析交给专业团队,能显著缩短试错周期,提高论文产出效率。

总结Conclusion

空间转录组聚类不是简单分颜色,而是把组织结构、表达模式和空间邻域整合起来。对医学生、医生和科研人员来说,真正有价值的分析,不是看见几个 cluster,而是解释这些区域为何存在、如何形成、与疾病机制有什么关系。掌握空间转录组聚类方法,是把组学数据转化为临床和科研结论的关键一步。

如果你正在推进空间转录组项目,但卡在聚类、注释和结果整合阶段,可以借助解螺旋的专业生信支持,把复杂数据快速转成可发表、可复现、可解释的研究成果。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料