引言Introduction
空间转录组把“位置”和“表达”同时带回来,但聚类做不好,结果很容易混成一团。对医学生、医生和科研人员来说,真正的难点不是拿到数据,而是如何把空间表达信号分成有生物学意义的区域。空间转录组聚类的核心,是把组织结构、细胞组成和空间邻域一起读懂。

1. 空间转录组聚类到底在解决什么问题
1.1 从“表达矩阵”回到“组织结构”
传统转录组会丢失空间信息。空间转录组保留了位点坐标,所以它不只是看某个基因高不高,还要看这些高表达信号在组织里是否成片出现。聚类的目的,是把相邻且表达模式相近的 spot 或区域归为一类。
这一步很关键。因为一个 spot 往往不是单细胞,而是多个细胞的混合信号。以常见平台为例,spot 直径约 55 微米,细胞直径约 10 到 50 微米。这意味着空间转录组的基础单位,通常是“细胞团”而不是单细胞。
所以,空间转录组聚类本质上是在做区域分割,而不是简单的细胞分型。
1.2 为什么生信分析不能只看聚类结果
很多初学者拿到聚类图后,第一反应是“颜色分开了,就是结果出来了”。这不够。聚类只是起点。后续还要回答三个问题。
- 这些 cluster 是否稳定。
- 这些 cluster 是否对应真实解剖结构。
- 这些 cluster 是否能解释疾病机制。
如果聚类只是在技术噪声上分组,就没有生物学价值。 因此,空间转录组分析必须和组织学、免疫染色、单细胞参考图谱联合验证。这样结果才更可信,也更容易写进高质量论文。
2. 空间转录组聚类的主流方法
2.1 基于表达相似性的传统聚类
最常见的方法,仍然是先做归一化,再基于高变基因构建降维空间,最后聚类。常用思路包括 PCA、UMAP、t-SNE 后接 K-means、Louvain 或 Leiden。
这种方法简单,适合作为第一版分析。优点是快,门槛低。缺点也明显。它主要依赖表达相似性,对空间邻近关系利用不足。
在组织结构复杂的场景里,单纯表达聚类可能把本应相邻的功能区分开,也可能把不相邻但表达相近的区域混在一起。对于肿瘤、炎症和发育组织,这种偏差尤其明显。
2.2 融合空间信息的聚类方法
为了弥补上述问题,越来越多方法把空间坐标纳入模型。思路很直接。除了比较基因表达,还比较点位之间的空间距离。表达相似,不代表一定属于同一结构;空间接近,才更可能共享局部微环境。
这类方法在空间转录组里更实用。因为组织天然具有层次结构。比如肿瘤边缘、肿瘤核心、间质区、坏死区,往往不是靠单纯表达就能准确分开的。空间约束加入后,聚类边界更平滑,也更符合病理学观察。
2.3 图模型和深度学习方法
近年来,空间转录组聚类越来越依赖图模型。做法是把 spot 当作节点,把相邻 spot 连接成图,再联合表达信息和邻接关系进行分区。
这种方法的优势是能捕捉局部组织连续性。它特别适合识别边界模糊、过渡带明显的组织区域。
深度学习方法进一步强化了这一点。它们不仅考虑局部空间邻域,还会学习更复杂的非线性模式。对于高通量数据,尤其是肿瘤异质性强、样本数较多的项目,这类方法更有潜力。但也要注意,模型越复杂,越需要稳定的参数设置和独立验证。
3. 做好空间转录组聚类的关键步骤
3.1 数据预处理决定下限
聚类结果好不好,前面的预处理占很大比重。至少要完成以下步骤。
- 质控,去掉低 UMI、低基因数和异常 spot。
- 归一化,消除测序深度差异。
- 批次校正,处理不同切片或不同患者之间的技术差异。
- 选择高变基因,减少噪声干扰。
如果前处理不规范,后面的聚类再高级,也只是放大误差。 尤其在临床样本里,切片质量、组织坏死、RNA 降解都会影响结果。
3.2 特征选择要结合组织背景
空间转录组不是单纯找“变化最大的基因”。更合理的做法,是优先保留与组织结构、免疫浸润、上皮-间质转化、代谢状态相关的特征。
如果研究肿瘤,可以重点关注细胞周期、ECM 重塑、炎症反应和免疫抑制相关基因。
如果研究神经或发育组织,则应更重视分区标志物和发育通路。
好的特征选择,不是多,而是准。 这一步会直接影响 cluster 的可解释性。
3.3 聚类数不能只靠机器自动给出
很多平台会自动输出多个 cluster,但“几个类最好”不能只看软件默认值。一般要结合以下标准判断。
- 是否与已知组织结构一致。
- 是否具有清晰的 marker gene。
- 是否在相邻切片或重复样本中可复现。
- 是否能解释病理变化。
如果 cluster 数太少,异质性会被抹平。
如果 cluster 数太多,容易过分切碎,失去宏观结构。
空间转录组聚类的目标,是找到“足够细,但不过度拆分”的区域。
4. 空间转录组聚类的生信实践要点
4.1 先看空间,再看表达
很多人习惯先做热图和降维图,再看空间图。实际上顺序最好反过来。先把 cluster 画回组织切片,看它是否符合解剖结构。然后再检查 marker 基因。
这样更容易发现问题,比如某个 cluster 是否跨越了不合理的组织边界,或者是否只是边缘效应。
空间图是第一验证,marker 是第二验证。 两者对不上,就要回头检查参数。
4.2 与单细胞参考图谱联用
由于多数 spot 不是单细胞,空间转录组常常需要单细胞转录组来辅助注释。单细胞提供细胞类型参考,空间转录组提供位置关系。两者结合后,才能从“区域”进一步推断“细胞组成”。
这也是目前很多高分文章的标准思路。先用单细胞确定亚群,再把亚群映射回空间,最后分析细胞邻域和互作。
单细胞负责“是什么”,空间转录组负责“在哪里”。 这句话很重要。
4.3 结果呈现要强调可解释性
写文章时,不要只展示聚类图。建议至少包含以下内容。
- 组织切片染色图。
- 空间聚类图。
- 关键 marker 的空间表达图。
- 与单细胞注释一致性的证据。
- 通路富集或细胞互作分析。
这套组合能明显提升论文完整度。对于医生和科研人员来说,也更容易把数据和病理现象联系起来。
5. 常见误区与修正思路
5.1 把聚类当成终点
最常见的误区,就是把聚类结果直接当结论。实际上,聚类只是“分区”。真正有价值的是分区背后的机制。
比如,某个肿瘤区域为何免疫排斥,某个间质区域为何富集成纤维细胞,某个边缘区域为何出现代谢重编程。只有把聚类和机制结合,文章才有深度。
5.2 忽略技术平台差异
不同平台的 spot 尺寸、捕获效率、分辨率不同,聚类逻辑也不同。不能把不同技术的结果简单类比。
分析前要确认平台类型、spot 密度、测序深度和样本处理方式。否则,同样的参数在不同数据上可能产生完全不同的 cluster 数量和边界。
5.3 过度依赖“漂亮图”
空间转录组很容易做出好看的图,但图好看不等于结果可靠。评估标准应该是稳定性、重复性和生物学解释力。
真正好的结果,通常能经得起多种参数、多个样本和独立验证的考验。
6. 如何把空间转录组聚类做成高质量文章
6.1 从临床问题出发
最容易出成果的,不是追热点,而是围绕明确临床问题设计分析。比如分型、预后、免疫治疗反应、药物耐受、局部侵袭模式。
空间转录组聚类的价值,在于把“病灶内部结构差异”变成可量化证据。
6.2 以“区域差异”推动“机制发现”
聚类之后,继续做差异分析和通路富集。
重点关注以下层面。
- 免疫浸润差异。
- 基质重塑差异。
- 增殖和凋亡差异。
- 代谢通路差异。
- 细胞互作差异。
只有把区域分群和功能变化串起来,空间转录组才真正完成了从图到结论的跃迁。
6.3 让分析服务于发表
对于缺乏完整生信基础的团队,最常见的问题不是“没有数据”,而是“不会把数据变成结构化结论”。这时,专业支持非常重要。
像解螺旋这样的生信服务,可以帮助完成空间转录组的聚类优化、单细胞整合、图表解读和文章逻辑梳理。把数据分析交给专业团队,能显著缩短试错周期,提高论文产出效率。
总结Conclusion
空间转录组聚类不是简单分颜色,而是把组织结构、表达模式和空间邻域整合起来。对医学生、医生和科研人员来说,真正有价值的分析,不是看见几个 cluster,而是解释这些区域为何存在、如何形成、与疾病机制有什么关系。掌握空间转录组聚类方法,是把组学数据转化为临床和科研结论的关键一步。
如果你正在推进空间转录组项目,但卡在聚类、注释和结果整合阶段,可以借助解螺旋的专业生信支持,把复杂数据快速转成可发表、可复现、可解释的研究成果。

- 引言Introduction
- 1. 空间转录组聚类到底在解决什么问题
- 2. 空间转录组聚类的主流方法
- 3. 做好空间转录组聚类的关键步骤
- 4. 空间转录组聚类的生信实践要点
- 5. 常见误区与修正思路
- 6. 如何把空间转录组聚类做成高质量文章
- 总结Conclusion






