引言Introduction

单细胞数据能把“组织平均值”拆成“细胞层级差异”,但很多研究停在降维和出图,没真正回答疾病机制。单细胞聚类分析的价值,不是把细胞分成几类,而是找到异常细胞群、关键分子和可验证的病理线索。
单细胞测序数据从质控、降维、聚类到细胞注释的流程图,右侧展示不同细胞簇在UMAP图上的分布,并标注疾病相关异常细胞群。


1. 为什么单细胞聚类分析能解释疾病机制

1.1 从“平均表达”走向“细胞异质性”

传统bulk RNA测序得到的是组织内所有细胞的平均信号。它能告诉你“这个基因升高了”,却很难回答“是哪一类细胞在升高 ”。而疾病往往不是均一发生的。炎症细胞、上皮细胞、内皮细胞、胶质细胞,可能在不同阶段承担不同作用。

单细胞聚类分析解决的正是这个问题。它先根据表达谱把相似细胞聚在一起,再进一步识别细胞类型或亚群。聚类后的每个cluster,往往对应一种生物学状态,而不是简单的统计分组。 这也是单细胞聚类分析在生信研究中越来越重要的原因。

1.2 疾病机制通常隐藏在“少数异常亚群”里

很多疾病表型并不是由所有细胞共同驱动,而是由某些关键亚群主导。比如,免疫细胞中的活化亚群、成纤维细胞中的炎症亚群、神经系统中的反应性胶质细胞,都可能成为病理进展的核心。

这意味着,真正有机制价值的结果,不是“发现10个cluster”,而是识别出“哪个cluster最异常,异常到什么程度,背后受哪些基因和通路驱动”。 如果只停留在聚类数量,往往难以形成高质量结论。

1.3 聚类分析的核心是“找差异”,不是“做图”

很多初学者会把单细胞分析理解为UMAP、t-SNE和热图。实际上,这些只是展示形式。真正的重点包括:

  • 聚类是否稳定。
  • 细胞注释是否可信。
  • 疾病组与对照组在细胞组成上是否改变。
  • 关键cluster是否存在差异表达。
  • 这些差异是否能落到通路、调控网络或临床意义上。

没有后续分析支撑的聚类,只是图。 只有把聚类结果和差异分析、富集分析、细胞通讯、转录因子网络结合起来,才可能解释疾病机制。


2. 单细胞聚类分析的标准流程

2.1 质控、降维与聚类是基础

单细胞分析第一步是质控。常见指标包括每个细胞的基因数、UMI数、线粒体基因比例。随后进行标准化、找高变基因、降维,再完成聚类。

常用流程通常包括:

  1. 数据过滤,去除低质量细胞。
  2. 标准化和批次处理。
  3. 选择高变基因。
  4. PCA降维。
  5. 基于邻近图进行聚类。
  6. UMAP或t-SNE可视化。

这里要注意,聚类结果不是绝对真理,而是参数驱动的生物学假设。 分辨率过低会合并亚群,过高会制造假亚群。对医学研究来说,稳定性比“cluster数量多”更重要。

2.2 细胞注释决定后续解释的上限

聚类完成后,下一步是细胞注释。注释本质上是给cluster赋予生物学身份。常见依据是标志基因,例如免疫细胞、内皮细胞、成纤维细胞、上皮细胞、神经元或胶质细胞等。

这一步非常关键。如果注释错了,后面的差异分析、富集分析和机制推断都会偏离。 因此,单细胞聚类分析不能只依赖自动化工具,还需要结合文献和领域知识手动校正。

2.3 疾病研究中,建议把“群体变化”和“状态变化”分开看

单细胞聚类分析至少有两条主线。

  • 第一条是细胞组成变化。比如某种免疫细胞比例升高。
  • 第二条是细胞状态变化。比如同一种细胞内部出现炎症激活、应激反应或代谢重编程。

这两类变化常常同时存在,但生物学含义不同。 前者提示疾病微环境重塑,后者提示细胞功能被重编程。对于写论文来说,这也是结果部分最容易形成层次感的地方。


3. 如何从cluster中提取疾病机制

3.1 先找异常cluster,再找异常基因

疾病机制分析最常见的路径是先定位异常cluster,再在该cluster内做差异分析。这样可以避免被整体平均信号稀释。

一般可以从以下几个问题切入:

  • 疾病组某个cluster是否扩增或减少。
  • 该cluster是否高表达炎症、凋亡、增殖或迁移相关基因。
  • 该cluster是否富集某条关键通路。
  • 该cluster是否具有独特的转录调控模式。

这一步的本质,是把“细胞类型差异”转化为“机制差异”。

3.2 富集分析要和cluster背景对应

很多研究会直接对所有差异基因做GO或KEGG富集,但单细胞场景下,更建议结合cluster背景来解释。因为同一个基因在不同细胞类型中含义不同。

例如,免疫细胞中的趋化信号,可能代表炎症募集。上皮细胞中的同类信号,可能代表屏障损伤后的应激反应。内皮细胞中的血管生成通路,可能提示组织修复或异常血管重塑。

同样的通路,在不同细胞群里,机制指向并不相同。 这也是单细胞聚类分析优于bulk分析的关键原因。

3.3 进一步联合细胞通讯和调控网络

如果想把机制讲深,单细胞聚类结果通常还要继续向下拆解:

  • 细胞通讯分析,查看cluster之间是否存在配体-受体互作。
  • 转录因子分析,寻找驱动异常状态的核心调控因子。
  • 轨迹分析,判断细胞是否经历了状态转变。
  • 亚群再聚类,识别更细的功能分层。

在疾病研究中,“某个cluster异常”只是起点,“为什么异常、由谁驱动、与谁互作”才是机制闭环。


4. 单细胞聚类分析在不同疾病中的典型价值

4.1 炎症性疾病:找到主导炎症反应的细胞亚群

在炎症相关疾病中,单细胞聚类分析常用于识别免疫细胞活化亚群、炎症因子高表达亚群,以及参与组织损伤和修复的关键细胞群。

例如,在复杂炎症环境里,真正有价值的信息常常不是“免疫细胞多了”,而是哪类免疫细胞在扩增,是否伴随细胞因子、趋化因子或抗原呈递程序上调。

4.2 退行性疾病:识别反应性细胞状态

在神经退行性疾病中,单细胞聚类分析常用于区分正常稳态细胞和病理反应性细胞。胶质细胞、神经元、少突胶质细胞或内皮细胞的状态变化,往往比细胞总量变化更能反映疾病进程。

这类研究的重点常常不是“细胞有没有变少”,而是细胞是否进入了应激、炎症或修复相关程序。 这类状态差异,往往更接近疾病机制本身。

4.3 纤维化和器官损伤:锁定病理重塑来源

在纤维化或器官损伤研究中,单细胞聚类分析可以帮助识别活化成纤维细胞、损伤相关上皮细胞、异常内皮细胞等群体。它们往往承担基质沉积、炎症放大和组织重塑功能。

如果能把这些cluster和临床指标、病理评分、预后数据对应起来,论文的说服力会明显提高。 这也是生信研究从“描述性”走向“机制性”的关键一步。


5. 单细胞聚类分析常见误区

5.1 只看cluster图,不看生物学解释

很多文章图做得很漂亮,但cluster和疾病机制之间没有真正联系。这样的结果很难支撑高水平讨论。单细胞聚类分析必须回答三个问题:

  • 这个cluster是什么细胞。
  • 这个cluster为什么重要。
  • 这个cluster如何参与疾病。

5.2 过度依赖自动注释

自动注释工具可以提高效率,但不能替代人工判断。尤其是在疾病样本、组织复杂、细胞状态连续变化的情况下,自动注释可能把亚群误判为标准细胞类型。

医学背景和文献证据,仍然是单细胞注释最可靠的校验工具。

5.3 把“差异基因”直接等同于“机制基因”

差异表达只是线索,不是结论。要成为机制基因,还需要满足至少一个条件:

  • 在关键cluster中稳定高表达。
  • 与功能通路明显相关。
  • 能被上游调控网络解释。
  • 最好还能被外部数据或实验验证。

这也是E-E-A-T导向写作最重要的一点。证据链必须完整。


6. 让单细胞聚类分析真正服务于科研产出

单细胞聚类分析的最终目标,不是停在图,而是形成可投稿的逻辑链。一个更完整的框架通常是:

  1. 找到疾病相关异常cluster。
  2. 识别关键差异基因。
  3. 做功能富集和通路解释。
  4. 联合细胞通讯、转录因子或轨迹分析。
  5. 结合临床数据或外部队列验证。

这样才能把“生信结果”转化成“疾病机制”。

如果你希望把这条路径做得更高效,解螺旋 可以提供从单细胞聚类分析到结果整合的支持,帮助你把分散的cluster、基因和通路,整理成可发表、可验证的研究故事。


总结Conclusion

单细胞聚类分析的核心价值,在于解析细胞异质性并定位疾病中的关键异常亚群。它不是单纯的可视化工具,而是连接细胞组成、状态变化和分子机制的桥梁。真正有价值的结果,是能解释“哪类细胞变了、为什么变、会导致什么后果”。

对于医学生、医生和科研人员来说,掌握单细胞聚类分析,意味着你可以更精确地理解疾病发生发展过程,也更容易找到可验证的靶点和机制线索。若你正在推进相关项目,建议借助解螺旋 把单细胞聚类分析、细胞注释和机制整合一步做扎实,提升研究效率与产出质量。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料