引言Introduction

β多样性分析用于比较不同样本间菌群差异,是疾病队列研究里最常见,也最容易出错的一步。OTU表、距离矩阵、PCoA坐标、分组检验,任何一环处理不当,都会直接影响结论可信度。如果你想把“菌群差异”真正讲清楚,就必须先把β多样性分析做对。
疾病队列研究流程图,展示OTU表、距离矩阵、PCoA散点图和分组比较结果,整体风格为医学科研论文配图

1. 先理解β多样性分析到底在回答什么问题

1.1 β多样性不是“谁多谁少”,而是“谁和谁不一样”

在微生物组研究中,α多样性关注单一样本内部的丰富度和均匀度。β多样性则关注样本与样本之间的群落差异。它回答的是,病例组和对照组的菌群结构是否整体不同 。

这一步常用于疾病队列。比如肠道炎症、代谢异常、神经退行性疾病,都可能表现为群落组成偏移。此时,单看某一个菌属不够,必须用β多样性从整体层面判断分组是否分离。

1.2 从OTU到PCoA,是一条标准分析链

OTU表是起点。它记录每个样本中各OTU的丰度。接下来要把丰度转成样本间距离。常见方法包括 Bray-Curtis、Jaccard、Unweighted UniFrac、Weighted UniFrac。

得到距离矩阵后,通常用 PCoA、NMDS 或 PCA 进行降维可视化。PCoA不是结果本身,它只是把复杂距离关系投影到二维或三维空间。 真正的统计结论,还要结合置换检验、PERMANOVA 或 ANOSIM。

2. 疾病队列中,β多样性分析的标准实操流程

2.1 先确认数据层级和预处理方式

疾病队列分析最怕前处理不一致。OTU表、ASV表、物种注释表、样本分组信息,必须一一对应。样本命名要统一,缺失值要提前处理,污染样本和低测序深度样本要筛掉。

常见预处理步骤包括:

  1. 去除明显污染和低质量序列。
  2. 统一测序深度或采用合适的标准化方法。
  3. 选择分析层级,OTU、属、科或ASV。
  4. 明确距离算法是否考虑系统发育信息。

如果样本深度差异很大,却直接做距离比较,结果往往会被测序量偏差干扰。

2.2 距离矩阵选择要和研究问题匹配

不同距离指标强调的信息不同。Bray-Curtis反映丰度差异,适合看群落组成变化。Jaccard更关注有无差异,适合看定植或缺失。UniFrac引入系统发育信息,更适合解释进化关系相关的群落变化。

在疾病队列中,常见的选择逻辑是:

  • 想看总体丰度结构差异,优先 Bray-Curtis。
  • 想看菌群组成是否“换了人”,可用 Jaccard。
  • 想纳入系统发育距离,使用 UniFrac。
  • 想比较干预前后变化,可在纵向队列中重复计算距离。

不要为了“图好看”随意换距离。距离算法改变,生物学解释也会改变。

2.3 PCoA图要读懂坐标、解释度和分组趋势

PCoA图里,横轴和纵轴对应前两个主坐标。括号中的百分比是解释度,表示这两个轴能解释多少样本间差异。很多研究只看点是否分开,但这不够。

你还要看三件事:

  • 组内点是否聚集。
  • 组间是否明显分离。
  • 是否存在离群点拉偏整体结构。

如果病例组和对照组分离,但组内离散度也很大,就要小心。这可能提示个体异质性强,而不一定代表稳定的疾病特征。

3. 统计检验怎么做,才算有说服力

3.1 只看PCoA分离,不足以证明差异

PCoA是可视化工具,不是显著性检验。很多初学者会把“图上分开”直接等同于“有统计学差异”,这是不严谨的。

更规范的做法是配合:

  • PERMANOVA,用于检验组间整体差异。
  • ANOSIM,用于比较组间和组内距离差别。
  • PERMDISP,用于检验组内离散度是否不同。

如果只做PERMANOVA,不检查离散度,可能把“组内波动”误判成“组间差异”。

3.2 疾病队列里,混杂因素必须纳入设计

β多样性分析的结果很容易受年龄、性别、BMI、用药、饮食、抗生素暴露、采样时间影响。尤其是回顾性队列,临床信息越复杂,混杂越明显。

建议在设计阶段就明确:

  1. 是否做匹配。
  2. 是否分层分析。
  3. 是否进行协变量校正。
  4. 是否需要多中心分层比较。

如果样本量允许,PERMANOVA里可加入协变量,观察疾病状态是否仍然是主要解释因素。这一步决定你的结论是“相关”还是“更接近因果线索”。

3.3 纵向队列比横断面队列更容易看出真实变化

如果研究的是治疗前后、发病前后、随访转归前后,β多样性分析价值更大。因为同一受试者的基线差异会被部分抵消,更容易观察疾病进展或干预带来的群落漂移。

纵向设计中可以关注:

  • 同一患者治疗前后是否向健康状态靠近。
  • 不同时间点之间距离是否逐渐变化。
  • 疾病进展快慢是否与群落重塑幅度相关。

对于疾病队列,纵向β多样性往往比单次横断面更能体现临床意义。

4. 结果解读时,最容易踩的几个坑

4.1 把“群落差异”误写成“菌群失衡”

“失衡”是临床语境较强的词,证据要求更高。β多样性只能说明样本间整体结构不同,不能单独证明病理机制已经成立。更稳妥的表述是:

  • 病例组与对照组菌群结构存在显著差异。
  • 不同临床分层间群落分布呈分离趋势。
  • 干预前后菌群距离发生变化。

写论文时,结论要和证据强度匹配。

4.2 只报P值,不报距离和解释度

很多文章只写“P<0.05”,但没有交代使用哪种距离矩阵,也没有说明PCoA前两轴解释了多少变异。这样不利于复现,也不利于审稿人判断可靠性。

建议至少报告:

  • 距离算法。
  • 降维方法。
  • 统计检验名称。
  • P值或校正后P值。
  • 解释度。
  • 样本量和分组信息。

完整报告比单一显著性更重要。

4.3 忽略批次效应和测序平台差异

如果队列来自多个时间点或多个中心,批次效应可能比疾病效应更强。此时即便PCoA分开,也不一定是疾病导致。要尽量记录并控制:

  • 提取批次。
  • 建库批次。
  • 测序批次。
  • 分析软件版本。

对于多中心研究,最好在统计建模前做批次平衡检查。否则,β多样性图可能反映的是实验流程差异,而不是生物学差异。

5. 医学生、医生和科研人员如何把它真正做成一篇文章

5.1 一篇合格的β多样性结果,至少要回答三件事

第一,疾病组和对照组是否整体不同。
第二,这种不同是否稳定,是否被离群点或离散度驱动。
第三,临床变量是否能解释这部分差异。

这三点齐全,结果才有论文价值。若再结合差异菌、功能预测、临床评分或预后结局,文章层次会更完整。

5.2 推荐的写作表达模板

在结果部分,可以采用以下结构:

  • 基于Bray-Curtis距离进行PCoA分析。
  • 组间样本分布呈现分离趋势。
  • PERMANOVA显示组间差异具有统计学意义。
  • 进一步分层后,不同亚组间差异仍然存在。

这种写法比单纯描述“图上分开了”更符合医学论文规范。

5.3 如果数据量大,手工分析会明显拖慢进度

疾病队列越来越大,临床变量越来越多,单靠人工整理OTU表、距离矩阵、图形输出和统计检验,效率很低。尤其在多组比较、纵向随访和多维临床协变量并存时,反复跑图和改图非常耗时。

这也是为什么很多研究团队会借助标准化分析流程和自动化工具。像解螺旋 这类面向科研场景的支持体系,可以帮助研究者更快完成数据整理、统计分析和结果输出,把更多时间留给问题设计和论文打磨。对于想把β多样性分析真正做成可发表结果的人,规范流程比临时手工拼图更重要。

总结Conclusion

β多样性分析的核心,不是画一张PCoA图,而是用标准化方法回答“样本间是否真的不同”。从OTU表到距离矩阵,再到PCoA、PERMANOVA和协变量校正,每一步都决定最终结论是否可信。对于疾病队列研究,只有把距离指标、统计检验和临床解释同时做好,β多样性结果才有真正的科研价值。

如果你正在做微生物组疾病队列,想把分析流程做得更稳、更快、更适合发表,可以考虑借助解螺旋 的科研支持能力,减少重复劳动,把重点放回研究设计与结果解释上。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料