引言Introduction

Hi-C数据能告诉你染色质如何三维折叠,但流程长、步骤多、参数敏感。如果质控、比对、去噪和归一化做错,后面的TAD、loop和调控网络都会偏。 对医学生、医生和科研人员来说,真正难点不是“会不会画图”,而是能否稳定得到可信结果。
三维基因组结构示意图,展示原始测序数据经过质控、比对、归一化后生成接触矩阵、TAD和loop的流程图

1. Hi-C分析流程的核心逻辑

1.1 从“测序读段”到“接触信号”

Hi-C本质上是在测定空间上靠近的DNA片段。实验后得到的是大量双端测序读段。这些读段必须先经过严格清洗,才能转化为可靠的染色质接触矩阵。

标准流程通常包括以下几步:

  1. 原始数据质控。
  2. 比对到参考基因组。
  3. 过滤无效接触。
  4. 构建分辨率矩阵。
  5. 归一化与校正。
  6. 下游结构识别和生物学解释。

这个顺序不能乱。因为前一步的误差会被后一步放大。尤其是低质量比对、重复片段和自连接片段,都会直接影响矩阵稀疏度和信号可信度。

1.2 为什么Hi-C流程对参数特别敏感

Hi-C分析不是简单的“一键出图”。它是一个渐进式分析过程 。前面的数据处理会决定中间矩阵,矩阵再决定后面的TAD、A/B compartment和loop结果。

例如:

  • 过滤阈值不同,保留的有效读段数会变。
  • 分辨率不同,能看到的结构层级也不同。
  • 归一化方法不同,矩阵偏差校正结果会变。

这意味着Hi-C流程中的每个参数都可能改变最终结论。 对科研来说,这也是为什么需要保留完整的分析记录和版本信息。

2. 原始数据质控与比对

2.1 先看数据质量,再进入主流程

Hi-C原始数据进入分析前,第一步是质控。常见检查包括测序质量、接头污染、序列重复率和碱基分布异常。若这一步不过关,后面的分析可靠性会明显下降。

质控重点通常包括:

  • Q30比例。
  • reads长度分布。
  • adapter contamination。
  • duplication rate。
  • paired-end配对完整性。

如果原始数据存在明显偏差,建议先回溯建库和测序环节。 这比后面强行修图更重要。

2.2 比对与有效读段筛选

Hi-C读段比对到参考基因组后,并不是所有成对读段都能进入下游分析。需要剔除以下常见无效数据:

  • 自连接片段。
  • 近距离切割伪影。
  • 重复读段。
  • 低比对质量读段。
  • 非特异性匹配读段。

这一阶段的目标,是尽可能保留真实的空间接触信号。有效读段比例通常直接反映实验和文库质量。 若有效读段过低,后续分辨率和结构识别能力都会受限。

2.3 质量评估决定能否继续分析

很多Hi-C项目在这里就能看出问题。比如某些样本的有效接触分布异常,或在PCA/聚类中明显离群。此时应优先考虑剔除问题样本,而不是把所有样本硬做到底。

经验上,样本一致性差会比单个样本缺失造成更大的解释风险。 对临床样本尤其如此,因为批次效应和组织异质性会显著影响三维结构信号。

3. 矩阵构建、归一化与偏差校正

3.1 从接触对到接触矩阵

Hi-C分析的核心产物是接触矩阵。研究者会按固定bin大小,把染色质接触频率映射到二维矩阵中。常见分辨率包括 1 Mb、100 kb、40 kb,甚至更高。

分辨率选择遵循一个原则:
样本测序深度越高,可用分辨率越细。

如果测序深度不足,却强行使用高分辨率,矩阵会变得极度稀疏,后续TAD和loop识别会不稳定。因此,分辨率应该与测序覆盖度匹配,而不是越细越好。

3.2 归一化是Hi-C分析的关键

Hi-C矩阵会受到GC含量、片段长度、可比对性和局部覆盖度的影响。若不做归一化,不同区域的接触强度无法直接比较。

常见归一化思路包括:

  • ICE校正。
  • KR校正。
  • balanced matrix处理。
  • 距离衰减校正。

归一化的目标不是“让图更好看”,而是让矩阵更接近真实空间接触关系。 这一步做得好,才能减少技术偏差对生物学结论的干扰。

3.3 常见错误是忽略中间层变化

Hi-C流程里最容易被忽略的是中间层。很多人只看最终热图,却不看过滤后读段、标准化前后矩阵和样本间差异。

其实,中间结果一变,最终调控网络就会跟着变。 比如:

  • 某个样本过滤过严,导致有效信号不足。
  • 某个样本归一化后仍然离群。
  • 某个分辨率下TAD边界不稳定。

这些都会影响后续解释。因此,建议每一步都保留矩阵、日志和可视化结果,便于追踪问题来源。

4. 从结构域到调控网络

4.1 A/B compartment、TAD和loop的层级关系

Hi-C的下游分析通常分为三个层次:

  • A/B compartment,反映染色质开放与活跃状态。
  • TAD,反映局部拓扑结构域。
  • loop,反映远距离增强子-启动子或结构蛋白介导接触。

这三层不是彼此独立的。 compartment提供大尺度背景,TAD限定局部边界,loop则进一步连接具体调控元件。

因此,在解释基因表达变化时,不能只看一个层级。比如某个差异表达基因,可能对应compartment切换,也可能对应TAD边界改变,或特定loop增强。

4.2 如何从Hi-C走向调控网络

Hi-C本身不是“网络图”,但它可以为调控网络提供空间约束。常见做法是把染色质接触信息与以下数据整合:

  • RNA-seq表达谱。
  • ChIP-seq结合位点。
  • ATAC-seq开放染色质。
  • 已知转录因子和增强子注释。

整合后可以建立更可信的调控关系。例如:

  1. 先用Hi-C定位候选增强子-基因接触。
  2. 再用RNA-seq确认目标基因是否差异表达。
  3. 再结合ATAC-seq和ChIP-seq验证调控活性。
  4. 最终构建空间约束下的调控网络。

这类网络比单纯基于线性基因组距离的预测更符合真实生物学。 尤其在肿瘤、发育和免疫调控研究中,价值更高。

4.3 结果解释要回到生物学问题

Hi-C分析的终点不是热图,而是问题答案。你需要回答的是:

  • 哪些区域发生了结构重塑?
  • 哪些基因的调控环境被改变?
  • 这种改变是否能解释表型差异?

如果没有回到问题本身,Hi-C结果就很容易停留在“图像展示”层面。真正有价值的分析,是把三维结构变化与疾病机制、药物反应或发育过程联系起来。

5. 提高Hi-C分析可靠性的实践建议

5.1 保留完整分析链路

Hi-C项目建议保留以下记录:

  • 原始fastq。
  • 比对参数。
  • 过滤规则。
  • 分辨率设置。
  • 归一化方法。
  • 版本号和脚本。

这样做的价值很直接。后续如果结果有争议,可以快速定位问题在输入、参数还是下游模型。

5.2 优先做可重复的标准流程

对于多数科研项目,先用稳定、可复现的标准流程跑通,再讨论个性化优化,是更稳妥的路径。不要一开始就频繁调参,否则很难判断结果变化来自生物学差异还是技术波动。

标准化、质控、矩阵构建和结构识别,应该尽量自动化。 这样不仅节省时间,也能提升结果一致性。

5.3 用自动化工具降低人为误差

在实际项目中,Hi-C分析往往涉及多个软件、多个步骤和多次参数调整。手工处理很容易出错。借助成熟的自动化平台,可以把常规流程固化下来,减少重复劳动。

这里也可以考虑使用解螺旋 这类面向科研流程优化的工具,帮助你把数据整理、分析步骤和结果输出串联起来。把标准化流程自动化,能明显减少人为遗漏,提高Hi-C分析的一致性和可追溯性。 对需要高频处理数据的实验室和课题组,这一点尤其重要。

总结Conclusion

Hi-C分析流程的核心,不只是“从原始数据到图”,而是从测序读段到可信三维调控机制 。它依赖严谨的质控、准确的比对、合理的过滤、可靠的归一化,以及与转录组和表观组数据的整合。
只有把每一步做扎实,Hi-C结果才有资格进入调控网络层面的解释。

如果你正在做Hi-C项目,建议优先建立标准化、可复现、可追踪的分析链路。想进一步提高流程效率、减少手工操作、让分析更稳定,可以关注解螺旋 ,把重复性工作交给更高效的自动化流程。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料