引言Introduction
Hi-C数据能告诉你染色质如何三维折叠,但流程长、步骤多、参数敏感。如果质控、比对、去噪和归一化做错,后面的TAD、loop和调控网络都会偏。 对医学生、医生和科研人员来说,真正难点不是“会不会画图”,而是能否稳定得到可信结果。

1. Hi-C分析流程的核心逻辑
1.1 从“测序读段”到“接触信号”
Hi-C本质上是在测定空间上靠近的DNA片段。实验后得到的是大量双端测序读段。这些读段必须先经过严格清洗,才能转化为可靠的染色质接触矩阵。
标准流程通常包括以下几步:
- 原始数据质控。
- 比对到参考基因组。
- 过滤无效接触。
- 构建分辨率矩阵。
- 归一化与校正。
- 下游结构识别和生物学解释。
这个顺序不能乱。因为前一步的误差会被后一步放大。尤其是低质量比对、重复片段和自连接片段,都会直接影响矩阵稀疏度和信号可信度。
1.2 为什么Hi-C流程对参数特别敏感
Hi-C分析不是简单的“一键出图”。它是一个渐进式分析过程 。前面的数据处理会决定中间矩阵,矩阵再决定后面的TAD、A/B compartment和loop结果。
例如:
- 过滤阈值不同,保留的有效读段数会变。
- 分辨率不同,能看到的结构层级也不同。
- 归一化方法不同,矩阵偏差校正结果会变。
这意味着Hi-C流程中的每个参数都可能改变最终结论。 对科研来说,这也是为什么需要保留完整的分析记录和版本信息。
2. 原始数据质控与比对
2.1 先看数据质量,再进入主流程
Hi-C原始数据进入分析前,第一步是质控。常见检查包括测序质量、接头污染、序列重复率和碱基分布异常。若这一步不过关,后面的分析可靠性会明显下降。
质控重点通常包括:
- Q30比例。
- reads长度分布。
- adapter contamination。
- duplication rate。
- paired-end配对完整性。
如果原始数据存在明显偏差,建议先回溯建库和测序环节。 这比后面强行修图更重要。
2.2 比对与有效读段筛选
Hi-C读段比对到参考基因组后,并不是所有成对读段都能进入下游分析。需要剔除以下常见无效数据:
- 自连接片段。
- 近距离切割伪影。
- 重复读段。
- 低比对质量读段。
- 非特异性匹配读段。
这一阶段的目标,是尽可能保留真实的空间接触信号。有效读段比例通常直接反映实验和文库质量。 若有效读段过低,后续分辨率和结构识别能力都会受限。
2.3 质量评估决定能否继续分析
很多Hi-C项目在这里就能看出问题。比如某些样本的有效接触分布异常,或在PCA/聚类中明显离群。此时应优先考虑剔除问题样本,而不是把所有样本硬做到底。
经验上,样本一致性差会比单个样本缺失造成更大的解释风险。 对临床样本尤其如此,因为批次效应和组织异质性会显著影响三维结构信号。
3. 矩阵构建、归一化与偏差校正
3.1 从接触对到接触矩阵
Hi-C分析的核心产物是接触矩阵。研究者会按固定bin大小,把染色质接触频率映射到二维矩阵中。常见分辨率包括 1 Mb、100 kb、40 kb,甚至更高。
分辨率选择遵循一个原则:
样本测序深度越高,可用分辨率越细。
如果测序深度不足,却强行使用高分辨率,矩阵会变得极度稀疏,后续TAD和loop识别会不稳定。因此,分辨率应该与测序覆盖度匹配,而不是越细越好。
3.2 归一化是Hi-C分析的关键
Hi-C矩阵会受到GC含量、片段长度、可比对性和局部覆盖度的影响。若不做归一化,不同区域的接触强度无法直接比较。
常见归一化思路包括:
- ICE校正。
- KR校正。
- balanced matrix处理。
- 距离衰减校正。
归一化的目标不是“让图更好看”,而是让矩阵更接近真实空间接触关系。 这一步做得好,才能减少技术偏差对生物学结论的干扰。
3.3 常见错误是忽略中间层变化
Hi-C流程里最容易被忽略的是中间层。很多人只看最终热图,却不看过滤后读段、标准化前后矩阵和样本间差异。
其实,中间结果一变,最终调控网络就会跟着变。 比如:
- 某个样本过滤过严,导致有效信号不足。
- 某个样本归一化后仍然离群。
- 某个分辨率下TAD边界不稳定。
这些都会影响后续解释。因此,建议每一步都保留矩阵、日志和可视化结果,便于追踪问题来源。
4. 从结构域到调控网络
4.1 A/B compartment、TAD和loop的层级关系
Hi-C的下游分析通常分为三个层次:
- A/B compartment,反映染色质开放与活跃状态。
- TAD,反映局部拓扑结构域。
- loop,反映远距离增强子-启动子或结构蛋白介导接触。
这三层不是彼此独立的。 compartment提供大尺度背景,TAD限定局部边界,loop则进一步连接具体调控元件。
因此,在解释基因表达变化时,不能只看一个层级。比如某个差异表达基因,可能对应compartment切换,也可能对应TAD边界改变,或特定loop增强。
4.2 如何从Hi-C走向调控网络
Hi-C本身不是“网络图”,但它可以为调控网络提供空间约束。常见做法是把染色质接触信息与以下数据整合:
- RNA-seq表达谱。
- ChIP-seq结合位点。
- ATAC-seq开放染色质。
- 已知转录因子和增强子注释。
整合后可以建立更可信的调控关系。例如:
- 先用Hi-C定位候选增强子-基因接触。
- 再用RNA-seq确认目标基因是否差异表达。
- 再结合ATAC-seq和ChIP-seq验证调控活性。
- 最终构建空间约束下的调控网络。
这类网络比单纯基于线性基因组距离的预测更符合真实生物学。 尤其在肿瘤、发育和免疫调控研究中,价值更高。
4.3 结果解释要回到生物学问题
Hi-C分析的终点不是热图,而是问题答案。你需要回答的是:
- 哪些区域发生了结构重塑?
- 哪些基因的调控环境被改变?
- 这种改变是否能解释表型差异?
如果没有回到问题本身,Hi-C结果就很容易停留在“图像展示”层面。真正有价值的分析,是把三维结构变化与疾病机制、药物反应或发育过程联系起来。
5. 提高Hi-C分析可靠性的实践建议
5.1 保留完整分析链路
Hi-C项目建议保留以下记录:
- 原始fastq。
- 比对参数。
- 过滤规则。
- 分辨率设置。
- 归一化方法。
- 版本号和脚本。
这样做的价值很直接。后续如果结果有争议,可以快速定位问题在输入、参数还是下游模型。
5.2 优先做可重复的标准流程
对于多数科研项目,先用稳定、可复现的标准流程跑通,再讨论个性化优化,是更稳妥的路径。不要一开始就频繁调参,否则很难判断结果变化来自生物学差异还是技术波动。
标准化、质控、矩阵构建和结构识别,应该尽量自动化。 这样不仅节省时间,也能提升结果一致性。
5.3 用自动化工具降低人为误差
在实际项目中,Hi-C分析往往涉及多个软件、多个步骤和多次参数调整。手工处理很容易出错。借助成熟的自动化平台,可以把常规流程固化下来,减少重复劳动。
这里也可以考虑使用解螺旋 这类面向科研流程优化的工具,帮助你把数据整理、分析步骤和结果输出串联起来。把标准化流程自动化,能明显减少人为遗漏,提高Hi-C分析的一致性和可追溯性。 对需要高频处理数据的实验室和课题组,这一点尤其重要。
总结Conclusion
Hi-C分析流程的核心,不只是“从原始数据到图”,而是从测序读段到可信三维调控机制 。它依赖严谨的质控、准确的比对、合理的过滤、可靠的归一化,以及与转录组和表观组数据的整合。
只有把每一步做扎实,Hi-C结果才有资格进入调控网络层面的解释。
如果你正在做Hi-C项目,建议优先建立标准化、可复现、可追踪的分析链路。想进一步提高流程效率、减少手工操作、让分析更稳定,可以关注解螺旋 ,把重复性工作交给更高效的自动化流程。

- 引言Introduction
- 1. Hi-C分析流程的核心逻辑
- 2. 原始数据质控与比对
- 3. 矩阵构建、归一化与偏差校正
- 4. 从结构域到调控网络
- 5. 提高Hi-C分析可靠性的实践建议
- 总结Conclusion






