引言Introduction

测序数据看起来“已经拿到”,但真正能不能用,往往卡在质控这一步。很多后续分析失败,不是算法问题,而是原始数据质量不过关。 对医学生、医生和科研人员来说,先把测序数据质控做好,才能避免比对偏差、差异分析失真和重复返工。
实验室测序流程示意图,展示raw data到clean data,再到比对和差异分析的流程,突出质控环节

1. 为什么测序数据质控是第一道门槛

1.1 质控决定数据能不能进入后续分析

FASTQ文件从raw data到clean data,通常要经历两个核心步骤,QC和filter。只有通过测序数据质控,数据才具备进入比对、组装、定量、差异基因分析和注释的基础。 这一步不是形式,而是分析流程的入口。

如果原始数据中接头污染、低质量碱基过多,后续分析会出现系统性误差。比如比对率下降,表达量估计偏移,甚至把技术噪音误判为生物学差异。对于不常亲自处理原始数据的课题组,这一步尤其重要。

1.2 高通量测序不等于自动可靠

现在测序平台普遍成熟,以Illumina为代表的仪器整体质量已经很高。但“平台可靠”不等于“每个样本都合格”。 样本制备、建库、上机和数据输出任何一个环节有问题,都会反映在FASTQ质控结果里。

因此,不能只看测序公司给出的结论。建议研究者自己至少做一次独立质控验证。这样能尽早发现问题,避免把错误数据带入整个项目。

2. 先读懂FASTQ文件,再谈质控

2.1 FASTQ的四行结构是质控基础

FASTQ文件每个read由四行组成,理解它,才能正确解读质控报告。

  • 第一行,以“@”开头,包含序列识别信息。
  • 第二行,是真实测序序列,如ATCG。
  • 第三行,通常是“+”。
  • 第四行,是对应每个碱基的质量值。

第二行是序列本体,第四行是质量判断核心。 如果第二行出现较多N,说明该位置测不准。N越多,数据可用性越差。

2.2 Q值是判断碱基可信度的核心指标

质控时最常见的是Q值体系。Q30通常代表准确率99.9%,Q20代表准确率99%以上。 Q值越高,说明测序误差越少。

实际分析中,最常关注的是Q30。因为它能较直观反映碱基级别的可靠性。一般来说,碱基质量图在Q30以上,属于较好的状态。若大部分碱基低于Q30,就需要警惕数据质量。

2.3 不要只盯着一个数字

FASTQ质控不是只看一个Q30就结束。还要结合:

  • 序列长度分布。
  • GC含量。
  • Adapter污染。
  • N碱基比例。
  • 序列重复水平。

其中,碱基质量仍是最核心的判断指标。 其他指标要结合样本类型和测序策略综合解释。

3. FASTQC怎么做,质控流程怎么跑

3.1 从原始文件到可分析文件

拿到测序数据后,通常先确认文件类型。很多数据会以.gz压缩包形式存在,需要先解压,再进行查看和质控。整理文件时,建议先确认目录结构,再清理不需要的临时文件,避免混淆。

常见流程是:

  1. 进入数据目录。
  2. 查看是否有SCI或SRA相关文件。
  3. 解压得到FASTQ文件。
  4. 确认文件完整。
  5. 运行FASTQC进行质控。

在进入比对之前,先完成文件整理和基础质控,是最稳妥的做法。

3.2 FASTQC命令适合批量处理

FASTQC是最常用的FASTQ质控工具之一。它支持单文件,也支持多个文件批量分析。输出一般包含HTML报告和ZIP压缩包。实际阅读时,优先看HTML报告,因为更直观。

常用参数包括:

  • -o,指定输出路径。
  • -t,指定线程数。

例如,多个样本可以通过循环命令批量处理。线程数要结合电脑配置设置,过高未必更快。一般来说,合理分配线程能明显提升运行效率。

3.3 批量质控更适合真实项目

真实项目里,样本数往往不止一个。对于成对样本、多个分组或公共数据库下载的数据,建议批量运行质控。这样能快速发现某个样本是否明显异常。

如果只有某一个样本质量显著偏低,先不要急着进入下游分析。 应先判断是测序问题、样本污染,还是文库构建异常。

4. 质控报告到底看什么

4.1 先看基本信息,再看核心质量图

FASTQC报告第一页通常会给出基本信息,包括:

  • 文件名。
  • 文件类型。
  • 编码方式。
  • 序列长度。
  • GC含量。

对于人类样本,GC含量通常在50%左右波动,轻微偏离并不一定异常。真正需要重点看的是碱基质量分布图。如果大部分碱基质量保持在Q30以上,通常说明数据较可靠。

4.2 绿色通过不代表所有项都完美

FASTQC里常见的绿色代表通过。红色或黄色提示不一定都要处理。比如:

  • sequence duplication levels,常常不通过。
  • Adapter content,有时会出现。
  • 某些长度分布项,也可能不理想。

其中,sequence duplication levels未通过在RNA-seq里并不少见。 因为某些高表达基因本来就会被重复测到。不要把所有warning都当成严重问题。

4.3 重点是找影响分析的异常

真正要警惕的是这些情况:

  • 大段低质量碱基集中在read末端。
  • N碱基比例偏高。
  • Adapter污染明显。
  • 不同样本之间质量差异过大。
  • 某个样本整体偏离其他样本。

这些问题会直接影响比对、定量和差异分析。质控的目标不是追求“全绿”,而是确保数据足够可靠。

5. 从质控到清洗,如何把raw data变成clean data

5.1 QC和filter是连续动作

测序数据质控通常分两层。第一层是QC,用来检查质量。第二层是filter,用来清理低质量片段。只有完成QC和filter,才算真正进入clean data阶段。

清洗通常会去掉:

  • 低质量序列。
  • 带有过多N的序列。
  • 接头污染序列。
  • 长度过短的无效片段。

这些过滤操作会减少噪音,但也会让可用reads数量下降。因此,必须在“保留足够数据”和“去除明显错误”之间平衡。

5.2 不同项目的过滤阈值不完全一样

不同测序平台、建库方法和研究目的,对过滤标准的要求并不完全相同。比如,单细胞、转录组和外显子测序,对read质量和长度分布的关注点就不同。

但有一点是共通的。如果基础质控不通过,后续分析再精细也难以补救。 所以清洗规则应建立在质控结果基础上,而不是先设想下游结论。

5.3 清洗后的数据才适合进入核心分析

clean data生成后,才能进入比对、组装、定量、差异表达、功能富集和注释。这个顺序不能颠倒。否则,下游结果虽然“看起来完整”,但可信度会大幅下降。

对于科研项目,建议保留原始FASTQ、质控HTML报告和清洗后的结果文件。这样便于复现,也方便投稿时回应审稿人问题。

6. 质控结果如何判断是否达标

6.1 看碱基质量是否稳定

最实用的判断标准,是看质量曲线是否稳定。如果主要碱基区域保持在Q30附近或以上,通常可以接受。 若末端明显下滑,可以考虑修剪低质量尾端。

质量曲线波动很大的样本,往往更值得进一步排查。因为这类数据在比对和定量时更容易产生噪音。

6.2 看异常样本是否需要单独处理

在TCGA或其他大队列数据中,常会遇到少数异常样本。数据评估时,除了FASTQ质控,还可以结合箱线图、密度图、PCA图和聚类图观察整体分布。

如果一个样本在多个维度都明显偏离群体,它很可能不是“正常生物学差异”,而是技术异常。 这类样本是否剔除,需要结合研究设计谨慎判断。

6.3 结合项目目标做最终决策

不同研究的容忍阈值不同。基础探索性分析和临床验证研究,对数据严格程度并不一样。关键原则是:质控结论要服务于研究问题,而不是只为了满足工具报告。

对于需要高可信度结论的项目,建议把质控标准定得更严格。对于大样本探索性研究,则更强调样本一致性和批次可控。

7. 高质量分析的最后一步,离不开专业工具和规范流程

7.1 质控不是附属步骤,而是分析起点

很多人把质控当成“跑工具、看报告”这么简单。实际上,测序数据质控决定的是整条分析链的可信度。 只要这一步做扎实,后面的比对、表达定量和差异分析会更稳。

特别是在论文写作和项目汇报中,质控结果往往也是最容易被追问的部分。数据是否干净,直接影响结果是否站得住。

7.2 规范保存报告,便于复现和交付

建议统一保存以下内容:

  • 原始FASTQ文件。
  • FASTQC HTML报告。
  • 清洗后的clean data。
  • 关键参数记录。
  • 样本异常说明。

这样做的好处很直接。后期复现更方便,团队协作更顺畅,数据交付也更专业。

7.3 用解螺旋提高质控与分析效率

如果你希望把测序数据质控、清洗和下游分析串成标准流程,解螺旋 可以帮助你更高效地完成文献学习、数据整理和方法落地。它适合需要快速上手RNA-seq和生信分析的医学生、医生和科研人员,把复杂步骤拆成可执行流程,减少试错成本。

总结Conclusion

测序数据质控不是可选项,而是高质量分析的起点。 从FASTQ结构、Q值判断,到FASTQC报告解读,再到QC和filter生成clean data,每一步都在决定后续结果是否可靠。对于科研项目来说,先把数据看懂,再进入比对和差异分析,才是稳妥路径。

如果你正在做RNA-seq或其他测序项目,建议把质控流程标准化,保留完整报告,并在团队中形成统一规范。想更高效地完成这一步,可以进一步了解解螺旋 提供的生信学习与分析支持,帮助你把测序数据质控真正做对、做稳。

解螺旋科研助手企业微信二维码,扫码添加免费领取科研资料礼包,包含AI科研提效、SCI投稿技巧、国自然基金、医学科研绘图、科研软件工具等实用资料