引言Introduction
基因表达量标准化 是转录组分析的第一道门槛。原始 counts 直接比较,容易被测序深度、样本组成和低表达基因干扰,导致差异分析偏移。对医学生、医生和科研人员来说,先把标准化做对,后面的 fold change 和显著性检验才更可信。

1. 为什么必须做基因表达量标准化
1.1 原始counts不能直接比较
RNA-seq差异分析通常输入的是未处理的原始 counts。不同样本的测序深度不同,library size 也不同。若不进行基因表达量标准化 ,同一个基因在两个样本中的 counts 差异,可能只是“测得更多”,不一定是真实生物学差异。
此外,样本组成偏倚也会影响结果。少数高表达基因会拉高总 counts,掩盖其他基因的真实变化。因此,标准化的目标不是“美化数据”,而是尽量消除技术偏差,让样本间可比。
1.2 标准化的核心输出是 scaling factor
在edgeR等方法中,标准化最终要得到每个样本的 scaling factor。它的作用很直接。先把原始 counts 按样本间可比的尺度调整,再用于 fold change 计算和统计检验。
这一步做得好,后续得到的 p 值和校正后 p 值才更稳健。
2. 常用的基因表达量标准化策略
2.1 edgeR的标准化思路
edgeR与DESeq2都处理原始 counts,但标准化路径不同。edgeR会先去掉所有样本中表达为0的基因,再选择一个 reference sample。这个 reference sample 的 scaling factor 被设为1,其余样本围绕它计算。
参考样本的选择并不是随机的。edgeR倾向于选表达分布更均衡的样本。通常会先计算每个样本的总 counts,再除以总 counts 消除 library size 影响,然后比较各样本的75%分位值,选择最接近平均值的样本作为 reference sample。
2.2 为什么要选 reference sample
如果 reference sample 本身分布极不均一,就会影响其他样本的标准化因子计算。换句话说,reference sample 不是“随便挑一个样本”,而是要尽量代表整体表达水平。
这也是edgeR标准化和很多初学者直觉不同的地方。选错参考样本,会让后续 scaling factor 失真。
2.3 不同样本的基因集合可以不同
edgeR在计算每个样本的 scaling factor 时,并不是用同一批基因。它会针对 reference sample 和某个目标样本,分别筛选可用于计算的基因列表,再求加权平均值。这个设计的目的,是尽量保留稳定表达的基因,减少极端高表达或低表达基因的干扰。
3. edgeR标准化的关键步骤
3.1 先去除无表达基因
第一步是移除在所有样本中都为0的基因。这类基因没有信息量,保留它们只会增加噪音。
这是最基础、也最必要的过滤。
3.2 通过分位数选择参考样本
edgeR会先对每个样本做总 counts 归一,再找出每个样本的75%分位值。然后计算所有样本75%分位值的平均值,选择最接近平均值的样本作为 reference sample。
这一做法的意义在于,它偏向选择“整体表达更居中”的样本,而不是表达偏高或偏低的异常样本。
3.3 用稳定基因计算 scaling factor
在计算目标样本的 scaling factor 时,edgeR会先排除只在单一样本中表达的基因,因为这类基因可能出现无穷大或负无穷大的 log 比值。随后,再剔除表达过高或过低的偏离基因,只保留中间稳定区域的基因来估计标准化因子。
最终使用的是加权平均值,而不是简单平均值。
原因很清楚。高表达基因对标准化更稳定,低表达基因波动更大,权重应更低。最后再用 2 的加权平均值幂次,得到该样本的 scaling factor。
3.4 再做中心归一化
edgeR得到初步 scaling factor 后,还会进行中心归一化。这样做不会改变分析结论,只是让整体因子分布在数学上更“居中”。
这一步对最终差异分析没有本质影响,但能让标准化因子的表示更规范。
4. 标准化后的数据如何进入差异分析
4.1 标准化不是终点
标准化完成后,才能进入 fold change 计算、显著性检验和多重假设校正。也就是说,标准化是差异分析可信性的前提,不是附加步骤。
如果输入数据本身偏差很大,即使统计方法正确,结果也可能不稳。尤其在样本量较小、组间差异复杂时,标准化质量会直接影响候选基因筛选。
4.2 与过滤标准密切相关
标准化前通常还要做基因过滤。常见原则包括:
- 去掉全部为0的基因。
- 保留至少一半样本中表达量大于0的基因。
- 或保留中位数大于0的基因。
这些过滤规则没有唯一最优解,但目标一致。减少低表达和无信息基因对标准化和差异分析的干扰。
5. 做基因表达量标准化时最容易踩的坑
5.1 不要把不同流程的数据直接混合
TCGA和GTEx等数据来源的处理流程不同,直接拼接原始表达矩阵容易引入批次效应。更稳妥的做法是使用统一处理后的数据,再考虑后续批次校正。
如果必须合并不同来源数据,应先确认样本注释、ID对应关系和处理版本一致。否则,标准化做得再好,也可能抵不过前端数据不一致。
5.2 不要忽视样本过滤
在TCGA数据中,样本类型编码非常重要。比如 01 常代表原发肿瘤,11 常代表正常组织。若样本注释没有看清,分组就可能错位,后续标准化和差异分析都会偏。
标准化不能修复错误分组。
这是很多初学者最容易忽略的地方。
5.3 不能只看一个指标
差异分析不是只盯着 p 值或 logFC。标准化是否合理,还要结合:
- 样本分布是否异常。
- 过滤后基因数是否合理。
- 参考样本是否稳定。
- 校正后 p 值是否控制得当。
如果筛选过严,可能只剩很少基因;如果过宽,又会引入大量噪音。标准化前后的每一步都要连贯。
5.4 不同软件的标准化方法不同
edgeR、DESeq2、limma-voom 的处理逻辑不完全一样。虽然目标都是消除技术偏差,但具体实现不同。
分析前应先明确你使用的是哪种方法,再决定输入格式、过滤阈值和后续统计流程。
6. 实操建议:把标准化做稳的3个步骤
6.1 先做基础清洗
先去掉全0基因,再检查样本注释和分组信息。这个阶段不要急着上模型。基础清洗做不好,后面很难补救。
6.2 再检查样本分布
看每个样本的 counts 分布是否明显失衡,是否存在离群值。若某个样本表达分布非常不均一,就不适合作为 reference sample。
这一步能减少标准化因子被异常样本拉偏。
6.3 最后再进入正式分析
完成标准化后,再做 fold change、p值和FDR校正。对于医学生和科研人员来说,建议把这一流程固定下来,避免每个项目都从零开始试错。
稳定流程比“临时灵感”更重要。
7. 如何借助工具提高效率
如果你希望把基因表达量标准化 流程做得更规范,可以优先使用成熟的分析框架,并固定过滤、分组、标准化和差异分析的顺序。对于需要快速完成课题设计、论文图表和转录组分析的研究者,解螺旋 这类生信与科研支持平台,可以帮助你更快完成数据清洗、标准化和结果筛选,减少重复试错,把精力集中到科研问题本身。
总结Conclusion
基因表达量标准化的本质,是让不同样本站在同一尺度上比较。 先过滤无信息基因,再选稳健参考样本,再计算 scaling factor,最后进入差异分析,这是更可靠的流程。
对医学生、医生和科研人员来说,标准化不是形式步骤,而是结果可信度的基础。若你希望更高效地完成转录组分析,可以结合成熟工具和解螺旋 的科研支持服务,减少踩坑,提升分析质量。

- 引言Introduction
- 1. 为什么必须做基因表达量标准化
- 2. 常用的基因表达量标准化策略
- 3. edgeR标准化的关键步骤
- 4. 标准化后的数据如何进入差异分析
- 5. 做基因表达量标准化时最容易踩的坑
- 6. 实操建议:把标准化做稳的3个步骤
- 7. 如何借助工具提高效率
- 总结Conclusion






