生物信息学质控报告应该怎么看

质控不是在报告里寻找绿色对勾,而是在分析开始前识别风险。一个指标是否异常,要放回具体数据类型和样本背景中解释。

先看整体,再看局部

我习惯按三个层次阅读质控结果:

  1. 单个样本是否完整:文件大小、read 数、质量和长度是否合理;
  2. 样本之间是否一致:同批样本的分布是否大体接近,有没有明显离群值;
  3. 异常是否影响下游问题:警告来自技术问题,还是数据本身的合理特征。

每碱基质量

测序 read 末端质量轻微下降很常见。需要关注的是下降发生得多早、影响多少碱基,以及是否在大量样本中重复出现。

不要为了得到一张“全绿”的报告而过度修剪。过度截短会损失有效信息,也可能降低后续比对或组装能力。

GC 含量

GC 分布反映序列中 G 和 C 的比例。明显偏离理论分布可能来自污染、扩增偏好、文库组成或真实的生物学富集。

判断时可以问:

  • 所有样本都偏移,还是只有一个样本;
  • 偏移是否与已知的建库方式一致;
  • 异常样本是否在其他指标上也异常;
  • 下游比对率和特征分配率是否同时受影响。

接头与过度代表序列

当插入片段短于测序长度时,read 可能读入接头。过度代表序列也可能来自接头、引物、污染序列或真实的高丰度片段。

处理之前先确认序列来源,再决定是否去除。未知序列可以先进行小规模比对或序列搜索,不要仅凭出现频率就删除。

重复率

高重复率不总是 PCR 过度扩增。目标区域测序、高表达转录本和低复杂度文库都可能产生较多重复 reads。

因此重复率应与文库类型、测序深度、复杂度曲线和样本间差异一起解释。

建立一张质控汇总表

比起逐个打开报告,更有效的方法是汇总关键指标:

sample raw reads clean reads Q30 mapping rate note
sample_A 20M 19M 92% 88% normal
sample_B 21M 18M 85% 70% inspect adapter

表中的数字只是演示。真正重要的是保留判断依据:发现了什么、采取了什么处理、为什么这样处理,以及处理后结果是否改善。

质控的最终产物不是一份漂亮报告,而是一条对数据质量有证据支持的分析决策链。

继续阅读与公开资源