生物信息学质控报告应该怎么看

生物信息学质控报告应该怎么看文章生物信息学2026-08-12
生物信息学质控报告应该怎么看
Perry质控不是在报告里寻找绿色对勾,而是在分析开始前识别风险。一个指标是否异常,要放回具体数据类型和样本背景中解释。
先看整体,再看局部
我习惯按三个层次阅读质控结果:
- 单个样本是否完整:文件大小、read 数、质量和长度是否合理;
- 样本之间是否一致:同批样本的分布是否大体接近,有没有明显离群值;
- 异常是否影响下游问题:警告来自技术问题,还是数据本身的合理特征。
每碱基质量
测序 read 末端质量轻微下降很常见。需要关注的是下降发生得多早、影响多少碱基,以及是否在大量样本中重复出现。
不要为了得到一张“全绿”的报告而过度修剪。过度截短会损失有效信息,也可能降低后续比对或组装能力。
GC 含量
GC 分布反映序列中 G 和 C 的比例。明显偏离理论分布可能来自污染、扩增偏好、文库组成或真实的生物学富集。
判断时可以问:
- 所有样本都偏移,还是只有一个样本;
- 偏移是否与已知的建库方式一致;
- 异常样本是否在其他指标上也异常;
- 下游比对率和特征分配率是否同时受影响。
接头与过度代表序列
当插入片段短于测序长度时,read 可能读入接头。过度代表序列也可能来自接头、引物、污染序列或真实的高丰度片段。
处理之前先确认序列来源,再决定是否去除。未知序列可以先进行小规模比对或序列搜索,不要仅凭出现频率就删除。
重复率
高重复率不总是 PCR 过度扩增。目标区域测序、高表达转录本和低复杂度文库都可能产生较多重复 reads。
因此重复率应与文库类型、测序深度、复杂度曲线和样本间差异一起解释。
建立一张质控汇总表
比起逐个打开报告,更有效的方法是汇总关键指标:
| sample | raw reads | clean reads | Q30 | mapping rate | note |
|---|---|---|---|---|---|
| sample_A | 20M | 19M | 92% | 88% | normal |
| sample_B | 21M | 18M | 85% | 70% | inspect adapter |
表中的数字只是演示。真正重要的是保留判断依据:发现了什么、采取了什么处理、为什么这样处理,以及处理后结果是否改善。
质控的最终产物不是一份漂亮报告,而是一条对数据质量有证据支持的分析决策链。

