从 FASTQ 到表达矩阵:生物信息学流程在做什么

刚接触转录组分析时,最容易被大量工具名称淹没。与其先背命令,不如先理解数据在每一步发生了什么变化。

1. FASTQ:测序仪输出的读段

FASTQ 文件通常以四行为一组记录一条 read:

1
2
3
4
@read_001
AGCTTAGCTA
+
FFFFFFFFFF

四行依次对应 read 标识、碱基序列、分隔符和质量字符。质量字符经过编码后表示每个碱基被正确识别的可信程度。

这一阶段最重要的问题不是“有多少文件”,而是:

  • 数据是单端还是双端;
  • 每个样本对应哪些文件;
  • read 长度是否一致;
  • 接头和低质量碱基是否明显;
  • 是否存在异常的碱基组成或重复序列。

2. 质控:先判断数据能不能用

质控报告是一张体检表。常看的指标包括每碱基质量、GC 分布、接头污染、重复比例和序列长度分布。

指标出现警告并不等于数据一定失败。比如高表达转录本可能自然带来较高重复率。正确做法是结合实验类型、文库构建方式和所有样本的整体分布判断。

3. 比对与定量:回答 reads 来自哪里

常见思路有两类:

  1. 将 reads 比对到参考基因组,再根据注释统计到基因或转录本;
  2. 直接对参考转录本进行快速定量。

两条路线都在解决同一件事:把海量短序列转换为每个基因或转录本的丰度估计。选择哪条路线取决于研究问题,而不是工具排行榜。

4. 表达矩阵:进入统计分析的入口

最终常见结果是一张矩阵:行是基因,列是样本,单元格是计数或丰度。

gene sample_A sample_B sample_C
gene_1 132 98 141
gene_2 0 3 1
gene_3 842 910 765

这张表还不是结论。接下来通常需要检查样本关系、过滤低表达特征、选择合适的归一化方式,并根据实验设计建立统计模型。

5. 每一步都要留下记录

一个可复现流程至少应保存:

  • 输入文件及其校验信息;
  • 参考序列和注释版本;
  • 软件版本与参数;
  • 样本信息表;
  • 每一步的质控报告;
  • 从原始输入到最终图表的脚本。

理解数据如何变化,比记住某一条命令更重要。工具会更新,但“输入是什么、转换做了什么、输出能回答什么”这三个问题一直有效。

继续阅读与公开资源