6.Enformer:原图、模型逻辑与研究范式

论文题名: Effective gene expression prediction from sequence by integrating long-range interactions

期刊与年份: Nature Methods,2021。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

阅读来源说明: Nature Methods,2021;以当前 PDF 为准。

研究瓶颈怎样转化为问题

许多 enhancer 距 TSS 超过 20 kb,局部卷积模型即便有很长输入,也未必有效整合这些信息。Enformer 把序列预测的瓶颈定位到信息传递距离:为什么一个启动子的输出不能直接汇集远端元件的状态?依据设计逻辑推断,idea 是让可变距离的调控位置通过注意力通信,并用 CRISPRi 检查增加的远端信息是否有功能价值。论文没有以先测得的三维染色质接触作为必需输入,而是询问序列能否提供预测所需的规则。

输入、目标与结构

约 200 kb 原始 DNA 经卷积提取局部特征并降采样,Transformer 使用相对位置表示整合远距离信息;人和小鼠的任务头以 128 bp bin 输出多种 CAGE、可及性、TF 与组蛋白轨迹。局部卷积擅长基序识别,注意力解决远端汇总,多任务轨迹迫使表征同时解释不同调控层。训练仍依赖参考基因组实验,不是以 eQTL 或病例风险作为直接目标。变异效应可由双等位预测差及下游模型得到;因此基础轨迹的改善、因果元件排序和疾病风险是三个要分别评估的任务。

Figure 1:长上下文带来的表达预测改进

Figure 1

原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。

子图 讲什么,以及怎样理解
a Enformer 用约 200 kb 序列,以 128 bp 分辨率预测人和小鼠基因组轨迹;Transformer 将有效感受野扩展到约 100 kb 远端调控区域。
b 与 Basenji2 比较留出基因的 CAGE 表达相关性:左按实验跨基因,右按基因跨实验;Enformer 在基因总体表达和组织变化两方面均提高。
c 在 5,313 条轨迹上按四种测序类型比较预测—实测相关性;更长上下文的优势不限于 CAGE。
d CD44 区域示例展示实测及两模型预测的信号轨迹,帮助直观看出峰形和表达信号改善。

b 把按实验跨基因与按基因跨组织分开,避免普遍表达强弱掩盖组织差异。CAGE 相关从 0.81 到 0.85 是基础表达预测改善,不能解释成每个病人表达变化的准确率。c 说明收益不局限一种实验,d 是位点示例而非总体证明。正文还做注意力替换与感受野分析来支撑结构选择,因此其论点比‘Transformer 比 CNN 新’具体:远端信息确实有助于此任务。不过输入窗口外的调控仍不在模型覆盖内,组织头也只对应训练过的实验背景。

Figure 2:模型识别增强子及染色质边界

Figure 2

原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 在 HNRNPA1 位点对照 CAGE、H3K27ac、CRISPRi 增强子验证、注意力及梯度贡献;模型关注的序列与实测活性增强子对应。
b 以 CRISPRi 验证的增强子—基因联系作阳性,按距离比较 AUPRC;Enformer 贡献分数可用于排序远端调控元件。
c 比较以 TAD 边界居中与随机区域的平均注意力矩阵;边界处关注增强、跨边界关注下降,提示模型学到调控区域限制。
d 分别统计同域内、跨边界、边界位置的注意力分布;量化 c 中观察到的跨界抑制及边界关注。

a 把注意力/梯度与 CRISPRi 对照,而 b 在不同距离上用真正的功能联系评估排序,检验远端元件是否通过模型影响基因。注意力权重自身不是干预效果,梯度也可能随局部计算状态变化;外部 CRISPRi 是关键补充。c、d 中 TAD 边界附近的平均模式说明模型捕捉了与调控隔离有关的序列信息,不能据此宣称预测了任意细胞的真实三维接触。实验阳性比例和候选筛选决定 AUPRC 背景,跨数据比较必须保留分母定义。

Figure 3:eQTL 与变异效应

Figure 3

原图来源:所用 PDF 文件第 6 页,Figure 3。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 用 SLDP 比较预测等位基因效应与 GTEx eQTL 的全基因组方向一致性;多数 CAGE 样本的 Enformer 关联 Z 分数高于 Basenji2。
b 骨骼肌组织的 SLDP 对比突出与肌肉相关的 CAGE 样本,说明改善具有组织对应性。
c 在皮下脂肪重复 b 的分析,检验另一组织中的相关性改善。
d 用模型特征训练随机森林区分精细定位 eQTL 与匹配阴性;Enformer 在 48 种组织中的 47 种表现更好。
e 按变异距 TSS 分组比较 AUPRC;改善出现在多个距离区间,支持对远端效应的利用。
f rs11644125 的计算突变与 NLRC5 预测联系说明距 TSS 约 35 kb 的变异可影响表达,受影响序列匹配 SP1 基序。

a–c 用 SLDP 处理连锁相关,问全基因组预测方向是否与组织 eQTL 统计一致;这不同于逐个 SNP 的因果判定。d、e 的随机森林使用模型特征,已属于额外监督步骤,不能与完全零样本预测混称。细分 TSS 距离检查改进是不是仅来自启动子近端。f 将具体变异、基序和远端基因联系连起来,提供可验证机制候选;SP1 基序匹配并不单独证明真实结合改变或 NLRC5 为唯一靶基因。

Figure 4:饱和突变实验的验证

Figure 4

原图来源:所用 PDF 文件第 7 页,Figure 4。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 在 CAGI5 的 15 个区域比较预测变异效应与 MPRA 的相关性;分别列出无需区域再训练的方法和经过训练的方法。
b 逐区域比较 Enformer 与 CAGI5 获胜方法的相关性,显示总体预测表现改善。
c LDLR 启动子的实测与预测饱和突变图;逐碱基颜色/高度标出敏感调控序列,检验模型是否恢复真实基序效应。

饱和 MPRA 提供一个区域内大量单碱基对照,能检验模型是否恢复细粒度效应,而不是只找到活跃区域。a 区分无需该区域再训练和经过训练的方法,是公平解释性能的重要条件;b 应逐区域读,不能只报总体平均;c 的 LDLR 图说明模型如何定位敏感序列。报告构建的长度、载体和细胞背景限制外推,因此 MPRA 一致性支持局部调控能力,而远端内源效应仍需由 Figure 2 的实验补足。

我的理解与可迁移设计

我更想迁移它的验证层次:新增一个结构组件,先证明它改善相应信息问题,再用与该信息对应的干预实验验证。对 TE×AD,若认为 TE 影响远端基因,便应选择有 enhancer–gene 证据的候选,而不是拿短片段 MPRA 证明全部远端机制。16 GB 单卡更适合冻结已有模型、提取限定候选的双等位特征,再训练小头;本文完整人鼠多任务训练不是可直接照搬的资源配置。注意力或梯度适合形成假说,最终证据仍应对应具体细胞、基因和真实等位方向。

还有一个实践判断:模型只能输出训练轨迹对应的细胞环境,而不能在没有该环境标签时自动知道患者处于炎症状态。若要预测静息与炎症差异,应有真实配对功能测量,训练或校准环境条件头,并按整个位点或研究留出。长上下文可以提供远端序列信息,却不会自动生成这些缺失标签。针对 TE 区还要检查可唯一比对性及测序覆盖,避免模型从原始实验的低可检测性学出假阴性。基准应同时放入启动子近端、远端及困难阴性,这样才知道新增结构在哪类位点有效。

继续阅读与公开资源