70.Basenji:原图、模型逻辑与研究范式

70.Basenji:原图、模型逻辑与研究范式
Perry论文题名: Sequential regulatory activity prediction across chromosomes with convolutional neural networks
期刊与年份: Genome Research,2018。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
本篇问题: 更长序列上下文能否支持连续调控轨迹、基因表达及远端变异效应预测?
从局部开放到沿染色体的功能轨道
Basenji 接续 Basset,处理两个不足:把连续测序信号压成峰有或无,会丢掉表达强弱;短片段也看不到较远调控元件。作者因此用长 DNA 同时预测 DNase、组蛋白 ChIP 和 CAGE 计数轨道,再从 TSS 输出构造基因表达和变异效应。这是把局部分类推进为长程多任务回归的研究范式。
我的推测是,研究从‘非编码变异通常通过表达中间表型作用’这个链条出发:先把表达当作可测的桥梁,再增加远端信息,让模型产生变异—基因—细胞的三维解释。此处是根据正文的论证重建。输入 131,072 bp one-hot DNA,经卷积池化到 128 bp bins,再用密集连接的膨胀卷积扩大上下文,输出 4,229 个实验轨道,使用 Poisson 回归损失。输入长度不等于每个输出的有效感受野;本文七层膨胀卷积约覆盖 32 kb,远处超出这一范围的调控仍不可见。
作者重新处理原始 reads,包括多重比对分配和 GC 偏好校正,而非直接沿用公开峰表。这个细节与重复序列研究直接相关:预测计数需要知道没有唯一比对信号是生物沉默还是处理策略造成的缺失。但算法分配多重 reads 仍依赖假设,不是为每个重复拷贝创造了独立实测证据。
Figure 1:Basenji序列到连续调控轨迹架构
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
图中标出的增强子、启动子和 CTCF 是为了讲结构而画的示意,不是这一输入的真实注释结果。卷积模块识别局部信号,膨胀卷积用逐步增大的间隔共享信息,密集连接保留早期表示,最后每个 bin 输出多种实验计数。这种结构可以跨越局部模式,但没有直接输入三维接触图,跨距离整合也不等于学到了全部真实染色质环。
Poisson 目标将模型输出对齐到覆盖计数,比峰分类保留更多强弱变化。128 bp 汇总适合区域轨道,却无法直接解析单碱基切割足迹。后文用单碱基替换询问输出变化是另一个层面:输入可以改到一个碱基,输出仍是粗 bin 的实验信号。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| 全图(无字母) | 卷积/池化形成128bp表示,膨胀卷积跨远距离整合信息,输出沿序列的实验计数并用Poisson损失训练;图中基因功能标记用于说明架构。 |
Figure 2:多种表观与转录轨迹预测
原图来源:所用 PDF 文件第 3 页,Figure 2。点击图片可查看原图。
A 的实测与预测轨道展示模型恢复强启动子和强远端元件的能力,也保留弱信号漏报与误报;不能只看醒目的峰。B 按实验类型比较 R²,尖锐活性标记比广域沉默标记更容易预测,说明不同数据对局部序列的依赖程度与测量质量不同。C 的低信号高估、高信号低估提示模型压缩动态范围,这会影响后面突变效应的量级。
D 将实验重复相关作为参照,预测有时比重复之间更一致,作者解释为对噪声的平滑。它不表示模型比真实实验更了解所有生物学差异:模型可能保留可从序列学习的共有成分,同时去掉随机噪声和部分真实条件变化。两个实验重复也可能包含技术与生物差异。应将这种现象理解为在这些轨道上的统计一致性,而不是宣称模拟可替代实验。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | AKT2位点各实验轨迹对预测轨迹,模型识别启动子和强远端元件,较弱元件存在漏报/误报。 |
| B | 按实验类型比较解释方差R²分布,展示尖峰信号较易预测而广域染色质标记较难。 |
| C | 代表性CD34细胞DNase实验128bp信号对预测散点,展示动态范围及局部误差。 |
| D | 实验重复间相关对模型预测相关,说明预测在这些数据中的平均一致性可超过实验重复一致性。 |
Figure 3:细胞类型特异的表达预测
原图来源:所用 PDF 文件第 4 页,Figure 3。点击图片可查看原图。
A、B 的高表达相关是在同一种细胞中跨基因比较,测序深度越高往往越好;这不能自动推出模型能预测同一基因在不同人的遗传表达差异。C 用聚类一致性检查细胞间结构,调整 Rand 指数显著高于随机,但绝对一致性仍有限,显著并非完整复原。D 将基因按跨细胞相关分位展示,故意包括表现较差的例子。
这里表达来自 TSS 的 CAGE,并按一个基因不同起始位点汇总,不是完整 RNA-seq 丰度或转录本剪接。变动大的细胞特异基因更难、动态范围容易收缩,说明长序列与多任务还未解决所有调控。对 AD 研究,若关注某个细胞状态程序,应单独测量它在相关细胞中的预测能力,而不能只引用所有基因平均相关。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 各CAGE数据集的跨基因表达相关对测序深度,检验数据质量与模型表现的关系。 |
| B | 代表性动脉内皮细胞真实与预测表达散点,展示单个类型的性能。 |
| C | 真实与预测表达矩阵的细胞聚类一致性,调整Rand指数高于随机值,说明保留细胞类型结构。 |
| D | 选取不同相关分位基因,在细胞类型间比较标准化表达,展示基因特异预测的强弱差异。 |
Figure 4:识别远端调控元件及驱动模体
原图来源:所用 PDF 文件第 5 页,Figure 4。点击图片可查看原图。
A 先在 128 bp 内部表示上计算梯度归因定位区域,再对局部序列做饱和突变识别模体,形成从远端区域到具体碱基的两步解释。PIM1 的既有增强子提供外部注释支持,TF 敲低资料也提供部分调控关联,但相似细胞里 TF 敲低影响 PIM1 不会单独证明作用通过这里的指定增强子。归因负值表示模型依赖的抑制方向,也不能直接等同抑制蛋白实测结合。
B 用同一区域内打乱的背景检验高归因是否富集真实调控注释,避免单个案例独占结论。它支持模型重要位置与已知功能区域一致,却没有验证所有新归因峰。对自己的研究,重要性可用于候选优先级,随后应比较删除、替换或独立实验;不能以网络敏感区域的统计 P 值代替生物干预 P 值。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | PIM1位点的显著归因峰和饱和突变,识别已知增强子与新候选区,突出POU2F及PU.1模体。 |
| B | 各ENCODE调控注释类别的最大归因累积分布相对背景,检验高归因是否富集调控元件。 |
Figure 5:基因特异变异评分与eQTL富集
原图来源:所用 PDF 文件第 7 页,Figure 5。点击图片可查看原图。
A 的 SED 与 Basset SAD 最大差异在于明确指定受影响基因:比较同一基因 TSS 在两种等位序列中的预测,而不是只比较变异附近开放。B、C 再把单变异分数经 LD 矩阵传播为 SED-LD,与群体 eQTL 的边际关联更接近。边际统计同时携带邻近相关变异的信号,直接对比孤立变异效果并不公平。
胰腺最高分组 eQTL 富集约为底部组平均的 4.2 倍,是群体排序趋势,不是一个高分变异 4.2 倍致病。分析同时控制 LD score,并检查到 TSS 距离的影响,但仍不等于精确因果定位或准确效应方向。原训练用参考 DNA 配合各实验轨道,未输入对应实验的个人基因组,且 CAGE 和 RNA 丰度也有不同调控层。这些差异解释了为什么富集证据应与个体表达验证分开。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 以两种等位序列对目标基因TSS预测的差值定义SED,说明评分同时包含变异与受影响基因。 |
| B | 胰腺eQTL比例随SED-LD增加,最高分位约为底部三分位平均的4.2倍,检验群体关联富集。 |
| C | SED-LD绝对值对eQTLχ²统计量的关系,检验效应评分与实测关联强度一致性。 |
Figure 6:多发性硬化关联位点的细胞环境解释
原图来源:所用 PDF 文件第 8 页,Figure 6。点击图片可查看原图。
上部把 MS 关联区域、精细定位与基因位置放在一起,模型挑出的 rs78461372 并非统计概率最高的 lead SNP。中部展示 C→G 更符合 ETS 模体,并在免疫细胞表达输出上产生不同效果;下部在低表达的岛叶皮层环境中,周边模体归因符号改变。不能将一个位点赋予跨所有细胞恒定的激活或抑制标签。
GTEx 的相关表达增加支持候选方向,但本文引用的是另一细胞环境中的边际 eQTL,不能单独确认这个变异而非 LD 邻居,也不能直接证明 MS 病因。模型识别、模体解释、群体表达关联和疾病关联各提供一段信息,尚缺指定细胞中等位编辑到病理的完整干预链。这个案例的价值是提出了比‘最近基因’更明确、可测试的机制候选。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| 上部位点轨迹 | 展示GALC/GPR65表达、GWAS精细定位概率和候选变异位置,从关联区域挑出rs78461372。 |
| 中部CD14单核细胞 | 逐碱基效应与模体显示C→G形成ETS因子位点,预测增强附近基因表达,提出免疫细胞中的机制。 |
| 下部岛叶皮层 | 同一序列的突变效应预测不同,GPR65基线表达很低且该模体可呈抑制作用,说明变异作用依赖细胞环境。 |
我的理解与可迁移启发
Basenji 提醒我,疾病解释需要把候选变异连接到基因,光证明某个 TE 变得更开放还不够。可以用脑细胞相关的局部序列模型建立开放候选,再通过长程表达模型、连接证据或 eQTL 指定可能靶基因,最后比较方向是否一致。不同输出的分数不宜直接相加,应先保留每一层的含义与适用窗口。
另一个启发是数据处理可以构成研究贡献。对多重比对 reads 的处理,可能比把网络换得更复杂更影响 TE 的结论。但平滑分配会让相似拷贝共享信号,因此应加入可唯一比对区域与模拟 reads 的对照。原文非重叠长片段随机拆分也不能完全防止远距离重复同源泄漏;重新做家族或同源簇留出更适合转座子问题。
个人显卡上可先复用现成权重推理,或从较短窗口与少量相关轨道训练小模型。本文同时训练数千轨道的规模不应成为选题必需条件。真正应保留的是任务逻辑:连续功能输出、明确目标基因、考虑 LD 的群体验证,以及承认长程视野和个人基因组泛化仍有边界。








