71.BPNet:原图、模型逻辑与研究范式

71.BPNet:原图、模型逻辑与研究范式
Perry论文题名: Base-resolution models of transcription-factor binding reveal soft motif syntax
期刊与年份: Nature Genetics,2021。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
本篇问题: 碱基分辨率TF结合预测能否揭示组合模体、协同方向和间距语法?
为什么必须预测足迹,而不只预测峰
BPNet 的科学问题是 TF 怎样在 DNA 上协同:两个模体需要严格间隔,还是有可变但偏好的距离?粗 ChIP 峰只告诉我们某段有结合,难以区分一个因子直接结合自己的模体,还是被另一个因子间接带到附近。作者使用小鼠胚胎干细胞的 Oct4、Sox2、Nanog、Klf4 ChIP-nexus,让实验本身提供逐碱基、分链的足迹,模型输出也保持同一分辨率。
我推测研究思路源于‘统计共现并不等于功能语法’这个矛盾:重复序列可以把一套固定模体间距拷贝到许多位置,让常见间距看起来显著,却不一定代表蛋白协同需要该距离。于是作者不是只数模体,而是训练可预测结合的模型,在随机与天然背景里主动改变模体和间距,再做原位验证。这是高分辨率预测—计算干预—生物干预相结合的研究范式;动机重建是我的理解。
模型输入 1 kb one-hot DNA,卷积与残差膨胀卷积不进行降采样,输出各 TF 双链的足迹分布与总计数。形状用多项分布负对数似然,总计数用对数计数 MSE,实验控制轨道作为偏差支路。它不是无监督模型;训练标签是实际 ChIP-nexus。拆开形状与总量很关键:局部 DNA 可以较准确地指定结合位置,却未必足以决定整个区域的结合强度。
Figure 1:BPNet预测碱基分辨率TF结合足迹
原图来源:所用 PDF 文件第 37 页,Figure 1。点击图片可查看原图。
a 说明 ChIP-nexus 峰来自外切酶停止位置,而非把常规 ChIP 信号插值成单碱基。b、c 显示同一复合模体周围不同 TF 的足迹,以及相对于 ChIP-seq 更清楚的结合特异性。这个实验分辨率决定模型是否有机会学习细微语法。d 的控制支路让已由实验背景解释的信号不必由 DNA 网络再学习。
e、f 检验未训练区域中的定位形状,接近实验重复的是足迹高信号位置的一致性;总计数预测没有达到同样的重复水平,不能省略这一差别。g 增加层数并扩大可见上下文,Nanog 等因子的收益尤其明显,支持邻近序列参与。但层数、容量与感受野共同改变,不能仅据此把收益全部归因于某个已确定的蛋白协作机制。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | ChIP-nexus通过外切酶停止位置测量Oct4、Sox2、Nanog、Klf4的正反链足迹,说明高分辨率训练信号来源。 |
| b | 高信号Oct4-Sox2模体周围两种TF足迹热图,展示结合位置和链方向。 |
| c | ChIP-nexus对ChIP-seq平均轨迹,前者分辨率更高,也减少Oct4在Sox2单模体上的非特异信号。 |
| d | 1kb序列同时预测多TF双链计数并剔除控制轨迹解释的偏差,展示BPNet架构。 |
| e | 未见Lefty增强子的实测与预测足迹,检查具体位点形状。 |
| f | 1–10bp分辨率下预测高信号位置的auPRC与实验重复及基线,检验模型接近重复水平的准确性。 |
| g | 卷积层增加扩大感受野并提升形状auPRC,说明周边序列有助于足迹预测。 |
Figure 2:由模型归因提取模体和功能实例
原图来源:所用 PDF 文件第 38 页,Figure 2。点击图片可查看原图。
a、b 先把预测分解到碱基,c 再从高贡献片段中聚类形成模体。CWM 记录平均预测贡献,PFM 记录碱基出现频率,两者回答的问题不同。d 的重复来源 N6 是本文与 TE 研究最直接的连接:整段重复序列常常频率都很高,实际与 TF 结合预测相关的却只是其中短小部分。保守或高频并不能替代功能贡献。
e、f 统计代表模体实例和组合复杂度,但没有说每个区域都必须具备同一套模体。g 用独立 TF 去除后的 ATAC 变化检验实例排序,支持贡献结合上下文比纯 PWM 匹配更能找到有功能的实例。h 又训练线性模型用 BPNet 表示预测该扰动变化,因此是有标签的下游探针,不是 BPNet 未经训练就直接预测敲除效应。归因解释与额外监督预测应分层报告。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | DeepLIFT反向分解预测为逐碱基贡献,定义归因分析。 |
| b | Oct4远端增强子的预测、贡献与模体实例,展示从输出到关键序列的解析。 |
| c | TF-MoDISco聚类高贡献seqlet,生成贡献权重矩阵CWM与频率矩阵PFM,再定位基因组实例。 |
| d | 重复来源N6模体的PFM与不同TF的CWM不同,说明碱基常见程度并不等于功能贡献。 |
| e | 11种代表模体在约15万区域的实例数量,展示学到的调控特征覆盖度。 |
| f | 每个区域模体实例数分布,描述调控组合复杂性。 |
| g | 用Oct4或Sox2去除后失去开放度的区域验证模体实例,模型贡献排序优于HOMER/MEME序列匹配排序。 |
| h | 利用BPNet瓶颈表示预测TF去除后的ATAC变化,展示表示可以定量预测独立扰动实验。 |
Figure 3:组合模体与直接/间接结合
原图来源:所用 PDF 文件第 40 页,Figure 3。点击图片可查看原图。
a 的复合模体可与已知蛋白—DNA接触结构相对照,帮助说明模型学到的是具体结合组合;图中结构是相关蛋白组合的外部参照,不能把归因高度直接等同结合能。b 的 Nanog 变体在共同核心周围有不同侧翼,提示实际结合规则比单一共识序列丰富。
c 汇总已知与候选模式,d 显示不同 TF 对各模式的预测贡献,e 用实测足迹形状提供直接或间接结合的线索。尖锐足迹、模糊足迹和没有足迹是结合语境证据,而不是单凭 d 最大值决定哪个蛋白直接结合。与病理机制相比,这里首先解释的是多能性 TF 网络;迁移到脑细胞需要相应 TF 和实验训练信号,不能照搬 Nanog 的结论。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | Oct4、双Oct4、Sox2、Oct4-Sox2分别被发现,组合CWM还与蛋白-DNA结构对应,展示组合代码可被识别。 |
| b | 三种Nanog模体变体的足迹都集中于TCA,同时存在不同侧翼序列,揭示结合变体。 |
| c | 已知、新颖和新环境出现的短模体集合,展示模型发现的序列模式。 |
| d | 逐TF平均模体贡献,提出最可能直接作用的TF,但贡献最高本身不能完全证明直接结合。 |
| e | 尖锐、模糊或缺失的ChIP-nexus足迹帮助区分直接、间接与未结合的模式。 |
Figure 4:模体协同作用的距离与方向规则
原图来源:所用 PDF 文件第 41 页,Figure 4。点击图片可查看原图。
a 在随机背景中加两个模体,再改变距离,并扣除邻居模体自身肩部足迹造成的影响。b 在天然序列中移除第二模体,检验同样规律是否仍在更复杂背景中成立。两套实验都还是模型中的操作;它们共同减少某一种背景造成假相互作用的可能,却不能自动证明真实细胞的协同。
c 将短距离与核小体尺度距离分开,箭头表示一个模体对另一个 TF 结合的影响,因此‘方向性’是作用的不对称,不只是 DNA 正反链方向。d 比较天然共现与随机期望,并排除带严格间隔模体的重复来源。结果支持软间距偏好,而非每对 TF 都要求唯一固定距离。对 TE 项目应同时检查家族继承造成的固定间隔与功能扰动造成的距离依赖,不能只做一张富集间距直方图。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 在随机序列中插入两模体并改变间距,预测足迹倍数变化,识别蛋白尺度与核小体尺度的协同。 |
| b | 在天然序列中替换第二模体重复分析,检验合成背景发现的作用是否保留。 |
| c | 把近距离和70–150bp作用汇总为热图,比较不同TF对的协同强度及方向性。 |
| d | 真实模体近邻出现概率对随机期望,检验预测相互作用是否对应天然共现偏好。 |
Figure 5:Nanog与伙伴模体的DNA螺旋周期
原图来源:所用 PDF 文件第 42 页,Figure 5。点击图片可查看原图。
a、b 中周期性出现在贡献而非普通碱基频率上,说明某种侧翼排列在出现时会影响预测,却不一定是整体序列中强烈富集的模式。c 的 Fourier 分析把它量化为约 10.5 bp,d 比较其他 TF 和模体以检验特异性。需要先规定分析窗口、去平滑趋势和频段,不能在多个周期中事后挑一条生物学好解释的峰。
e–h 检查真实模体间距,i–k 再看实测 Nanog 足迹与间距的关系,使周期不只存在于网络归因。螺旋尺度提示同侧 DNA 接触或核小体表面作用,但作者保留多种物理解释;本图没有选择出唯一分子机制。连续曲线与置信区间来自许多实例的统计关联,无法替代逐个改变间距的原位实验。‘软语法’意味着概率偏好而非无例外规则。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | Nanog的CWM侧翼出现周期贡献,普通PFM未清楚显示,说明功能归因揭示额外规则。 |
| b | 各Nanog实例贡献热图及平均值重现周期模式。 |
| c | Fourier谱显示约10.5±0.3bp周期,对应DNA螺旋尺度。 |
| d | 不同TF模体的10.5bp谱比例,说明该周期主要关联Nanog。 |
| e | Nanog与Nanog间距分布在不同方向组合中也有周期偏好。 |
| f | Nanog与Sox2的间距分布,检验异源模体组合的周期。 |
| g | Nanog与Oct4-Sox2的间距分布,展示组合模体伙伴的周期。 |
| h | Nanog与Zic3的间距分布,显示另一伙伴也具有类似规则。 |
| i | Nanog—Nanog不同间距的实测Nanog足迹强度,优选间距平均结合更强。 |
| j | Sox2—Nanog间距与Nanog实测足迹强度,验证异源组合的周期效应。 |
| k | Oct4-Sox2—Nanog间距与Nanog足迹强度,进一步连接序列间距与实验结合。 |
Figure 6:CRISPR验证方向性协同
原图来源:所用 PDF 文件第 43 页,Figure 6。点击图片可查看原图。
a、b 分别改变 Sox2 与 Nanog 模体后看 Sox2 结合,c、d 看 Nanog 结合,构成明确的双向干预对照。Sox2 模体损坏影响 Nanog,而反向损坏不明显影响 Sox2,验证了一个位点的作用不对称。作者使用独立编辑克隆和结合测量,证据已经强于模型模拟或模体共现。
这项验证支持所选区域的局部协同及邻近 Nanog 依赖,但并没有把全基因组所有配对都逐一验证,也未通过系统改变间距直接证明所有 10.5 bp 周期的必要性。终点是 TF 结合,尚不是胚胎分化表型或疾病风险。它展示了如何挑选能区分两种机制的实验:改变 A 看 B,改变 B 看 A,比只破坏一处后观察整体下降更有信息。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 突变Sox2位点后,预测及实测Sox2足迹都消失。 |
| b | 突变Nanog位点对Sox2结合影响不明显,显示反向作用较弱。 |
| c | 突变Sox2位点却降低区域内Nanog结合,与模型的方向性协同一致。 |
| d | 突变Nanog位点消除自身足迹并降低附近Nanog结合,验证邻近协同预测。 |
我的理解:重复结构与功能结构需要拆开
这篇论文对转座子研究的启发不是‘重复里有模体’,而是频率结构与功能结构可能不同。同源 TE 拷贝会携带相同排列,模型归因可以提出其中哪些短区域对指定细胞功能重要;之后应通过匹配家族背景、保留或打乱邻近模体、独立报告测量检验。CWM 也仍是模型解释,必须检查训练中的测序偏差与重复可比对性。
对于公共 AD ATAC 数据,可以先在指定脑细胞训练小型足迹或开放度模型,研究 TE 内模体与邻近非 TE 模体是否具有不同距离依赖。没有 ChIP-nexus 时,不能声称 ATAC 切割峰直接是某个 TF 的专属结合足迹;需要 bias 模型与独立 TF 数据。更有创新价值的问题是候选协同能否解释变异对调控的不同后果,并在留出拷贝或队列重现。BPNet 示范的是机制发现的证据组织,而不是一套直接套用 AD 的 TF 名单。








