91.ChromBPNet:原图、模型逻辑与研究范式

91.ChromBPNet:原图、模型逻辑与研究范式
Perry论文题名: ChromBPNet: bias factorized, base-resolution deep learning models of chromatin accessibility reveal cis-regulatory sequence syntax, transcription factor footprints and regulatory variants
期刊与年份: bioRxiv,2024。论文原文。
阅读版本: bioRxiv预印本,2025-01-08版本。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
本篇问题: 分解测序酶偏差后能否恢复真实TF足迹、调控语法和变异效应?
问题先来自解释失败,模型才围绕偏差重新设计
我对研究起点的推测是:如果一个ATAC模型能准确预测每个碱基的切割分布,却在归因中不断发现Tn5偏好,它可能擅长预测实验,而没有正确解释细胞调控。作者从计数头与形状头发现的motif差异出发,将技术偏差明确建成独立模块。这属于测量过程驱动的监督建模:训练标签是ATAC或DNase读段,不是疾病状态,也不是无监督疾病分型。
模型输入2,114 bp DNA,预测中央1 kb的无链方向逐碱基概率与总覆盖量。512通道扩张卷积让局部motif与附近组合共享表示,形状用多项负对数似然,总量用log计数均方误差;两种目标分别回答读段落在哪里、有多少。浅层128通道偏差模型先在低信号、GC匹配非峰区域学习,冻结后再训练调控分支。校正后的输出来自移除偏差分支,而不是把所有原始轨迹先平滑成一个新标签。
这套分解也有依赖条件:背景区域不能混入太多弱开放峰,否则会把真实TF规则交给偏差模型。作者用motif归因检查并逐步调整非峰覆盖阈值。方法采用ATAC正链+4、负链−4的切割位点处理,与常见+4/−5设置不同;复现时不能无意混用两者。本解读基于2025年1月8日的预印本版本,证据强度按该份PDF评估。
Figure 1:高分辨率开放度模型受到Tn5序列偏差干扰
原图来源:所用 PDF 文件第 25 页,Figure 1。点击图片可查看原图。
a先把总量与形状分开,是后续诊断成立的必要条件。b在同一未见位点同时展示实测、预测和两头归因,c/d证明预测确实有能力,e/f/g再揭示能力背后的特征并不一致:计数主要对应TF,而形状显著携带Tn5偏好。关键结论不是模型整体无用,而是低JSD不能独自保证生物解释正确;测序酶可以提供很强的预测信号。对TE序列,这尤其重要,因为某类重复的碱基组成可能同时改变酶偏好和真实结合,直接将归因富集称为TE功能会混淆两者。
主图:PDF 第 25 页;完整图注:第 26 页。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 2114bp序列预测总计数和1kb逐碱基切割概率两种输出,定义计数头与形状头。 |
| b | 未见区域实测、预测及归因,计数归因突出TF而形状归因还包含Tn5偏好伪特征。 |
| c | 未见染色体K562峰计数预测对实测,验证总体开放量准确性。 |
| d | 预测与实测形状JSD对重复及随机/均值基线,展示较好形状预测不代表没有酶偏差。 |
| e | 计数头发现的主要模体匹配已知TF,显示其功能可解释性。 |
| f | 形状头模体常为Tn5偏好或扭曲TF模式,定位污染来源。 |
| g | 计数与形状归因seqlet频率比较,说明Tn5模式主导未经校正的形状解释。 |
Figure 2:分解酶偏差与真实TF代码
原图来源:所用 PDF 文件第 27 页,Figure 2。点击图片可查看原图。
a/c先核对偏差模型究竟学到了什么,d给出冻结与残差学习,b/e/f/g用实际轨迹、motif比例及边际足迹比较多种校正。只有去掉Tn5模式却保留TF模式,才能支持分解方向正确。边际足迹是把motif插入许多背景序列再平均预测,降低其他motif共现影响;它是计算反事实,不能写成直接测量的蛋白占位。CTCF与ZBTB7A等实例还提醒我们,增加某个motif未必都增加开放度。背景染色质偏差优于裸DNA偏差,也说明实验环境会改变测量过程,换协议后应重新做偏差诊断。
主图:PDF 第 27 页;完整图注:第 28 页。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 在无开放峰的背景染色质训练Tn5偏差模型,定义独立偏差学习。 |
| b | 同一区域不同校正方案的轨迹与归因,ChromBPNet配BPNet偏差模型产生清楚潜在足迹,并去掉伪Tn5特征。 |
| c | 背景模型发现的多种Tn5模体,证明它学习的是酶序列偏好。 |
| d | 冻结预训练偏差模型、训练残差TF子模型的结构,说明因子分解方式。 |
| e | 各校正方案的seqlet类型比较,完整BPNet偏差模型才能有效避免Tn5主导。 |
| f | Tn5模体边际足迹在不同模型中的对照,检验酶偏差是否被消除。 |
| g | 真实TF模体边际足迹比较,校正后形状不再被Tn5偏好干扰。 |
Figure 3:校正后ATAC与DNase结果更加一致
原图来源:所用 PDF 文件第 29 页,Figure 3。点击图片可查看原图。
a把同一位点的ATAC与DNase并排,b–d从单例扩展到轨迹、归因和motif实例的整体一致性,e–h再问校正有没有过度抹掉实验特征。两者足迹高度更一致,而DNase仍更窄,意味着方法尝试消除酶序列偏好,同时保留测量分辨率差异。这是比两条曲线看起来相似更严格的检验。不过相同序列、相近细胞状态和共同分析步骤也会增加一致性,它们不能替代真实结合扰动。
主图:PDF 第 29 页;完整图注:第 30 页。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 同一K562位点ATAC/DNase真实、预测和归因,校正后都突出AP1/SP1代码。 |
| b | 两实验轨迹间JSD分布,校正提高跨实验一致性。 |
| c | 不同计数/形状归因JSD,形状归因经校正明显更一致。 |
| d | 两实验的TF模体实例频率相似,说明共用调控代码被恢复。 |
| e | 模体足迹校正前后比较,展示酶差异去除后的TF形状。 |
| f | 边际足迹宽度和高度的定义,解释后续量化。 |
| g | DNase足迹仍比ATAC窄,说明校正并不抹平两实验的真实分辨率差别。 |
| h | 两实验的足迹高度高度相关,支持共同的TF结合强度信息。 |
Figure 4:低覆盖数据中恢复足迹与模体
原图来源:所用 PDF 文件第 31 页,Figure 4。点击图片可查看原图。
a–d是从同一572M读段实验降采样并分别训练,检验随着覆盖降低哪些信号先丢失。总体轨迹尚稳定时,稀有motif已可能召回下降,因此少量读段下得到清晰预测不代表稀有调控模式同样可靠。满深度模型是参照,不是无噪声真值,多个深度也不是独立生物队列。做AD罕见细胞或供体伪总体时,我会同时报告读段深度、motif稳定性和变异效应稳定性,不仅展示平滑轨迹;模型去噪产生的形状也不能伪装成该供体实际测到的足迹。
主图:PDF 第 31 页;完整图注:第 32 页。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 逐步降采样时实测轨迹变差,模型校正轨迹与归因仍较稳定,展示去噪能力。 |
| b | 满深度对降采样的JSD,25M读段仍接近,5M才明显下降。 |
| c | 相对满深度模体实例的召回,低深度仍保留多数模体但罕见模体在5M丢失。 |
| d | 不同深度的代表TF足迹,检查局部形状保持情况。 |
Figure 5:紧凑模体词典与协同组合
原图来源:所用 PDF 文件第 33 页,Figure 5。点击图片可查看原图。
a/b定义各细胞的紧凑motif词典,c通过组合、间距与方向扰动询问FOS–TEAD是否超出单motif效应相加,d–g再将可及性归因与TF ChIP模型归因联系起来。固定6 bp间距的协同主要来自模型反事实与独立ChIP建模支持,不能把每一种组合都写成已经完成CRISPR验证。d–g的参照是另一个由ChIP训练的BPNet归因,并非直接的结合常数;共享建模偏差仍需留意。对TE家族,可检验其共识序列是否保留特定间距组合,再看功能副本是否偏离共识,而不是只数motif出现次数。
主图:PDF 第 33 页;完整图注:第 34 页。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 不同细胞系最主要十个计数模体,展示细胞特异调控词典。 |
| b | 未经/经过偏差校正的足迹,后者显露细胞类型差异。 |
| c | FOS-TEAD组合在固定6bp间距表现超加和协同,展示模型能发现精细模体语法。 |
| d | HepG2 LDLR附近ATAC与多TF ChIP归因一致,连接开放预测与实际TF结合。 |
| e | CTCF位点ATAC模型与CTCF ChIP模型归因相关,验证功能实例定位。 |
| f | ChromBPNet归因比总体ATAC/DNase计数及TOBIAS分数更贴近CTCF ChIP归因。 |
| g | 多细胞、多TF重复f的比较,检验这种结合信息优势是否普遍。 |
Figure 6:跨实验、祖源与细胞类型的变异效应
原图来源:所用 PDF 文件第 35 页,Figure 6。点击图片可查看原图。
a–k逐层增加外部检验:QTL分类、带符号效应、单例机制、欧洲与非洲数据、个体内等位偏倚、祖源模型一致性,最后到小胶质细胞和平滑肌。总量log倍数变化、形状JSD和活跃等位分位分别刻画方向、形状改变与背景可及性,合并分数的用途也要区分排序和定量。作者修正Enformer原来过大输出范围后,其局部QTL分类明显改善;因此不能概括成小模型在所有任务都击败大模型。h需考虑等位比对偏差,i是参考序列训练的群体模型之间比较,不能称为个人基因组已完全泛化。j支持脑细胞局部可及性预测,尚未建立AD发病或进展因果。
主图:PDF 第 35 页;完整图注:第 36 页。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 约鲁巴LCL dsQTL的精确率—召回率,ChromBPNet优于gkmSVM且接近Enformer。 |
| b | dsQTL实测效应对预测log倍数变化,检验定量方向与强度。 |
| c | rs11242436两等位轨迹及归因,显示AP1模体破坏及邻近AP1协同效应。 |
| d | 欧洲LCL caQTL的模型分类比较,检验跨祖源及ATAC应用。 |
| e | 欧洲caQTL实测对预测效应,验证效应量。 |
| f | 非洲LCL caQTL分类比较,检验另一祖源集合。 |
| g | 非洲caQTL实测对预测效应,验证量化一致性。 |
| h | 非洲杂合位点ATAC等位偏倚对预测效应,提供个体内等位比较。 |
| i | 不同祖源参考LCL训练模型的预测效应相关矩阵,检验调控效应跨背景稳定性。 |
| j | 小胶质细胞caQTL对单细胞伪总体训练模型预测,检查原代脑细胞应用。 |
| k | 冠状动脉平滑肌caQTL对匹配伪总体模型预测,检查另一原代环境。 |
Figure 7:TF结合、报告实验、复杂性状与罕见病变异
原图来源:所用 PDF 文件第 37 页,Figure 7。点击图片可查看原图。
a–c用SPI1结合QTL问可及性效应能否反映先锋TF作用,d跨报告实验检验更直接的序列活动,e将效应排序与精细定位联系,f给血液性状实例,g/h才走到罕见神经发育候选与小鼠胚胎报告。证据逐层增强,但报告系统的活性变化仍不等于人类内源靶基因、细胞功能和疾病表型全部成立。g中的NR2F1抑制解释及JARID2靶向关系应作为支持程度不同的机制假说。版本核对还有两处文字冲突:a正文一次写SP1而图注写SPI1,f正文使用K562而图注写GM12878;此处保留图示任务与候选机制,不能据冲突文字补造确定细胞证据。
主图:PDF 第 37 页;完整图注:第 38 页。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | rs5764238的G等位产生强SPI1模体,不同模型归因一致,解释先锋TF结合QTL。 |
| b | SPI1 bQTL的分类曲线,比较ChromBPNet与Enformer。 |
| c | SPI1等位ChIP效应对预测开放度效应,验证结合与开放的联系。 |
| d | 多增强子/启动子MPRA饱和突变效应及模型比较,ChromBPNet在IRF4、SORT1、HNF4A、MSMB、HBG1等更优。 |
| e | 高预测效应变异在红细胞GWAS精细定位候选中的富集,随PIP和效应阈值增加而增强。 |
| f | 红细胞体积关联rs11553699的G等位破坏GATA模体,提出具体调控机制。 |
| g | 神经发育障碍患者变异hs2599的G等位产生抑制NR2F1模体并预测降低开放度,给出疾病相关候选机制。 |
| h | E11.5转基因小鼠A/G增强子报告实验,G等位在多个脑区活性降低,与g的预测一致。 |
阅读说明:实际阅读版本为bioRxiv预印本,2025年1月8日,DOI 10.1101/2024.12.25.630221;讲解依据这份PDF的正文7幅图。
将创新放在测量与机制之间
对AD的TE候选,我最愿意迁移的是两阶段流程:先用细胞类型伪总体建立并检验酶偏差分支,再训练调控模型,锁定后比较TE与匹配非TE变异的有符号局部效应。TE家族、GC、可比对性、峰强度和TSS距离都需要控制;无法唯一比对的副本不能因为模型预测漂亮就被计作实测支持。随后用独立caQTL、等位数据或MPRA验证方向,最后才连接靶基因与病理。
本模型是约600万参数的局部CNN,适合作为有限显存方案的候选,但实际5060 16 GB训练速度与batch仍应做小规模实测,不能从参数少直接承诺完整流程无障碍。小胶质细胞已有公共数据和本篇基准,可先复现一个细胞类型再展开。真正可发表的问题是某类TE背景是否系统性影响局部调控、或现有模型为何在这些背景失败,而不是简单把ChromBPNet换名字。
最深的感悟是,解释工具可以参与模型诊断,而不只是预测后的装饰。作者先发现归因中的测量混杂,再改变训练结构,并以第二种酶、QTL和报告实验检验;这个循环值得模仿。但它主要解释局部染色质规则,远端表达、病理环境和跨细胞状态仍是开放边界,不能靠扩大结论措辞跨过去。
局部效应验证时还需统一参考组装与等位方向,避免坐标转换使符号反转。









