56.DeepSTARR:原图、模型逻辑与研究范式

56.DeepSTARR:原图、模型逻辑与研究范式
Perry论文题名: DeepSTARR predicts enhancer activity from DNA sequence and enables the de novo design of synthetic enhancers
期刊与年份: Nature Genetics,2022。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
研究问题: DeepSTARR 能否定量预测果蝇增强子活性、解释相同基序为何贡献不同,并据此设计合成增强子?
难点与构思:从识别增强子到解释语法
增强子通常包含多个TF结合模式,但相同motif在不同位置的功能可能不等价。只比较motif是否富集,既难解释某个位点的强弱,也不能回答调整间距会发生什么。本文还加入启动子兼容性:同一序列对发育型和管家型启动子的活性不同。我的推测是,构思的关键是把两个程序放进同一测量与模型体系,以连续活性而非二分类训练,再用大规模突变检验解释是否真实。
因而本研究真正难的部分并非只有网络训练,还包括设计能区分解释的测量。随机改动、只改核心、只换侧翼和改变伙伴距离回答不同问题;若这些对照缺失,预测相符仍可能对应多种机制。论文把模型当成设计下一轮比较的工具,这比事后给高分序列加一个已知TF名称更深入。
输入、架构与学习目标
模型以249 bp序列为输入,输出果蝇S2细胞中两类启动子的增强活性。四层卷积及池化抽取局部模式与组合,两层全连接将共享表示映射到两种目标。它属于有实验标签的监督多任务回归;模型无需事先提供全部motif,不等于训练没有监督。把同一序列的两个功能同时预测,可以利用共享序列成分,也能学习程序特异的权重。
主要测试留出染色体2R,减少相邻序列进入训练和测试的泄漏。两类预测相关约0.68、0.74,与实验重复相关约0.73、0.76接近。重复一致性是估计可测上限的参照,不能解读为已掌握全部调控机制。STARR-seq测到的是特定细胞和报告系统中的活性,仍不同于原位染色质环境下对自然靶基因的完整作用。
模型解释怎样变成实验
贡献分数先提出候选,TF-MoDISco汇总重复模式,随后真实突变检验必要性。论文没有停在logo看起来像已知TF,而是继续问同一motif的不同实例为何贡献不同,再做侧翼交换和间距测试。这样形成“模型定位—控制其他因素—改变候选因素—测量活性”的闭环。特别是保持核心序列不变的侧翼交换,能缩小解释范围,避免把核心匹配强度混入上下文作用。
跨物种实验保留了另一种边界。果蝇发现的语法思路在人增强子中也有证据,不意味着果蝇模型可不经调整预测所有人类脑增强子。人部分的线性语法分析及突变验证是对规则的检验,不能称为同一网络对所有物种的零样本泛化。
Figure 1|从 DNA 预测两类增强子活性
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
a先用同一报告设计建立两种程序的标签,b与d分别从区域轨迹和全体留出序列检验连续预测,c解释共享网络,e直接评价Dev与Hk的相对偏好。e尤其重要:如果两个输出都只是区分强弱增强子,就未必学到启动子兼容。测试采用未见染色体,证明的泛化仍是同细胞和实验体系中的新序列,不是新组织或新生物环境。
| 子图 | 讲解 |
|---|---|
| a | 用发育型 Dev 和管家型 Hk 启动子做 UMI-STARR-seq,得到同序列对两种启动子的活性标签。 |
| b | 留出染色体 2R 的实测和预测轨迹对照,两类活性峰均可被重建。 |
| c | 249 bp 序列输入多任务 CNN,同时输出 Dev、Hk 定量活性。 |
| d | 测试序列预测对实测的两类活性散点,验证不是只把序列分为强/弱,而可预测连续数值。 |
| e | 预测和实测 Dev/Hk 的 log2 倍数差,评价增强子–启动子偏好的定量预测。 |
Figure 2|重要基序的发现与实验验证
原图来源:所用 PDF 文件第 3 页,Figure 2。点击图片可查看原图。
a、b从贡献分数提出候选motif,c通过突变发育型、管家型及长度匹配对照模式测试功能与程序特异性,d比较富集和模型重要性。随机对照帮助排除任意改动序列都降低活性的解释,另一类启动子的结果则帮助辨别一般活性丢失与特异程序丢失。富集度只反映出现频率,重要性取决于是否影响功能,二者不一致正是这张图要回答的问题。
| 子图 | 讲解 |
|---|---|
| a | 强 Dev/Hk 增强子的逐碱基贡献分数标出候选基序,并用基序突变后的活性下降验证。 |
| b | TF-MoDISco 汇总反复出现的预测模式,区分 Dev 与 Hk 的主要基序。 |
| c | 突变八类 Dev、四类 Hk 及对照基序;功能下降具有增强子类型特异性,支持模型识别了相应程序。 |
| d | 比较普通富集度和模型全局重要性,某些不显著富集的基序仍很重要,说明频繁出现不等于功能贡献大。 |
Figure 3|同类基序实例并不等价
原图来源:所用 PDF 文件第 5 页,Figure 3。点击图片可查看原图。
a在同一增强子里逐个删除三个GATA实例,以共享背景控制细胞与整体序列差异;b扩展到1013个GATA实例,c进一步跨motif量化实例不等价,d比较DeepSTARR与PWM。大约57%的所测增强子存在至少两倍的实例差,不等于基因组所有增强子的精确比例。模型比PWM更准说明上下文带来信息,但还未确定究竟是侧翼、距离或其他模式,这为后两张图留下可检验问题。
| 子图 | 讲解 |
|---|---|
| a | 一个含三个 GATA 位点的增强子,逐个和全部突变造成不同活性损失,模型贡献分数相应不同。 |
| b | 1,013 个 GATA 实例的实测突变效应与 DeepSTARR 预测对比,检验单个位点功能预测。 |
| c | 同增强子最强与最弱同类实例的活性差;约 57% 增强子存在至少两倍的实例贡献差。 |
| d | 各基序的预测–实测相关:DeepSTARR 高于只用 PWM 位点分数,说明序列上下文提供信息。 |
Figure 4|侧翼序列改变同一核心基序的作用
原图来源:所用 PDF 文件第 6 页,Figure 4。点击图片可查看原图。
a–c定位强弱实例的侧翼差异,并保持核心相同以排除核心匹配解释;d在47个增强子中交换两碱基侧翼,e给出具体前后活性。交换使原强位点变弱、原弱位点变强,比单纯贡献热图更接近侧翼具有功能作用的直接证据。仍要把结论限定到所测实例和报告条件:这支持少量侧翼可改变贡献,并不表示任意上下文都可由两碱基完全决定,也不能自动归因于某一未测的蛋白结构机制。
| 子图 | 讲解 |
|---|---|
| a | 强、弱 GATA/Trl 实例周围 ±50 bp 的贡献分数比较,差异延伸到核心之外。 |
| b | 按贡献排序的侧翼碱基热图及不同碱基对应的功能分布,找出核心相同但侧翼不同的偏好。 |
| c | 模型/突变选出的高功能 logo 与普通 PWM 对照,显示侧翼信息不总在传统基序模型中体现。 |
| d | 在 47 个增强子中交换强弱 GATA 的两碱基侧翼,原强位点减弱、弱位点增强,直接测试侧翼的充分性。 |
| e | 一个交换侧翼的具体序列及实测活性例子,把贡献分数变化和功能变化对应。 |
Figure 5|基序距离的协同规则
原图来源:所用 PDF 文件第 7 页,Figure 5。点击图片可查看原图。
a把两个模式插入60个随机背景并扫描距离,降低单个背景偶然性的影响。协同性按线性活性中的组合效应与单效应和比较,不能随意把对数差值叫协同。b、c区分不同伙伴和间距的规则,d、e再通过天然实例突变支持GATA较远配对与AP-1/GATA较近配对。计算植入是提出规则的实验式操作,真实突变是其独立功能检验;两者并列避免只在模型自己的世界中自我验证。
| 子图 | 讲解 |
|---|---|
| a | 将两个基序按不同距离植入 60 个随机背景,用组合效应相对单基序效应定义协同性。 |
| b | ETS/SREBP、GATA/GATA、AP-1/GATA、Dref/Dref 的四种距离响应,并与天然分布及活性回归比较,显示不同组合使用不同间距规律。 |
| c | 不同基序相对中央 GATA 的距离扫描,检验 GATA 配对规则是否依伙伴而变。 |
| d | 突变实验显示离另一 GATA 较远的实例更重要,验证模型的长距离 GATA/GATA 偏好。 |
| e | AP-1 距 GATA 较近时突变损失更大,验证另一种近距离组合偏好。 |
Figure 6|在人增强子中检验语法规则
原图来源:所用 PDF 文件第 9 页,Figure 6。点击图片可查看原图。
a–d在人体报告实验及相关细胞的足迹中检验实例不等价,e用核心、侧翼、位置和距离的线性模型判断各类语法信息,f真实突变支持AP-1与ETS近程关系,g总结上下文框架。RNA或TF足迹不是这里的训练目标,它们提供额外背景支持;相关RKO细胞也不能当成与HCT116完全相同的状态。图支持语法思路可迁移到人,但对特定细胞的具体参数仍要重新估计。
| 子图 | 讲解 |
|---|---|
| a | 人 HCT116 增强子的四个 AP-1 实例突变效应不同,并与相关 RKO 细胞的 DNase 足迹对应。 |
| b | 同增强子最强/最弱同类基序实例的实测效应差,说明不等价现象也在人类存在。 |
| c | 按基序类型量化至少两倍实例差的增强子比例,整体也约 57%。 |
| d | 有 TF 足迹的实例通常突变后损失更大,连接报告活性和内源结合线索。 |
| e | 线性模型结合核心、侧翼、位置和伙伴距离预测实例贡献,各特征的回归重要性表明上下文规则有用。 |
| f | 近距离 AP-1/ETS 对中,突变任一位点的损失更大,实验验证二者的近程协同。 |
| g | 机制示意总结基序组合、侧翼和距离共同决定贡献,单独位点匹配分数不足。 |
Figure 7|从头合成增强子
原图来源:所用 PDF 文件第 10 页,Figure 7。点击图片可查看原图。
a预测并实测249条合成序列,b比较三个序列的贡献与间距,回答模型规则是否足以构造新功能。相关约0.62说明预测有实际设计价值,同时存在偏差;挑出的高活性序列也不能代表整个随机序列空间的成功率。图的关键是合成之后做了功能测量,而非仅在模型里优化分数。共享motif数量却活性不同的例子把设计收益重新连接到前面发现的上下文语法。
| 子图 | 讲解 |
|---|---|
| a | 从模型扫描随机序列中挑出 249 个合成序列,预测与 UMI-STARR-seq 活性相关,PCC 约 0.62,可得到很强的合成增强子。 |
| b | 三个活性不同的合成序列的贡献分数及 GATA/AP-1/ETS 间距;同样基序数量仍因语法不同而活性悬殊。 |
依据:对应主图、完整图注及正文 Results;实验结果只按本文给出的对象和条件解释。
我的理解与可迁移设计
这篇提供了一条很清楚的机制研究路线:先把测量目标做精确,再让模型给出可控制的局部假设,最终用替换或突变区别候选因素。对AD转座子研究,值得借鉴的并非直接照搬果蝇TF,而是比较同家族序列为什么在脑细胞中开放不同,是否有核心之外的侧翼或组合差异。需要匹配家族、长度、GC及可比对性,才不会把重复家族背景误认为调控语法。
纯计算阶段可以先在独立公开数据中验证预测与真实可达性,并检查规则跨供者是否成立;虚拟突变只能给候选证据,不能写成做过功能实验。16GB显存可以支持这类短序列CNN的受控问题,真正有价值的创新是一个能解释并经外部证据检验的规则。若将来增加实验,优先选能够区分两种机制的侧翼交换或伙伴间距设计,而不是仅重复证明一个高分片段活性很高。









