73.Puffin:原图、模型逻辑与研究范式

73.Puffin:原图、模型逻辑与研究范式
Perry论文题名: Sequence basis of transcription initiation in the human genome
期刊与年份: Science,2024。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
本篇问题: 启动子序列怎样决定转录起始位置、方向性和跨环境表达选择性?
用两种模型回答两层问题
Puffin 的目标不是只提高表达预测,而是理解启动子 DNA 怎样决定起始位置和方向。作者先训练看 100 kb 的 Puffin-D,再根据它揭示的局部依赖设计更简单的 Puffin。前者强调准确预测,后者把计算拆成序列模式及其位置效应,便于逐项解释。这种‘复杂模型探索—简单模型总结—独立实验核验’的范式尤其值得借鉴。
我的推测是,选题由一个知识缺口形成:许多人类启动子没有经典 TATA 元件,却仍形成清楚的 TSS 分布,单个共识模体不足以解释它们。作者因而把输出设为双链逐碱基起始信号,而非整段是否启动,再问能否用少量规则重建这个分布。这是我的论证重建。模型学习的模体并非预先指定,它们从多种起始测量和 DNA 中获得;名称在训练后结合已知知识赋予。
Puffin 有模式激活层和位置效应层,模体、起始子与三核苷酸各采用适合的范围,效应在对数尺度相加。训练主要用归一化的 KL 散度重视形状,辅以弱的幅值损失。因此它首先解释哪里开始转录,整体丰度仍可能受远端影响。训练信号按实验技术合并多个细胞,提供的是核心规则,而非每个细胞实时状态;CAGE/RAMPAGE 的成熟转录本与 GRO/PRO-cap 的新生转录本也具有不同含义。
Figure 1:预测型与解释型转录起始模型
原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。
A 区分两种模型的角色,B 把 Puffin 的每一步拆成可查看的量。模体匹配激活和‘在距模体多少碱基处影响起始’是两套权重,使同一模体可以对不同相对位置产生不同作用。可解释性来自受约束的计算结构,而不是训练后只附一张注意力图。
C、D 用留出染色体上的实际启动子检查逐碱基形状。覆盖较低时实验本身也不稳定,作者将不同 CAGE 技术相关作参照。模型有时比两种技术之间更相关,不能解释成它超过真实生物学:汇总、平滑、实验偏好和高可信启动子的选择都影响测量。正文的性能主要基于跨技术形状一致的启动子,不能无条件推广到所有弱或异常疾病启动子。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | Puffin-D用于高精度预测,Puffin用于解析启动子代码,两者连接模体、方向性及跨物种研究。 |
| B | 序列模式激活、位置效应和加总预测的计算流程,说明Puffin如何产生可解释的逐碱基贡献。 |
| C | 未见染色体启动子的双链起始信号对预测,检查位置及峰形。 |
| D | 不同测序覆盖组的逐碱基相关,并用两套CAGE实验相关作参照,说明低覆盖对评估的限制。 |
Figure 2:序列模式的特定位置效应
原图来源:所用 PDF 文件第 5 页,Figure 2。点击图片可查看原图。
A–C 比较三个模式层级:模体提供广域驱动,起始子偏好精调局部位置,三核苷酸承接剩余序列依赖。模型的简洁不是说转录只有九种蛋白参与,而是这些模式足以解释训练测量中的主要局部变化;一个 SP 或 ETS 模式也可能对应多个家族蛋白。
D 的横轴相对模体中心,而后来保守性图相对 TSS,两者有镜像坐标关系,读图必须先确定参照点。E、F 显示已知模式与 Long Inr 的局部结构。U1 的影响主要出现在成熟转录本测量中,说明它可以影响起始后的延伸和转录本存续,不能把所有模型预测峰都视为初始起始机制。NFY 的周期位置效应提供物理机制线索,但周期本身尚未确定具体分子接触。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 展示模型学习的模体、起始子和三核苷酸三类模式,说明表达预测的组成。 |
| B | 最强4万个启动子的平均位置效应,比较三类模式在TSS周围的分工。 |
| C | 不同转录起始强度下的TSS模式效应,检验序列贡献与表达强度关系。 |
| D | 每种模体正反方向的位置效应,区分双向与单向代码;U1效应主要作用于起始后的成熟过程。 |
| E | 模型学到的常规转录起始模体及命名,定位已知和新模式。 |
| F | Long Inr等起始子模式与已有核心启动子模体的重叠,展示细致的TSS序列规则。 |
Figure 3:TF去除和模体编辑的实验验证
原图来源:所用 PDF 文件第 7 页,Figure 3。点击图片可查看原图。
A 将对应模体激活归零,是模型内部对‘移除这个序列规则’的近似。B、C 用实际 NFYA 敲低和 YY1 急性去除后的起始相关测量检查预测位置变化,并且这些实验在小鼠细胞进行,构成跨物种验证。真正 TF 去除可能有间接网络反应,不能与模型关掉一个通道严格等价;一致性说明其捕获了一部分直接局部效应。
D 将高贡献与低贡献启动子并列,检验模型不只是挑到一个好案例;E 则通过 TATA/NFY 插入、删除报告实验具体改变 DNA,包括 LTR12 来源启动子。所有轨道在实例中缩放后比较,主要支持位置与相对形状,不能由图中高度直接比较绝对表达倍数。正文另有原位 CRISPR-Cap 验证,但那部分位于补充资料,不应冒充主图 E 的报告实验已经在原位完成。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 把对应模体激活设零模拟TF去除,说明计算机内敲除方法。 |
| B | NFY模拟去除后的TSS变化与NFYA敲低Start-seq对照,检验位置迁移预测。 |
| C | YY1模拟去除对mNET-seq实测变化,验证另一TF的起始调节。 |
| D | 高NFY或YY1贡献的启动子更受相应TF去除影响,支持贡献分数的功能意义。 |
| E | TATA/NFY位点插入或删除的预测与实测信号,验证改变具体模体可改变起始位置和强度。 |
Figure 4:模体组成与启动子表达选择性
原图来源:所用 PDF 文件第 8 页,Figure 4。点击图片可查看原图。
A、B 把每个启动子的模式贡献按明确窗口汇总,显示不同组合都可以实现起始,没有单一模体适用于全部。C、D 将模式组合与 FANTOM 跨细胞表达离散度联系起来,例如高 TATA 贡献更常伴随选择性表达。它们首先是关联,不能宣称某一个模体单独决定组织身份。
E–G 的虚拟插入改用 Puffin-D,将同一个 600 bp 启动子放进许多不同长程背景,询问它对外界调控环境的响应。这里是计算替换筛选,不是实际完成全部四万乘三千五百次基因组插入;插入目标还来自一个固定区域,未覆盖所有染色质环境。H 将这种背景选择性与真实跨细胞离散度关联,支持一种机制假说:启动子代码调节对外部激活的响应曲线。作者仍将这一解释称作推断,不能写成已经完全证明的细胞特异机制。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 用TSS附近预测加权平均定义模体贡献分数,并展示高表达启动子实例。 |
| B | 4万个启动子按主要贡献模体排列,显示不同模体组合形成的启动子类别。 |
| C | 平均表达对跨细胞/组织离散度按模体贡献着色,检验模体组成与表达特异性关系。 |
| D | 不同启动子类别的FANTOM表达热图,展示对应的组织表达模式。 |
| E | 把600bp启动子虚拟插入3500个基因组环境,用Puffin-D评价对远端上下文的选择性。 |
| F | 不同主导模体的启动子能在多大比例环境达到高表达,比较上下文敏感性。 |
| G | 预测表达对插入环境活性排序的响应曲线,展示不同代码对外部激活信号的响应差异。 |
| H | 虚拟插入选择性及序列模体选择性对实际跨细胞表达离散度,连接基因组上下文与组织特异性。 |
Figure 5:双向转录起始的共同序列基础
原图来源:所用 PDF 文件第 10 页,Figure 5。点击图片可查看原图。
A 提醒我们,新生转录的双向起始与成熟 RNA 的方向性可以同时成立。双向模体可向两个方向驱动起始,U1 等规则影响后续成熟结果,二者并不矛盾。B 的逐模式贡献让我们看到两个方向是否使用同一段序列,而不只是看到两条相邻峰。
C 的八千余个双向启动子提供系统比较,D 显示近距离 TSS 更常共享贡献,距离增大后共享下降。这里比较的是模型中的碱基贡献相关,不能等同于两个方向具有同一调控蛋白组成或相同稳定转录本功能。对 TE 衍生启动子,可分别检测正反链新生与成熟信号,避免把反向微弱 RNA 全部当成新的稳定基因表达。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 双向模体驱动两条链起始,单向模体与U1等共同影响方向,区分新生与成熟转录本的方向性。 |
| B | 代表启动子双链预测/实测及逐模体贡献,展示两方向是否共享驱动序列。 |
| C | 8216个双向启动子按反向TSS排序,对照实测、预测和贡献热图,系统检查共享序列代码。 |
| D | 两方向贡献相关对TSS间距,近距离TSS通常共享较多贡献序列,远距离共享较弱。 |
Figure 6:哺乳动物间的规则泛化与保守
原图来源:所用 PDF 文件第 11 页,Figure 6。点击图片可查看原图。
A、B 用人鼠模型互相预测,实际标签支持核心规则可迁移。作者通过人鼠对应位置的拆分避免近同源测试序列落在人模型训练范围,比较比单纯换一个物种更严格。C–E 进一步用 241 哺乳动物的比对保守性检验位置规则,TATA、YY1 和 NFY 的效应位置与保守位置趋势相符。
这两条证据的强度不同:鼠有实际起始数据,大多数其他物种主要提供序列保守性,而非全部获得起始测量。序列身份分数还经过物种间尺度归一化,不能把跨物种曲线直接当作同尺度自然选择系数。保守性支持功能约束与模型解释一致,仍不能推出每个物种的表达和疾病后果已经验证。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 人/鼠模型跨物种测试的流程及实例,定义序列规则迁移比较。 |
| B | 两模型在小鼠未见启动子的预测高度相似、性能接近,说明核心规则可跨物种复用。 |
| C | 241种哺乳动物的模体贡献与序列保守性比较流程。 |
| D | 从人TSS看各模体位置特异PhyloP,保守性模式与预测位置效应相符。 |
| E | 从其他物种看位置保守性,贡献分数能预测各物种序列保守程度,支持规则的广泛保留。 |
我的理解:让解释成为可操作的模型
最可迁移的启发是,解释不必停在黑箱归因;可以把复杂模型学到的关系压缩成有明确位置、方向和模式分工的模型,再设计会失败的验证。对 TE–AD 问题,可以先问某些拷贝是否形成替代起始、双向起始或与常规启动子不同的背景敏感性,而不是直接追求一个 AD 分类分数。
如果使用公共数据,尤其要把新生与成熟 RNA、局部启动子与远端环境分开。单细胞 RNA 表达不能完整替代逐碱基 TSS 数据,ATAC 开放也不能直接确定从哪个位置起始。可以先用现成 Puffin 计算局部规则,再用脑细胞 CAGE、长读长或公开转录本证据核对候选;异常起始到 AD 病理仍需要独立队列联系。
这篇论文没有证明所有调控都可加性描述。对数可加是模型选择,在任务范围内有效,但真正 TF 竞争、染色质与远端增强子可能需要更复杂项。个人显卡上可优先使用简单 Puffin 的已有权重或针对少量相关输出的小模型;不能因 Puffin 解释简单就默认 100 kb Puffin-D 全训练也有相同成本。研究价值来自找准可检验的序列规则和证据层,而非把两种模型的能力混在一起。








