65.PARM:原图、模型逻辑与研究范式

65.PARM:原图、模型逻辑与研究范式
Perry论文题名: Regulatory grammar in human promoters uncovered by MPRA-based deep learning
期刊与年份: Nature,2026。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
本篇问题: MPRA训练的启动子模型能否揭示功能位点、位置规则及细胞状态依赖?
这篇研究把问题缩小到了哪里
读 PARM 时应先接受作者的取舍:暂时拿掉远端增强子、染色质大结构和表观修饰,问一段启动子 DNA 在规定细胞环境中自主驱动转录的能力。已有大模型从 CAGE、RNA 或染色质轨道学习,但这些测量混合了局部序列、远端调控和细胞状态。本文用 MPRA 随机重叠片段直接产生功能标签,让训练目标与最终要解释的局部调控效应更接近。这是实验设计与小模型共同推进的研究范式。
我的推测是,选题来自一个可操作的矛盾:序列扫描能找到大量 TF 模体,却无法告诉我们其中哪些真的工作,以及同一个模体为什么换个位置会改变作用。此处是对论文逻辑的重建,并非作者自述。作者没有先提出复杂的万能模型,而是通过启动子富集提高有效实验覆盖,再用模型补全无法逐一测量的突变和插入。
PARM 输入最长 600 bp 的 one-hot 序列;短片段随机左右补零,并加入载体边界碱基,避免模型只学固定位置或忽略边界产生的新模体。带残差连接的卷积和注意力池化逐级整合局部模体,最终输出一个报告启动子活性值。每个细胞类型或处理条件单独训练,使用论文规定的 Poisson 或异方差损失。因此,条件依赖来自真实条件下的训练数据,而非 DNA 自身携带了‘热休克状态’。这些模型仍是有监督功能回归。附近启动子及重叠片段被放入同一数据折,防止高度相似片段跨训练与评估泄漏。
Figure 1:PARM原理、预测验证与强启动子设计
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
这一图先建立标签含义,再检验模型能否超越记忆天然序列。a 的 RNA 与 DNA 条形码计数归一化测量的是片段自主活性;b、c 用同一启动子附近长度和位置不同的片段,检验模型是否恢复局部功能轮廓。d 的高相关来自未训练启动子内片段平均值,不能读成每个突变都同样准确。e 换到独立慢病毒 MPRA 后仍相关,说明模型捕获了一部分跨实验形式的序列规则;这还不是原位基因表达验证。
f、g 的遗传算法让随机序列经历突变、重组和按模型分数选择,模型只负责定义选择标准。真正防止‘优化模型漏洞’的是 h:不同代数的合成序列被重新实验测量,并加入天然启动子和最强序列关键碱基突变的对照。关键突变降低活性支持序列依赖,但最强合成序列实测趋于饱和,没有随预测分数无限上升。设计工作应记录这种偏离,因为它告诉我们优化目标的可用区间。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 随机基因组片段的条形码MPRA测量流程,以自主启动子活性作为训练目标。 |
| b | VCPKMT启动子附近各片段的实测活性,展示片段位置如何影响表达。 |
| c | 同一批片段的PARM预测,对照b检查局部活性轮廓。 |
| d | 5204个未参与训练启动子的预测与实测平均活性相关,验证跨启动子泛化。 |
| e | 独立慢病毒MPRA片段上的相关,检查实验形式改变后的预测能力。 |
| f | 随机序列通过突变、重组和选择迭代设计强启动子的遗传算法流程。 |
| g | 一个算法实例的群体预测活性随代数变化,展示选择如何提高输出。 |
| h | 天然与合成启动子的预测/MPRA实测对照,并突变最强合成序列的关键碱基,验证高活性及关键序列依赖。 |
Figure 2:多细胞建模与单碱基效应验证
原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。
a 的富集文库是本文的工程贡献:把测序与转染容量集中在启动子附近,让更多重叠片段共同约束模型。b 展示的是各细胞环境分别训练后的表现,不是用一个模型无条件迁移到九个新细胞系。误差线是不同模型折的变异,也不能当作实验生物重复的不确定性。结直肠癌类器官说明这一策略可以用于复杂来源细胞,但不自动证明患者疾病机制已经识别出来。
c 的饱和突变实验把问题从‘序列总体活性’推进到‘改一个碱基会怎样’,d 汇总通过可靠性筛选的启动子与细胞组合。PARM、Enformer、Borzoi 的效应相关有相当波动,且部分比较使用近似细胞轨道,不能概括为小模型全面胜出。e、f 更值得一起读:Borzoi 的召回率较高,PARM 的精确率较高;后者的功能位点筛选更保守。选 AD 候选位点时,追求少而可靠和追求不漏掉潜在机制是不同任务,应保留这一权衡。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 启动子富集MPRA文库的构建流程,增加核心调控区的实验覆盖。 |
| b | 九个细胞系及结直肠癌类器官的预测/真实活性相关,检查跨环境建模。 |
| c | MCF7中CXCR4启动子逐碱基替换的实测与PARM、Borzoi、Enformer效应,比较定位和方向。 |
| d | 七个启动子/细胞环境的单碱基效应相关,系统比较模型。 |
| e | 各模型及FIMO识别实测功能调控位点的召回率,衡量漏掉多少位点。 |
| f | 对应精确率,衡量报告位点中多少具有实验功能。 |
Figure 3:细胞类型和刺激特异的调控位点
原图来源:所用 PDF 文件第 6 页,Figure 3。点击图片可查看原图。
a 用 APOC2 的 HNF4A 位点说明同一 DNA 可以在不同细胞模型中产生不同突变效应;b 再把局部例子扩展成 TF 家族层面的位点数量。这些位点由计算突变效应形状与模体匹配得到,并结合 TF 表达过滤;匹配到某一 TF 家族不等于已经证明具体蛋白结合。相似模体的家族成员仍可能需要额外实验区分。
c 是真实热休克、nutlin-3a 或 PMA 条件的 MPRA 活性变化。d、e 用条件对应模型解释发生变化的局部位点,f 汇总应答的家族,例如热休克的 HSF 与分化条件的 AP1。这里的证据链是‘先测处理后的功能,再训练该条件模型,再用突变推断解释’,不是让一个未见处理的模型预测整个细胞动力学。总位点数量变化不大,也可能隐藏位点身份替换;反过来,位点数增加不能直接等同基因表达等比例增加。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | APOC2启动子在HEK293与HepG2中的计算机内饱和突变;HNF4A位点只在HepG2预测为激活性。 |
| b | 不同TF家族激活位点数量的细胞类型差异,区分相对通用与高度细胞特异的因子。 |
| c | 不同刺激的MPRA表达变化对平均活性散点,定位显著应答启动子。 |
| d | MORF4L2启动子热休克前后预测的突变效应,解释刺激引起的调控变化。 |
| e | INHA启动子PMA处理前后的预测效应,提供另一种信号刺激实例。 |
| f | 刺激后各TF家族激活位点数的增减,筛选参与应答的候选调控因子。 |
Figure 4:功能位点的方向和TSS相对位置
原图来源:所用 PDF 文件第 7 页,Figure 4。点击图片可查看原图。
a、b 设置了关键对照:功能位点的正反方向差异,是否只是 DNA 中该方向模体本来更多?CTCF 的功能方向偏好不能被普通序列扫描的方向计数解释,提示自然启动子上下文参与了这种偏好。这不意味着所有 TF 都遵循方向规则;多数模体的两种方向在这一任务中相近。
c 将功能位点与纯序列模体的位置分布放在同一坐标,功能位点更集中于 TSS 附近。d 展开不同因子,TBP 在已知核心位置附近的峰同时充当生物学合理性检查,YY1、SP1 等则有自己的位置分布。e 保持各细胞热图的排序以便比较。应把结果读为在模型与筛选定义下的功能分布,不能把没有被识别的扫描模体一律宣判无功能;检测阈值、活性范围和未测环境都可能让弱效应遗漏。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | PARM激活位点正反方向数量比较,识别方向偏好。 |
| b | FIMO仅扫描序列模体的方向数量,作为不使用功能效应的参照。 |
| c | PARM功能位点与所有扫描模体相对TSS的位置分布不同,说明模体存在与真正发挥功能有区别。 |
| d | 逐个TF比较功能位点与扫描模体的位置分布,展示特定因子的偏好位置。 |
| e | 各细胞系激活位点的TSS位置热图,检验定位规则及其细胞差异。 |
Figure 5:同一模体随位置产生激活或抑制
原图来源:所用 PDF 文件第 8 页,Figure 5。点击图片可查看原图。
a、b 是从突变方向定义激活与抑制:破坏位点后预测活性下降,原位点被视为激活;破坏后上升则被视为抑制。c、d 的 NRF1 两例说明这个符号依赖启动子背景。它不是给 NRF1 这个蛋白永久贴上正负标签,也不是以归因图直接证明蛋白参与。本文 ISM 用参考减替代值,读图时必须先确认符号,避免与其他论文的替代减参考混淆。
e 将同一模体放到不同位置,并用突变模体作匹配对照;这比简单比较插入前后更能排除增加序列长度、改变间距的影响。f 到 g 是模型提出强对比位置、再由 MPRA 检验的主动验证。图注列出 20 个选中启动子,方法中经过测量质量筛选的最终集合为 19 个,阅读时应区分设计集合与有效数据。下游 NRF1、NFYA、SP1 的抑制趋势得到支持,但高基线启动子中 YY1 的预测激活并未完整出现,作者讨论了饱和效应。这个不一致使‘位置语法’更加可信:它是一套有背景和测量边界的规则,而不是无例外的口诀。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 激活与抑制位点相对TSS分布比较,说明功能符号与位置相关。 |
| b | 各TF的激活/抑制位点总数,展示同一TF模体可能具有两种预测作用。 |
| c | PAGE2B的逐碱基效应显示激活性NRF1位点,提供正向实例。 |
| d | Z99129.3中的NRF1位点预测为抑制性,与c比较说明上下文依赖。 |
| e | 把NFYA、NRF1、SP1、YY1模体系统插入启动子不同位置,热图显示同一模体的效应随位置与序列而变。 |
| f | 对20个选中启动子插入位点预测效应,给出实验前的方向和幅度。 |
| g | 对应MPRA实测插入效应,与f对照验证位置依赖调控语法。 |
我的理解与可迁移启发
最有启发的是任务缩小后,数据可以更接近想回答的因果问题。一个局部 CNN 配合针对性 MPRA 可以解释位置与突变作用,未必需要从头训练大型基础模型。对有限显存的研究者,这提示先选择一种可独立验证的调控任务,并使用冻结大模型作为比较或特征,而不是只比较参数量。本文使用 RTX 6000 训练,小参数量有利于计算可行性,但不能从文中 CPU 内存或训练时长直接推出 16 GB 显存的实测占用。
若迁移到 AD,可针对脑细胞相关启动子与 TE 重叠区提出‘同家族模体为何只在部分拷贝发挥作用’的假说,然后比较位置、邻近模体与细胞条件。现阶段 PARM 的细胞系数据不能替代 AD 脑细胞标签;启动子自主活性也不能解释远端 TE 增强子全部机制。模型预测突变效应、独立报告实验、原位调控和疾病病理关联应分层报告,最后一层仍需要独立疾病证据。这篇论文教会我的不是把所有位点都送进一个分数,而是为分数设计可被反驳的实验。







