76.DeepMEL:原图、模型逻辑与研究范式

76.DeepMEL:原图、模型逻辑与研究范式
Perry论文题名: Cross-species analysis of enhancer logic using deep learning
期刊与年份: Genome Research,2020。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
本篇问题: 黑色素瘤增强子的细胞状态代码如何跨物种保守,又如何因突变而改变?
物种比较怎样进入增强子研究
黑色素瘤 MEL 与 MES 状态已经有表达和开放度的定义,真正未解的是:这些状态由怎样的增强子组合代码维持,这套代码是否跨物种保留?作者建立六物种 ATAC 比较,再训练 DeepMEL。对构思的重建属于我的推测:进化在不同序列中保留功能,也会改变模体,这相当于提供大量天然扰动;模型则帮助比较传统比对难以识别的功能组合。这不是把物种按某条“进步阶梯”排列,也没有研究 AD 的演化起源。
DeepMEL 输入 500 bp 的 DNA,预测 24 个共开放主题的多标签。主题由人类 bulk ATAC 重采样后经 cisTopic 得到;这是无监督构建标签、再进行监督序列分类的组合,不能把全部网络训练称为无监督。CNN 提取局部模体,双向 LSTM 整合模体关系,正反互补序列分别经过同一网络后平均输出,二元交叉熵训练。主题标签比每个细胞系的开放标签更接近共享调控程序,这是本文重要的设计选择;但模型输出仍是主题归属分数,既不是增强子活性值,也不是患者风险。
Figure 1:跨物种保留的黑色素瘤两种细胞状态
原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。
A–C 先区分“能映射到人类坐标”与“在对应位置也开放”。传统 liftOver 的覆盖条件和不同基因组质量会影响这个结果,不可比对不等于无功能。D 的主成分同时包含物种和细胞状态,说明进化与状态差异并存;把全部物种直接聚类,并不能自动发现一种普适疾病亚型。E 的 MLANA、MMP3 个例给分组提供生物学参照,但多数非人类样本处于 MEL,只有狗提供 MES 对照,跨物种两状态的支持并不均衡。开放只是候选调控证据:即使区域跨物种都开放,也尚未证明它们激活相同基因。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 六物种进化树及26个细胞系三个区域的ATAC,展示比较范围及跨物种开放差异。 |
| B | 人SOX10位点的MEL与MES开放轨迹,说明两种状态的典型差异。 |
| C | 每物种开放区能否比对及在人同源位置保持开放的数量,区分序列保留与功能保留。 |
| D | 29619个可比对区域开放度PCA,检查样本主要按物种还是细胞状态组织。 |
| E | 各物种MLANA和MMP3附近轨迹,提供MEL及MES状态保守的具体实例。 |
Figure 2:MEL和MES主调控模体的保守
原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。
A、B 在人和狗各自比较 MEL/MES,避免把物种差异误认为状态差异。C–E 用分支长度衡量模体在多个物种保留,并与打乱序列比较;它考察的是模体模式在预先筛选的保守开放区中是否突出,而非全基因组无偏的自然选择检验。保守区域中有大量启动子,SP/KLF 等富集部分来自这个组成,作者另看远端区有助于拆开通用启动子与状态特异调控。模体家族相似还意味着 SOX、E-box 不直接指定 SOX10 或 MITF,具体命名要结合已知状态、表达及后续结合实验。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 人MEL/MES差异开放区热图与富集模体,识别状态相关TF家族。 |
| B | 狗MEL/MES差异区与模体,检验相同代码能否在另一物种发现。 |
| C | 用支系长度评分BLS衡量同源开放区模体保守的流程。 |
| D | 哺乳动物MEL同源开放区的模体BLS分布,标出最保守TF模式。 |
| E | 六物种共同开放区的BLS分布,检查更广进化跨度仍保留的模体。 |
Figure 3:DeepMEL增强子分类与变异解释
原图来源:所用 PDF 文件第 6 页,Figure 3。点击图片可查看原图。
A、B 的主题不是单细胞实测群体:作者从 bulk 中抽取 reads 构造模拟细胞,以捕获样本之间的共开放模式。这增加计算表征,不增加独立样本数。C–F 用二号染色体留出与打乱标签对照,证明网络能学到序列规律;ROC 与 PR 分别回答排序和稀少阳性检索问题,不能只读较漂亮的一项。G、H 把逐碱基归因与独立 IRF4 饱和突变 MPRA 比较,是本图最关键的桥梁:开放主题训练得到的序列特征,对这个增强子的报告活性也有信息。
I 的领先不能推广成所有增强子都优于通用模型:DeepMEL 专门学习黑色素瘤,而对照模型的任务与数据更广。另一个值得模仿的比较是主题训练与直接 ATAC 标签训练,但收益应在多条独立增强子上检验,单条 IRF4 仍可能偏向特定模体结构。分类分数差异的方向与报告活性变化一致时,才有更具体的变异功能证据。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 人细胞系cisTopic主题热图,定义共享和状态特异区域集合。 |
| B | MIA附近MEL及SERPINE1附近MES主题区域的轨迹,展示主题的生物含义。 |
| C | 以24个开放主题训练多标签序列模型的流程,说明共开放主题分类目标;cisTopic 标签无监督获得,后续 DNA 网络为监督训练。 |
| D | MEL/MES区域训练、测试与打乱对照的ROC,验证序列分类能力。 |
| E | 同一任务精确率—召回率,检验稀少阳性下的预测质量。 |
| F | MEL和MES分类最重要卷积核,寻找各状态调控模体。 |
| G | IRF4增强子双链归因、MPRA与计算机内逐碱基效应,检验关键碱基定位。 |
| H | IRF4实测对预测突变效应相关,定量验证G。 |
| I | 主题训练、直接ATAC训练及其他模型的IRF4变异预测性能,评估训练目标选择。 |
Figure 4:人训练模型的跨物种应用
原图来源:所用 PDF 文件第 8 页,Figure 4。点击图片可查看原图。
A 用人训练、狗实测差异区评估,提供跨物种泛化的独立功能标签。B 将其他物种开放区按状态代码评分,显示相似程序可以存在于不同背景。C 利用中间层比较同源基因附近的增强子,D 的 ERBB3 个例说明功能相似模式有时比整段序列比对更稳定。然而邻近同源基因加表示相似,首先建立的是候选功能对应;它不足以独立证明增强子本身严格同源。趋同产生相似模体、同基因附近的冗余增强子,都可能造成这种相似。
尤其在斑马鱼两个候选区上,相近组合支持共同起源或复制的假说,但判定复制史还需要共线性、系统发育及更多物种,而不是由一个模型相关系数直接裁决。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | DeepMEL与模体扫描方法在人及狗MEL/MES分类的比较,检验迁移优势。 |
| B | 所有物种样本中MEL/MES预测区域比例,检查模型是否再现状态差异。 |
| C | 同源MEL基因附近增强子嵌入相关对非同源基因参照,检验调控表示的跨物种对应。 |
| D-I | 人与其他物种的支系距离,为跨物种结果提供进化尺度。 |
| D-II | 六物种ERBB3区域ATAC及模型预测增强子,标出传统liftOver找到或漏掉的区域。 |
| D-III | 同源ERBB3增强子的归因比对及点突变/插缺位置,展示功能代码在不同序列中仍可保留。 |
Figure 5:MEL增强子的核心调控组合
原图来源:所用 PDF 文件第 9 页,Figure 5。点击图片可查看原图。
A 将卷积匹配与归因结合,以过滤只像模体却对主题输出无贡献的位置。B、C 的八种组合说明代码在伙伴搭配上有弹性,D 的独立 ChIP 为预测位点增加实际结合证据,E、F 再考察狗中的对应。需要注意集合本身先经过模型 MEL 分数筛选,再用同一模型解释;所有候选都有 SOX 模体既反映真实规律,也受筛选机制影响。SOX10 敲低后的闭合比单纯“全部预测都有 SOX”更能支持必要性。
模体在同一区域共现,不等于四个 TF 总在同一分子上同时结合。ChIP 集合的共富集提供群体结合证据,所谓核心调控组合仍应按不同模态分别读,不能把八类组成压成一个固定四蛋白复合物。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 把卷积核匹配与归因结合打分模体的流程,减少仅序列匹配产生的候选。 |
| B | MM001的3885个MEL区域中SOX、TFAP2A、MITF、RUNX模体数量热图。 |
| C | 同一集合二值化热图,展示模体的存在组合与区域分群。 |
| D | 各组合群的SOX10、MITF、TFAP2A ChIP信号,检查模体组合是否对应实际结合。 |
| E | 人区域组合Venn图及例子,描述核心模体共现。 |
| F | 狗区域组合Venn图及例子,与人比较跨物种组合代码。 |
Figure 6:SOX10与TFAP2A的空间定位
原图来源:所用 PDF 文件第 10 页,Figure 6。点击图片可查看原图。
A 的真实敲低实验把 SOX10 与 TFAP2A 的作用区分开:一者去除使所示区域基本关闭,另一者降低开放度,支持开创与稳定的不同功能。B–E 的核小体位置则来自 DNA 序列预测工具,并非在这些细胞中直接测得的核小体定位。因此 TF 相对核小体边缘或中心的偏好,是与机制一致的线索,尚不足以证明蛋白在真实核小体上以该位置开始结合。敲低经过 72 小时,也可能包含状态转换的间接后果。
这组图的优点在于没有仅凭 logo 命名蛋白功能,而是把位置、独立敲低和开放变化接在一起。下一步若要更强因果结论,可用早期时间点、结合测量及局部模体编辑拆开直接开创作用与下游细胞状态效应。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 人增强子模体、核小体预测及两TF敲低ATAC,检查不同因子对开放结构的作用。 |
| B | 狗增强子的模体与核小体位置预测,检验结构规则跨物种是否对应。 |
| C | 核小体起始和中心位置示意,解释后续曲线坐标。 |
| D | 按开放峰顶或TF模体对齐的核小体起点,比较SOX10与TFAP2A位置偏好。 |
| E | 对应核小体中心分布,进一步判断模体相对核小体的定位。 |
Figure 7:解释跨物种增强子功能变化的突变
原图来源:所用 PDF 文件第 11 页,Figure 7。点击图片可查看原图。
A–C 的 APPL2 区域开放、报告活性和模型分数共同变化,定义了功能分歧;D、E 的逐个天然差异替换给出候选解释。但报告实验比较了整条人狗序列,没有逐一测完四个关键替换的必要性和充分性,所以不能把每个模型高影响突变都当成已验证的进化因果位点。F 固定其他三个模体数,再考察 SOX 获得/丢失与开放变化,减少伙伴组成混杂,仍不是随机干预实验。
G 在同一个人类 MM001 细胞中比较六条人/狗增强子的荧光素酶,较好地固定了反式背景,支持 DNA 本身携带部分活性差异;样本很少,MITF 的活性关联仍需更广泛设计。开放与活性有时不一致,恰好说明“开门”和“执行转录”应作为两类读出分别建模。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 狗APPL2上游区域开放而人同源区不开放,定义进化差异实例。 |
| B | 同一区域报告活性,验证开放差异对应功能变化。 |
| C | 人/狗序列24个主题分数,检查模型能否再现状态活性差异。 |
| D | 逐个模拟人狗差异碱基对狗MEL分数的影响,筛选可能导致功能丢失的突变。 |
| E | 人狗归因及全部单碱基效应,突出破坏SOX10、MITF、TFAP2A位点的四个差异。 |
| F | SOX10位点获得/丢失数量对跨物种ATAC差异,检验该机制的总体关联。 |
| G | 六个人/狗增强子的荧光素酶及模体数,实验验证跨物种代码与活性关系。 |
我从这篇学到的研究策略
对 AD 与 TE,可以先发现某细胞状态的共开放程序,再问它由哪些家族拷贝的模体结构承载,最后比较跨物种功能保留与人类特异获得。这里要同时保留三个坐标:历史同源关系、实测调控状态、模型学到的功能相似性;三者一致时证据更强,三者分离时反而可能产生有价值的问题。年轻 TE 往往无法进入严格多物种比对,不能把这类缺失简单编码成低功能。
资源方面,原文确实使用 16 GB P100 训练该较小网络;这提供了同级显存可行性的实证,仍需对本机软件、序列数量和 batch size 重新测量。可以借鉴问题分解与主题标签,不必照搬旧版 LSTM。真正需要新增的证据是:独立供体和独立报告实验表明,TE 内的特定组合解释了总开放度之外的变化;否则“跨物种加深度学习”只是工具叠加。









