69.Basset:原图、模型逻辑与研究范式

69.Basset:原图、模型逻辑与研究范式
Perry论文题名: Basset: learning the regulatory code of the accessible genome with deep convolutional neural networks
期刊与年份: Genome Research,2016。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
本篇问题: 卷积序列模型能否学到多细胞开放染色质代码,并解释调控变异?
为什么从开放染色质学习序列规则
Basset 的出发点是:GWAS 给出了非编码候选,开放染色质图谱也标出了区域,但仅凭二者重叠还不知道哪个碱基真正影响调控。作者把实验测得的区域开放转换成序列监督任务,随后在模型中逐一改碱基。这使研究从‘是否落在一个峰里’推进到‘它是否改变这个峰的序列驱动潜力’。另一方面,尚未出现开放峰的序列,也可能因突变获得新的结合位点。
我的推测是,研究想法来自把三种条件接起来:多细胞 DNase 数据已足够大,CNN 可以自动发现局部模体并组合它们,普通实验室又需要能迁移到自己细胞的数据工具。论文因此既是多任务预测研究,也是一项开放软件与迁移学习研究。以上是我按论证重建的思路,不是作者对动机的原话。
模型输入合并 DHS 中心的 600 bp one-hot DNA,三层卷积、池化和两层全连接后,输出 164 种细胞的开放概率,采用多输出二元交叉熵。标签不是连续 DNase 强度,也不是疾病状态。每个输出头代表训练数据里的细胞环境;同一序列在不同细胞得到不同值,源于学习到了细胞间不同的实验开放模式,而非模型显式输入了该细胞实时 TF 浓度。
Figure 1:Basset多任务序列卷积模型
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
第一层共享卷积核可在任意局部位置识别序列模式,池化让短距离移动不至于完全改变识别;更深层可整合多个模式的位置关系,最终多任务输出共享底层信息。卷积核在 DNA 上有类似 PWM 的作用,但不是作者先把已知 TF 模体写入网络,它们在训练中学得。后续匹配数据库才是解释步骤。
这张结构图帮助理解能力边界:输出是整段是否开放的标量,没有逐碱基切割轨道,也没有远端增强子到基因的连接。之后的饱和突变虽可定位敏感碱基,仍然在询问同一个局部开放度函数。不能因为解释图分辨率高,就以为原模型已经预测了精确 TF 足迹或全基因组表达。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| 全图(无字母) | DNA独热编码经卷积、池化和全连接层输出164种细胞的DNase开放概率;第一层类似模体扫描,后续层组合位置与方向信息。 |
Figure 2:细胞特异开放度预测
原图来源:所用 PDF 文件第 3 页,Figure 2。点击图片可查看原图。
A 的热图是实际训练标签,说明开放区域大量共享又有谱系差异,多任务学习可以利用这种结构。所谓某细胞的负例多来自其他细胞开放、该细胞关闭的合并区域,不等于从整个基因组随意取出的完全背景。这个定义使模型尤其善于判断已有候选开放区域的细胞分布,不能将测试 AUC 无条件推广到整条染色体的新峰发现。
B、C 显示在此设置中 Basset 优于 gkm-SVM,并保留不同细胞表现的变化。但 gkm-SVM 由于计算限制用较小子样本训练,比较包含扩展数据能力的收益,不能全部归因于网络架构。原文另外报告 PR 指标并承认精确率限制,提醒我们高 ROC AUC 与可用于全基因组的低误报并不是同一回事。其随机区域拆分也比现代的染色体与同源簇留出更宽松,复用研究时应重新设计验证。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 约200万个开放位点在164种细胞的聚类热图,展示共享与特异的开放模式。 |
| B | 50种细胞的Basset对gkm-SVM AUC散点,比较深度模型与当时的序列核方法。 |
| C | 覆盖AUC分布不同分位的五种细胞ROC,说明性能跨细胞类型的差异。 |
Figure 3:卷积核识别已知与新模体
原图来源:所用 PDF 文件第 4 页,Figure 3。点击图片可查看原图。
A 将卷积核的信息量与消融影响并列,区分‘看起来像明确模体’与‘实际参与预测’。消融把该核输出设为平均值,检查网络失去这条信息后怎样变化;这是网络内部干预,不能当作敲除 TF 的细胞实验。B 的数据库匹配提供已知结合规则的外部支持,匹配不到的核也可能是 GC、CpG 或已知模体片段,不能全部称为新 TF。
C 按各细胞预测受影响的模式聚类,已知上皮发育相关模体出现在相近功能群,说明特征不只识别序列,也带有细胞使用情境。不过重复的卷积核可能共同表示一个 TF 的不同长度片段;核数量不能直接等于 TF 数量。可迁移的做法是把序列相似性、消融影响与细胞特异性同时看,再决定值得进一步检验的调控程序。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 300个首层卷积核的信息量与消融影响分数,观察复杂模体是否更影响预测及其数据库匹配情况。 |
| B | 45%卷积核可注释到已知TF模体,并展示匹配序列,验证模型学到生物序列规律。 |
| C | 按不同细胞的预测影响聚类出的TP63、GRHL1、KLF模体群,连接模型特征与上皮发育调控。 |
Figure 4:饱和突变定位功能碱基
原图来源:所用 PDF 文件第 5 页,Figure 4。点击图片可查看原图。
A 在所有单碱基替换下计算开放预测变化,loss 是可能造成的最大下降,gain 是可能造成的最大上升。当前 AP-1 模体出现高 loss,并有 JUN/JUND ChIP 和保守性支持,形成‘模型敏感位点—已知模体—独立结合证据’的链条。它支持这个实例的解释,但 ChIP 结合并没有直接测量每个替换后的开放变化。
B–D 将这一思想与演化约束比较。loss 的相关明显,gain 的相关较弱,联合后改善,说明某个位置不仅要保留现有功能,也可能要避免获得不恰当功能。需要注意相关由跨细胞分数经回归聚合而来,且分析限定非重复区域和 DHS 中心;不能称为已经验证所有 TE 碱基。统计显著与效应强度不同,原文的相关程度有限,仍有大量序列效应未被解释。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 测试区域逐碱基替换的开放度变化、gain/loss分数及保守性,突出AP-1模体并有JUN/JUND ChIP结合支持。 |
| B | 全基因组loss分数对PhyloP,检验预测受损碱基是否受进化保守约束。 |
| C | gain分数对PhyloP,展示获得功能分数与保守性的关系较弱。 |
| D | 联合gain与loss后的保守性关系更强,说明两类效应结合提供更多功能信息。 |
Figure 5:SAD用于GWAS变异解释
原图来源:所用 PDF 文件第 6 页,Figure 5。点击图片可查看原图。
A 把高 PICS 因果概率候选与附近低概率 LD 变异对比,检验 SAD 是否提供与统计精细定位一致的信息。PICS 概率是另一种推断,不能代替实验确证的因果标签;跨所有细胞平均 SAD 也可能稀释真正的疾病细胞环境。它更适合被看作候选排序证据。
B 的 rs4409785 形成 CTCF 模体并大幅改变预测,C 在已有 ChIP 数据中看到显著峰对应 C 等位,提供了独立支持。证据到达等位相关结合和开放潜力,尚未直接证明它通过远方 TYR 导致白癜风。靶基因距离很远,长程联系是待测假说;本文局部模型没有输出其接触关系。这种区分也适用于 AD:提出机制链的每一段,应逐段寻找相应数据,而不是把所有段压缩成‘致病位点’。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 高因果概率GWAS SNP比附近低概率SNP更常得到高开放度差异分数,验证SAD富集潜在因果变异。 |
| B | rs4409785的T与C等位预测:C形成CTCF模体并显著提高开放度,提出具体机制。 |
| C | 88种细胞CTCF ChIP读段和等位类型,显著峰都携带C,支持B的等位特异结合预测。 |
Figure 6:公共预训练用于新数据集
原图来源:所用 PDF 文件第 7 页,Figure 6。点击图片可查看原图。
A 将 149 种细胞预训练模型作为新细胞单任务模型的初始化,再用该新细胞数据训练,测试迁移是否省数据与计算。新细胞并不是无需标签便被正确预测,它仍需要自己的开放数据。肾皮质上皮例外说明某些任务更受益于相似细胞共同训练,迁移不是统一收益。
B 的训练时长是当年硬件与实现条件下的测量,表明预训练初始化可以显著降低适配成本。现代硬件可能更快,但输入、模型与软件变化也影响结果,不能按 GPU 名称直接换算。对于个人显卡,最值得借鉴的是先复用表示、仅针对合理的新环境适配,并用独立基因组划分检查它有没有保持泛化,而不是因训练快就默认可靠。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 全164细胞多任务模型与先149细胞预训练再加入新细胞的AUC比较,检验少量新数据适配;多数表现有效,肾皮质上皮例外受联合训练帮助。 |
| B | 预训练初始化降低GPU训练耗时,并让CPU训练可行,展示方法的计算成本收益。 |
我的理解:两种变异后果应同时考虑
这篇论文最早把我熟悉的‘峰重叠注释’向前推了一步:一个 TE 内变异可以破坏已有调控模体,也可以把沉默拷贝推向开放状态。两种方向都值得研究,尤其不能因为参考基因组中没有峰,就把潜在 gain 排除。可以对同家族拷贝做匹配背景,比较疾病候选的 gain 与 loss 分布,独立验证具体序列变化。
但 Basset 不是 AD 风险模型。局部开放预测后,还要确定脑细胞环境、靶基因和表达或剪接后果,再讨论病理关联。原研究的非重复保守性分析不能直接支持新 TE 结论;新的项目应按家族、可比对性和相似序列簇留出,避免网络记住同类拷贝。它的真正启发是让计算结果形成可以逐步验证的机制假说,而不是把概率变化直接写成疾病因果。








