58.Akita:原图、模型逻辑与研究范式

58.Akita:原图、模型逻辑与研究范式
Perry论文题名: Predicting 3D genome folding from DNA sequence with Akita
期刊与年份: Nature Methods,2020。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
研究问题: Akita 能否仅凭约 1 Mb DNA 序列预测三维接触图,并解释 CTCF、单碱基变异和结构变异的作用?
难点与构思:从一维序列到位置对
三维接触不是一个位点的属性,而是两个位置及周边背景的关系。已有方法常用染色质标记作输入,难以直接评价新DNA变异;只预测边界又不能覆盖完整接触图。我的推测是,Akita的构思来自把任务直接定义为序列到接触矩阵:先提取一维局部信息,再生成两两位置表示,最后用二维网络传播邻域关系。架构中的一维到二维转换使它能同时处理序列模式和接触几何。
重复元件特别容易暴露这一问题。人模型看到与CTCF相似的模式,会按它学到的人类背景赋予结构作用;鼠B2元素受到的抑制或调节未出现在训练中,便会造成系统高估。比较同一鼠序列在两个模型中的结果有助于定位失配,但要注意训练数据质量、细胞条件和物种同时变化,不能把所有差异纯粹归因于演化。
对反事实序列还需谨慎。翻转或随机破坏全部motif会产生训练分布中少见的序列,它们适合检验模型依赖,却可能放大外推误差。真正独立的编辑测量因此非常重要。模型若对未扰动序列准确,并不能自动保证任意人工变异都准确;应按变异大小、方向、序列背景和对应实验分层验证。局部热图的漂亮变化需要与这一外推边界一起理解。
模型输入、目标与范式
约1 Mb one-hot序列经一维卷积与扩张残差层压缩到2048 bp分箱,位置对特征通过两向量平均产生,并加入距离信息;二维扩张卷积预测接触图,维持对称性。输出裁边后覆盖约917 kb,目标是扣除距离背景后的log observed/expected,而非原始接触读数。监督训练用五个高质量Hi-C及Micro-C目标,均方误差优化各输出。
距离背景校正让模型关注某个区域相对一般距离规律的特殊结构;否则靠两个位置越近接触越多,就能获得看似不错的原始计数预测。训练测试按不重叠区域分开,避免同一局部结构反复进入两侧。模型的方向性与上下文仍由实测接触标签学习,虚拟突变是训练后的解释工具,不是无监督学习或实际细胞编辑。
尤其应将方向翻转、位点破坏和大片段删除分开评价,因为三者对序列及空间关系的改动不同。
从结构预测到遗传解释
本文先验证接触图,再测试CTCF方向与破坏,随后逐碱基评分并联系eQTL,最后比较真实工程删除与倒位。不同层级构成互补证据:计算突变显示模型使用什么,真实编辑提供独立结构变化,eQTL则连接表达遗传信息。接触改变不是表达改变的充分条件,更不直接等于疾病发生。
模型仅看约1 Mb上下文,不能把窗口外的关系当作不存在;细胞特异性也受训练资料限制。图5的人模型和图6鼠模型在与训练不同的实验细胞背景中比较,需要保留这一跨条件限制。所用作者稿中若主图图注跨页,实图仍在前一页,不能将文字续页理解为第二幅结果。
Figure 1|DNA 到三维基因组接触图
原图来源:所用 PDF 文件第 31 页,Figure 1。点击图片可查看原图。
a解释一维序列到二维接触的转换,b展示两个留出区域,c把误差与Spearman相关放在一起。平坦且少特征的图可能误差很低、相关却低,因此相关分数不能脱离图复杂度判断。扣除距离背景是重要控制,测试的成功说明序列能提供区域特异结构信息,而非模型只学了普遍的近距离接触。多任务共享有助于学习共性,但五个输出并不保证已充分捕捉细胞状态差异。
| 子图 | 讲解 |
|---|---|
| a | 1 Mb one-hot 序列经一维卷积抽取特征,转成二维位置对,再预测约 917 kb、2 kb 分辨率的接触图;输出是相对距离背景的 log 接触强度。 |
| b | 两个留出区域的预测与 HFF Micro-C 实测图,比较 TAD、边界和局部接触模式。 |
| c | 各测试区域 MSE 与 Spearman 相关散点;特征少的区域可同时有低误差和低相关,说明相关不能脱离图形复杂度解读。 |
Figure 2|CTCF 和开放染色质对应的结构
原图来源:所用 PDF 文件第 32 页,Figure 2。点击图片可查看原图。
a、b将真实接触与CTCF、DNase背景对应,c提供未扰动预测,d翻转全部CTCF方向,e随机破坏其模式。翻转主要重排结构,破坏则让结构变弱,这一区别支持方向语法,而不只是识别有没有CTCF。破坏后高DNase、低CTCF区域仍可保留一些边界,提示模型并非完全由CTCF支配。但这都是计算操作,不能直接归因于真实细胞中发生了同样的全基因组变化。
| 子图 | 讲解 |
|---|---|
| a | 三个留出区域的真实 HFF 接触图,作为扰动比较基线。 |
| b | 对应 CTCF ChIP-seq、DNase 轨迹,标出结合位点和开放区域。 |
| c | 未扰动序列的预测图,重建真实结构。 |
| d | 把全部 CTCF 基序方向翻转后接触模式改变,显示模型学到方向相关规则。 |
| e | 随机破坏 CTCF 基序后结构变弱,但部分高 DNase、低 CTCF 边界残留,提示不全由 CTCF 决定。 |
Figure 3|CTCF 基序的突出影响
原图来源:所用 PDF 文件第 33 页,Figure 3。点击图片可查看原图。
a把个例拓展到各测试区域,b量化结构信号减少,c量化接触图重排,两种分数分别回答变平和改变形状。CTCF显著突出,为模型学到已知结构因子提供支持;CTCFL共享相似模式,高分不等于它在体细胞中实际驱动相同作用。其他模式与CTCF重叠可能造成关联,需要排除重叠才能提出新的独立因子。图的价值是加入全局对照,而不是由一个好看的突变图命名新机制。
| 子图 | 讲解 |
|---|---|
| a | 逐区域比较破坏全部 CTCF 前后的图信号强度;扰动后动态范围降低,整体图更均匀。 |
| b | 逐类破坏 JASPAR 基序对信号强度的影响,CTCF 的下降明显,评价全局结构维持作用。 |
| c | 以扰动前后均方差衡量接触重排,CTCF 除 CTCFL 外高于其他基序至少约三倍;部分其他高分可能来自与 CTCF 重叠。 |
Figure 4|碱基分辨率结构贡献与 eQTL
原图来源:所用 PDF 文件第 34 页,Figure 4。点击图片可查看原图。
a–c显示核心及侧翼的碱基敏感性,d、e用无偏单碱基抽样检查这些结果在基因组中的分布,f按eQTL因果后验分层,g提出CCZ1附近非典型模式候选。高后验eQTL预测影响较大,支持结构与表达遗传信号相联系,仍不是对每个位点的结构因果验证。g只能说该侧翼序列可能影响边界,图注没有确定增强或削弱方向。实图在PDF34,PDF35仅续图注,不需要第二张图像。
| 子图 | 讲解 |
|---|---|
| a | 500 个 CTCF 周围 500 bp 的饱和突变平均分数,重要位置延伸到核心之外。 |
| b | 一个侧翼高影响位点的全部碱基替换热图及 logo,揭示核心外的具体序列依赖。 |
| c | 第二个对应例子,说明侧翼作用并非只见于一个位点。 |
| d | 十万次无偏单碱基突变按 CTCF、侧翼、启动子、增强子等注释比较扰动分数,评估贡献的基因组分布。 |
| e | 356 个高分变异的层级分类,仍有核心之外的强效位置,支持未完整识别的结构调控序列。 |
| f | GTEx eQTL 按因果后验概率和是否在 CTCF 内分组;高概率变异预测结构扰动较大,但这是计算关联而非直接因果验证。 |
| g | CCZ1 高概率 eQTL 附近的饱和突变,变异位于距 CTCF 约 70 bp 的未知基序,提示该侧翼序列可能影响 CTCF 边界功能,图注未确定增强或削弱的方向。 |
Figure 5|预测工程删除后的结构变化
原图来源:所用 PDF 文件第 36 页,Figure 5。点击图片可查看原图。
a的真实工程删除提供外部参照,b标记被删边界的CTCF簇,c仅修改输入DNA后预测域合并与新接触。这个实验比纯模型扰动更有力,因为目标变化来自已发表的编辑测量。预测使用HFF输出,而实验为HEK293T,应理解为结构共性的迁移示例,不是完全细胞匹配测试。一个成功边界删除也不能说明所有大小、所有位置的SV都同样准确。
| 子图 | 讲解 |
|---|---|
| a | HEK293T 的 Lmo2 区约 25 kb 边界删除前后 5C,两个原隔离域删除后合并,提供真实结构变异参考。 |
| b | 对应 CTCF 结合轨迹,说明被删边界包含三个位点簇。 |
| c | 只修改 DNA 后的模型预测再现域合并和新增接触,与 a 的实验变化对应。 |
Figure 6|跨物种规则和倒位
原图来源:所用 PDF 文件第 37 页,Figure 6。点击图片可查看原图。
a的人训练模型用于鼠DNA时,在计算中破坏B2 SINE反而改善预测,说明它把鼠特有元件中的CTCF位点作用估计过强;鼠数据训练后不再从破坏中获益,指向物种背景可被学习。b用鼠训练模型比较622 kb工程倒位与Capture-C,验证方向相关接触变化。B2结果不意味着真实删除SINE会改善折叠,而是暴露人模型的物种迁移失配。实图PDF37,PDF38仅图注。
| 子图 | 讲解 |
|---|---|
| a | 人训练模型预测鼠基因组,并在计算中破坏鼠 B2 SINE 后与鼠 Hi-C 比较;此举改善预测,说明人模型未学到鼠特有的 B2-CTCF 调控。 |
| b | 鼠训练模型预测 Eph4A 区约 622 kb 倒位,方向性接触变化与 capture-C 对应,验证物种匹配训练与结构变异预测。 |
阅读说明
- 源文件为作者稿,Figure 4 图注续至第 35 页,Figure 6 续至第 38 页。Figures 2–4 的突变多数为计算扰动;Figure 5–6 另有已发表工程变异实验作对照。
依据:对应主图、完整图注及正文 Results;实验结果只按本文给出的对象和条件解释。
我的理解与可迁移设计
图6对演化与TE研究很有启发:相同核心motif在物种特有重复背景中可能受不同调节,不能只按核心数量推断功能。对AD可以研究TE背景是否改变某些结构或可达性规则,但需用对应脑细胞与物种数据检验;人鼠模型差异不自动等于人类疾病来源。物种迁移失败也可能是训练分布差异,必须设置同物种及序列匹配对照。
在16GB显存设备上,我会先用现成模型对严格筛选的候选位点做局部推断,并用ATAC、CTCF或公开接触证据筛选适用范围。风险变异的结构分数再与精细定位和基因证据交叉,单独列出窗口边界、训练细胞不匹配及重复可比对性的限制。若没有脑接触资料,模型只提供结构假设,不能把它当成AD病理接触真值。创新更可能来自控制好TE背景并发现可外部复现的规律,而非直接宣称生成患者的真实三维基因组。








