78.DeepCpG:原图、模型逻辑与研究范式

78.DeepCpG:原图、模型逻辑与研究范式
Perry论文题名: DeepCpG: accurate prediction of single-cell DNA methylation states using deep learning
期刊与年份: Genome Biology,2017。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
本篇问题: DNA与邻近CpG信息能否补全单细胞甲基化,并揭示表观异质性的序列基础?
模型为何从“缺失值”出发
单细胞甲基化能看到细胞差异,却只能覆盖一部分 CpG。简单地把缺失填零,会把未测到误认为未甲基化;按全部细胞平均,又可能抹掉状态差异。DeepCpG 的问题因此是如何借用邻近位点与跨细胞信息,同时保留 DNA 序列提供的规律。对研究思路的重建属于我的推测:作者将数据来源拆开,分别学习空间邻域和序列,再融合,便于测试谁真正提供了预测信息,而不是让一个黑箱同时承担所有任务。
DNA 模块通常读取以目标 CpG 为中心的 1001 bp one-hot 序列。CpG 模块先把每个细胞左右各 25 个邻居的状态与距离压成向量,随后双向 GRU 扫描的是这些细胞向量;它不是沿 DNA 位点逐一循环。联合层为训练集合的各个细胞输出目标 CpG 的甲基化概率,以已观察到的二元状态计算负对数似然,缺失位置不计入损失。两个模块先独立训练并冻结,再训练联合层。这是监督插补范式,没有使用疾病标签,但不能因此称为纯无监督疾病发现。
Figure 1:单细胞甲基化缺失值预测
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
a 最需要记住的区别是 0、1 与问号:前两者是经过读数处理的状态,问号表示没有证据。b 的模块化使作者可以用图 2 的消融分辨信息来源;不同细胞共享 DNA,却有不同邻域甲基化,所以序列不是唯一决定项。双向 GRU 可减弱特定扫描方向的影响,但一般双向循环并不在数学上保证任意细胞排列完全不变,复现时仍应检查顺序稳定性。
c 的平滑轨迹是补全结果,d 是从预测相关性中寻找候选序列规律,两者证据等级不同。插补可以支持下游分析,却不会自动增加独立样本数。原输出层与这组细胞对应,也不能把邻域模块可接收不同数量的输入,误解成整个训练模型可不经调整直接预测任意新细胞。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 单细胞CpG稀疏矩阵以0、1和未知表示,定义需要填补的缺失数据。 |
| b | DNA卷积模块与CpG邻域模块联合预测;邻域先在每个细胞内汇总,再由双向GRU扫描不同细胞的摘要。 |
| c | 训练模型用于全基因组缺失CpG状态填补,展示主要应用。 |
| d | 从模型发现与平均甲基化及细胞间变异相关的模体,展示机制探索用途。 |
Figure 2:跨细胞、覆盖度和基因组环境的预测验证
原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。
a–c 逐步比较全部模型、DNA/CpG 单模块与覆盖分层,显示邻近甲基化信息通常比单独 DNA 更强,两者融合最好。这个结果很实在:局部状态相关性提供的插补优势,不应全部包装为网络发现了深层序列机制。d 在不同基因组环境比较,检查整体指标是否主要来自容易预测的 CpG 岛;低覆盖和高变异区域的增益更接近实际缺失数据问题。
e 展示不同细胞类型与测序技术上的适用性,但各数据集分别训练和选择模型,不能据此声称同一个模型在未见细胞类型中零样本泛化。评估按染色体留出,排除了目标位置的直接训练复现;同一组细胞的邻域信息仍参与预测,这是任务允许的条件输入,和留出全部供体的评价不是同一件事。已测位置上的留出准确率也不完全代表真正缺失区域,尤其 RRBS 对 GC 丰富区域有选择性,需考虑缺失机制。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 血清培养小鼠胚胎干细胞中的AUC与随机森林、窗口/细胞平均基线比较。 |
| b | 完整模型对DNA单模块、CpG单模块的性能,检验两类信息的互补。 |
| c | 按CpG覆盖细胞数分层的AUC,评估数据稀疏程度的影响。 |
| d | 不同基因组环境的AUC,检查CpG岛、启动子等区域的表现差异。 |
| e | 2i干细胞及不同测序方案的人肝癌、HepG2等数据上的性能,检验环境与技术泛化。 |
Figure 3:与甲基化相关的序列模体
原图来源:所用 PDF 文件第 5 页,Figure 3。点击图片可查看原图。
这幅没有字母的总图将卷积模体的出现模式做 PCA,颜色表示与模型预测甲基化的关联,大小表示平均活跃程度。相近点说明模式常在相近序列环境出现,而不是两个 TF 已被证明直接相互作用。CG 丰富模体与低甲基化、AT 丰富模体与高甲基化吻合,也可能部分反映 CpG 岛、启动子等组成差异;要提出某个 TF 的直接作用,需要在匹配 GC、CpG 密度与注释后继续检验。
三角形是与数据库模体显著匹配,未匹配的圆点不是已发现的新蛋白。模体重要性在 Methods 中主要用活跃程度与预测值的相关衡量,不能称为真实 TF 去除后的甲基化效应。已知因子与甲基化酶的关联为机制提供背景支持,但并没有在这张图里完成因果干预。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| 全图(无字母) | 128个模体按出现模式PCA排列,颜色表示对甲基化的关联方向、大小表示活跃度、三角表示已知匹配;周围logo展示代表模体,区分与低或高甲基化相关的序列家族。 |
Figure 4:单碱基突变效应的距离依赖
原图来源:所用 PDF 文件第 6 页,Figure 4。点击图片可查看原图。
曲线比较的是模型对序列变化的局部敏感度,Methods 使用一阶梯度近似,再取各替换的最大绝对效应。它没有实验制造这些突变,也不是逐个完整重跑后的全部非线性变异效应。靠近目标 CpG 的变化更大,说明模型依赖近邻序列;不同环境曲线不同,则说明敏感度依赖背景。
CpG 岛、启动子的低敏感度被作者解释为较稳健的甲基化环境,这是合理的候选解释,还可能受到输出概率接近边界、特征冗余等模型因素影响。要把“预测稳健”提升为“生物学抗突变能力”,应使用独立 mQTL、等位甲基化或编辑实验,并检查预测方向与校准。特别是突变改变 CpG 本身时,目标是否仍存在也要定义清楚,不能把缺少位点当作甲基化状态下降。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| 全图(无字母) | 各基因组环境的平均预测突变效应随距CpG位置变化,最近邻影响最大;CpG岛/启动子总体效应更小,表示不同序列环境的稳健性不同。 |
Figure 5:序列代码与细胞间甲基化差异
原图来源:所用 PDF 文件第 7 页,Figure 5。点击图片可查看原图。
a–c 明确试图区分平均甲基化与细胞间变异,避免所有中间甲基化水平都被自动命名为异质性机制。为此作者另训练 DNA 网络,复用并固定模体层,同时以均方误差预测多个窗口尺度的均值与方差。图中不是原联合插补器凭空输出“异质性因子”,而是一个新的监督任务。
d 在留出染色体上显示序列可以解释部分变异,但方差标签先由窗口内观测计算,包含技术噪声、覆盖和不同细胞状态混合的影响。对二元过程,均值与方差本来有关系,作者用两种相关的差来筛选更偏向方差的模体,能够缓解混淆却并未完全正交化。b 的保守性关联同样可能受启动子与增强子组成影响。预测变异与表达联系虽显著但很弱,不能只报告显著性而省略效应强度,更不能把这些序列规律称为疾病进展的直接驱动。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 模体对细胞间变异与平均甲基化的效应差,筛出主要关联异质性的模体。 |
| b | 模体活跃度对序列保守和细胞间变异的相关,检查进化约束与表观异质性关系。 |
| c | 选中模体logo,展示a、b中候选序列结构。 |
| d | 测试染色体不同环境的预测/真实细胞间变异及相关,检验仅序列能否解释部分异质性。 |
对 AD 无监督路线的具体启发
这篇提供了一种更细的问题定义:先预测正常情况下序列与邻域能解释的甲基化结构,再研究独立样本中偏离结构的部分。AD 项目可以把残差作为候选中间表型,检验它是否随病理负担改变;不过作者在本文仅提出残差研究方向,并没有完成这种疾病分析。训练、阈值选择与病理关联检验需要分开,模型也要按供体留出,防止邻域聚合将同一人的信息传到评价集合。
若研究 TE,可比较同家族拷贝的甲基化均值与异质性,匹配序列、可比对性和覆盖,再问差异是否聚焦于某细胞调控状态。首先要测出足够可靠的变异,再谈插补。填得更满可能改善可视化,却可能压低真实少数状态或将噪声传播成平滑结构。建议同时保留原始观测掩码,主结论在实测高覆盖子集复现,插补仅用于敏感性分析与候选排序。这样模型才是在补充证据,而不是制造证据。
疾病脑组织还有非CpG甲基化等其他现象,本文二元CpG任务没有覆盖这些内容,不能仅换一组脑数据就声称恢复完整神经元甲基化程序。模型迁移时应先定义实验分辨率和目标,再选择适当标签与损失。







