72.DanQ:原图、模型逻辑与研究范式

72.DanQ:原图、模型逻辑与研究范式
Perry论文题名: DanQ: a hybrid convolutional and recurrent deep neural network for quantifying the function of DNA sequences
期刊与年份: Nucleic Acids Research,2016。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
本篇问题: 卷积与双向循环网络结合能否改善DNA功能预测并捕捉模体依赖?
研究问题:模体识别之后还缺什么
DanQ 提出,识别一个模体与理解它在一段 DNA 中如何组合是两件事。卷积适合共享一个局部扫描器,但在当时常用架构中,较远模体之间的顺序与关系可能没有被充分整合。作者用双向 LSTM 接在卷积之后,让网络阅读已经提取的局部特征,再完成多种染色质功能预测。这是一项架构替换与统一基准比较研究。
我的推测是,作者将序列模型在语音和文本中的依赖建模方法迁移到 DNA:不让 LSTM 从原始四种碱基开始,而先由 CNN 降低长度、识别局部模式,再由循环层处理模式间联系。这个组合把‘局部特征’与‘上下文整合’分工,具有清楚的工程动机。以上是我对想法形成过程的推断,而不是作者原话。
输入是中央 200 bp 标注区域周围的 1,000 bp one-hot DNA,输出 919 个 TF 结合、DNase 与组蛋白峰的二元概率,训练目标为多任务交叉熵。训练、验证、测试沿用 DeepSEA 的染色体拆分和反向互补流程,有助于降低数据处理差异对比较的干扰。这里的‘grammar’首先是一种建模假说:更好的功能预测与已知模体支持其合理性,正文并没有逐对模体进行间距编辑来证实具体语法。
Figure 1:卷积加双向LSTM的DanQ结构
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
流程图将模型拆成卷积扫描、池化、双向 LSTM 和全连接预测。池化减少需要循环处理的空间位置,提高可行性,但也会损失一定精确位置信息。双向表示来自从左向右和从右向左处理同一序列,它不等于自动实现 DNA 反向互补对称;本文仍需要显式加入反向互补,并在测试时平均两种方向预测。
作者把 LSTM 放在卷积之后,希望每个局部模式的解释依赖附近或较远模式。不过隐藏状态是统计表示,不能把其中某个单元直接命名为‘协同因子’。最终每个输出仍是中央窗口的静态功能标记,模型并没有沿染色体连续输出,也没有模拟细胞时间进展。它的可见范围为 1 kb,不能因为循环网络能处理长依赖就宣称已包含任意远端增强子。
多任务共享局部特征也有代价:不同细胞数据的噪声、覆盖和正例数量不同,而同一参考序列对应的是多个实验环境。共享表示可以借助相关任务,但不能恢复没有进入标签的细胞状态。设计脑细胞模型时,应先检查目标细胞的可用数据是否真实独立,避免把多个相近实验当作独立供体证据。若全部任务平均值提高,却在疾病相关的少数细胞上下降,也不能据平均值选择模型。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| 全图(无字母) | 卷积扫描模体、池化降维,再用双向LSTM学习模体的方向与空间依赖,最后预测各表观标记概率。 |
Figure 2:ROC维度的预测性能
原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。
上部两个目标示例显示 ROC 曲线的改进,下部按全部 919 目标画出成对 AUC,避免仅挑出一两个表现好的 TF。94.1% 目标更好说的是获胜目标比例,不是总体准确率提高 94.1%,绝对 ROC AUC 收益通常小得多。实例同时涵盖不同细胞与因子,有助于看清方法收益不是单一目标特例。
正文将 ROC 表现较高与阳性稀少联系起来,这一点应精确理解:在固定阳性与阴性得分分布下,ROC AUC 并不会因简单改变类别比例而数学上自动提高。但在稀少阳性应用中,很小的假阳性率也可能产生大量错误候选,因而高 ROC AUC 不充分保证实际筛选质量。下一张 PR 图正好回答这个实际问题。不能把作者的提醒变成‘类别不均衡会自动使任何模型 ROC 虚高’的通用定理。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| 上部GM12878 EBF1 | 三种方法在EBF1目标上的ROC曲线,比较真实阳性与误报的权衡。 |
| 上部H1-hESC SIX5 | SIX5目标的ROC曲线,提供不同细胞及TF的实例。 |
| 下部AUC散点 | 逐目标DanQ对DeepSEA ROC AUC,DanQ在94.1%的目标上更高。 |
Figure 3:精确率与召回率维度的预测性能
原图来源:所用 PDF 文件第 4 页,Figure 3。点击图片可查看原图。
这里沿用同样目标,用 precision 和 recall 检查候选列表的可信度。上部 EBF1 和 SIX5 的改善比 ROC 图更明显,因为多余假阳性会直接降低精确率;下部确认这种收益普遍存在。PR 的随机水平受阳性比例影响,因此不同任务的原始 PR AUC 也不能不看基线直接横向比较。
97.6% 目标胜出与部分目标超过 50% 的相对收益是两种统计。相对收益应与起始水平一起解释,不能写成所有调控任务有同样幅度提升。网络在染色质标记上的改善,最后在 eQTL/GWAS 变异排序中只带来较小提升,原文也承认这一点。这说明功能标签更准确与疾病位点更准确之间,还隔着 LD、疾病相关细胞环境与标签收录机制。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| 上部GM12878 EBF1 | EBF1目标的精确率—召回率曲线,更适合观察稀少阳性的预测质量。 |
| 上部H1-hESC SIX5 | SIX5目标的精确率—召回率曲线,比较三种方法在另一任务上的差异。 |
| 下部AUC散点 | 逐目标PR AUC比较,DanQ在97.6%的目标上高于DeepSEA,说明收益不只是类别不均衡下的ROC提升。 |
Figure 4:学到的卷积模体
原图来源:所用 PDF 文件第 4 页,Figure 4。点击图片可查看原图。
A 用 EBF1、TP63、CTCF 的数据库模体与学习核对齐,展示局部特征确实含有可解释的调控模式。匹配的显著性来自序列模式比较,不是对相应 TF 在某个患者细胞内结合的实测显著性。模型中的一个核可能只识别部分模体或与多个 TF 家族相似,不能用一次匹配认定精确蛋白身份。
B、C 是同一批核的两种信息量显示方式,分别看每种碱基与每个位点总体结构,并按相似性组织集合。它们没有证明核之间的相互作用已经被实验验证,也不能将卷积核总数当作发现了同样多种 TF。正文较大 DanQ-JASPAR 版本同时增加核数量并使用已知模体初始化,收益无法仅归因于初始化;只有保持其他条件相同的额外消融才能分开二者。图 4 与图 2、3 同页,最终图像要单独裁取,避免把几张主图混成一张。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| A | 三个卷积核匹配EBF1、TP63、CTCF数据库模体,验证卷积特征的生物解释。 |
| B | 320个核的逐碱基信息量热图按序列相似性排列,展示模体集合及重复模式。 |
| C | 同一集合按各位置总信息量着色,更直观比较模体长度和保守结构。 |
我的理解与可迁移启发
这篇论文教会我的,是把架构假说转为能公平比较的问题。使用同一输入、同一标签、同一拆分,再比较不同上下文整合方式,比直接换一套更大数据和更大模型更能说明改动价值。对 16 GB 显存的公共 AD 或 TE 项目,可用较小 CNN 加上下文模块作为基线,但应实际测量显存与训练时间。论文基于当年 Titan Z 与旧框架的时长不能直接换算到现在的显卡。
若想从 TE 内模体组合得到创新点,应进一步问:同一家族相似拷贝为何在不同脑细胞中功能不同?DanQ 可以给出预测与候选模式,但真正的组合规则需要固定背景下增加、删除、交换模体或间距的对照,并用独立实验或留出数据检验。不能只展示 LSTM 加入后分数提高,就宣布发现了某种生物学语法。
疾病证据还要注意,本文下游 SNP 优先排序使用额外的 boosted classifier 与 eQTL/GWAS 标签;它不是由交叉熵训练的序列模型直接输出疾病概率。关联 SNP 可以只是与真正因果位点连锁,负例也不是全部得到验证的无功能位点。研究 AD 时应尽量区分已精细定位候选、单纯关联候选和频率匹配背景,并保留不确定性。
最后,正文没有新的基因编辑验证。它主要证明一个混合架构在同样基准上更有效,并能学到已知模体。可以借鉴这种计算创新路径,但若目标是机制性论文,后续工作应增加独立细胞数据、相似序列留出、明确的功能问题和可被反驳的干预预测。网络模块的名字不能代替疾病或调控证据链。
本文说明的转化路径还提醒我,序列是稳定的输入,细胞环境却会改变。研究疾病进展时仅改变网络读取方式不足以模拟进展,仍须提供对应环境的真实训练或验证资料。






