1.DeepSEA:原图、模型逻辑与研究范式

1.DeepSEA:原图、模型逻辑与研究范式
Perry论文题名: Predicting effects of noncoding variants with deep learning–based sequence model
期刊与年份: Nature Methods,2015。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
Nature Methods,2015。阅读正式发表版;论文原文。以下只讲正文3个主图及全部实际子图,不包含补充图。页码指所提供PDF的文件页码。
研究问题: 能否从DNA序列学习染色质调控规律,并把这种能力转成单碱基非编码变异的效应预测?
研究瓶颈怎样变成一个可训练的问题
这篇文章面对的困难是:非编码疾病相关位点很多,真正测过等位基因功能的位点很少。保守性和已有染色质注释能告诉我们一个位置是否值得关注,却不必然告诉我们同一位置的C变T会改变什么;单个TF motif也难以表达相邻结合位点、协同因子和较长序列环境的影响。作者把稀缺的“变异—功能”监督暂时放到后面,先利用丰富的染色质实验训练“序列—分子表型”模型,再比较两种等位序列的预测差异。这是把难任务拆成可学习代理任务的设计,不是直接用疾病病例训练一个风险分类器。
从论文明确陈述的瓶颈推断,idea形成的关键是意识到参考基因组上的大量不同序列已经提供了调控规律的训练样本;模型若学到了可迁移的规律,就可能对没有见过的单碱基替换产生有意义的响应。这是对设计逻辑的重构,不能当成作者真实的心理过程。最值得检验的环节也因此十分清楚:模型在参考序列上表现好,是否真的意味着它能预测两种等位基因的差异?后面的Figure 2专门回答这一跳跃。
输入、输出和模型结构为何这样选择
每个样本是GRCh37/hg19上的1,000bp DNA,用1,000×4的one-hot矩阵表示。监督标签针对中央200bp区间:超过一半区间位于某个实验峰内就记为1,否则为0。两侧各400bp提供上下文,预测对象仍是中央区间。919个输出包括690个TF结合、125个DNase可及性和104个组蛋白标记任务;“919”是实验特征数,不是919种TF或细胞。训练及染色质测试主要取至少一个TF结合事件覆盖的区间,约占基因组17%,因此主文性能有明确的取样范围。
三层卷积分别有320、480、960个核,配合最大池化、ReLU、全连接层与独立sigmoid输出。底层滑动核可学习类似motif的短模式,上层逐步组合更大范围的信息;全连接层汇总1kb环境。多任务共享隐藏特征,使某个TF的模式也能被协同TF或可及性任务利用。因为一个区间可以同时具有多个染色质特征,这里用独立sigmoid多标签预测,比把所有标签当互斥类别更合适。训练最小化多任务负对数似然并加入正则化、dropout,使用带动量的随机梯度下降。
染色质测试留出整条8、9号染色体,验证另用7号染色体指定区间,避免重叠序列在训练和测试之间泄漏;正向与反向互补序列的预测取平均。应用时把同一上下文分别改成REF与ALT,计算各输出的概率差和log-odds差,再结合保守性训练变异优先级模型。于是证据链为“序列→预测染色质变化→功能变异排序”;染色质变化不是疾病风险,序列差异分数也不是天然校准好的致病概率。
Figure 1:从可测的染色质任务连接到稀缺的变异效应
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
| 子图 | 具体读法 |
|---|---|
| 全图(无字母标签) | 先用TF结合、DNase可及性和组蛋白标记训练序列网络,再把参考与替代等位序列分别送入同一网络,比较预测差异,为非编码变异排序。图中没有a、b标签,不额外拆造字母。 |
这张流程图最重要的是两种监督层次的区别。前半段的标签来自染色质实验,后半段的变异排序才使用HGMD、eQTL或GWAS等标签。两种等位序列使用同一个模型、相同上下文,提供了受控的计算比较,减少“两个不同位点本来就在不同调控环境”的混杂。但计算上只改变一个碱基,并不等于做了内源基因组编辑:模型可能学到相关模式,也可能遗漏未提供的细胞状态、远端相互作用或非序列决定因素。因此Figure 1是研究假说和验证路径,不能独立证明等位因果效应。
Figure 2:先检验预测对象,再检验单碱基方向和可信范围
原图来源:所用 PDF 文件第 3 页,Figure 2。点击图片可查看原图。
| 子图 | 具体读法 |
|---|---|
| a | 左、中、右分别是TF结合、DNase位点和组蛋白标记的ROC曲线,只纳入至少50个测试阳性的任务。曲线靠近左上角表示区分峰与非峰能力较强;三个任务类别的难度并不相同。 |
| b | 35种细胞中57,407个实验等位不平衡位点:横轴ALT序列的DHS概率,纵轴REF概率。红点是实验ALT偏向,蓝点是REF偏向;预测方向与颜色对应才算正确。黑线标出概率差0.07的高置信边界。 |
| c | 横轴为两等位预测概率差的筛选阈值,纵轴为方向准确率;蓝线对应各细胞,红线对应合并结果。它检验能否根据预测差值筛出较可靠的变异,而不是给出全部位点的统一准确率。 |
a图首先检查代理任务是否学成。主文报告TF、DHS、组蛋白任务的中位ROC-AUC分别为0.958、0.923、0.856,不能把TF的最好类别表现套用到所有输出。与gkm-SVM比较支持卷积网络及较长上下文的价值,但方法部分也说明gkm-SVM受核矩阵规模限制,对大任务抽样训练;这一比较不是严格相同算力、相同训练量下的唯一架构实验。ROC-AUC体现排序,未直接说明真实全基因组低阳性率下的精确率。
b图是整篇最关键的迁移检验:网络没有用这些变异效应训练,却要判断哪个等位在相应细胞中更开放。用同一细胞内的等位不平衡比较,比仅判断“某位点有没有DHS”更接近变异功能问题;匹配细胞类型也减少了把错误context当模型失效的情况。不过实验读出是杂合位点的DNase等位不平衡,仍是染色质层面的方向证据,不能直接称为靶基因表达变化或疾病因果效应。复用这类验证时还需要核查等位比对偏倚和连锁背景。
c图补上可靠性边界。文中差值>0.1的6,726个位点达到>95%准确率,但这只是57,407个位点中的约11.7%(按文中数目计算)。阈值提高意味着保留更强预测,覆盖范围也缩小;若只报告95%就隐藏了这一交换。可迁移的设计是同时报告准确率和保留数量,检查被放弃的位点是否集中于低效应或特定细胞任务。该图支持“可以筛高置信候选”,没有证明模型能正确处理所有变异。
Figure 3:用逐渐困难的背景判断排序是否只是区域识别
原图来源:所用 PDF 文件第 3 页,Figure 3。点击图片可查看原图。
| 子图 | 具体读法 |
|---|---|
| 左图:HGMD 调控突变 | 阳性为已注释调控突变,阴性是不同距离的1000 Genomes变异;横轴距离条件约1,200、260、100bp,纵轴ROC-AUC。比较GWAVA时排除其训练阳性及2kb内邻近变异,减少训练集重用优势。 |
| 中图:GRASP eQTL | 阳性为非编码表达QTL,阴性由全局随机逐步变为距阳性更近的变异;按次要等位频率分布匹配。检验模型能否在相近遗传区域中区分表达相关标签。 |
| 右图:GWAS Catalog | 阳性为非编码性状相关GWAS位点,比较DeepSEA、CADD、GWAVA不同版本及FunSeq2。横轴“All”和约31,000、6,300、1,400、360bp是阴性背景条件;不是训练轮次或模型输入长度。 |
三张图的对照设计针对一个容易被忽略的捷径:全局阳性和阴性可能在基因密度、染色质环境和保守性上就很不同,模型即使不理解等位替换,也能识别“这里像功能区”。把阴性移到阳性附近,并匹配等位频率,使这种区域捷径更难。采用连续染色体区块交叉验证,进一步减少同一局部背景在训练和测试两边出现。与不同信息来源的方法比较,以及保守性/染色质预测的消融,才支撑“序列提供额外信息”,而非只展示一个较高AUC。
同时,1000 Genomes背景是未被这些阳性目录标记的变异,不是实验确认的无功能阴性;GWAS位点也可能只是与因果变异连锁的标记。HGMD、eQTL、GWAS分别对应调控病理、表达关联和性状关联,标签含义不一致。图中较好的排序可支持候选优先级,但不能说明已解析每个疾病位点的机制。主文还指出保守性对HGMD更有信息,染色质差异对常见eQTL/GWAS更有信息:这提示不同变异类型应使用不同证据组合,不应把强保守性等同于所有非编码功能。
我的理解与可迁移的研究设计
我最想借鉴的是验证顺序:先验证模型学习的分子表型,再用未参与训练的等位读出检验差异,最后才连接疾病标签。这让每一层失败都可以被定位,而不是用一个疾病分类分数掩盖序列模型是否真的懂变异。对于AD候选调控变异,可把DeepSEA当作具有历史意义的基线,用相关细胞的MPRA、caQTL或等位开放数据检验方向;若研究TE序列,必须另行检查训练覆盖和重复序列可比对性,不能把旧模型的高AUC直接迁移过去。
我也不会把REF/ALT比较自动解释为祖先/衍生比较。论文加入的保守性代表另一类进化证据,不能代替祖先状态或正交序列实验;把人类上下文改写成祖先背景只会得到待验证的计算反事实。延伸研究最有价值的新增证据是独立细胞context、严格位点留出及真实等位效应,而不是只换更大的网络。DeepSEA的贡献,是把可学习的DNA调控规律与变异效应连接起来,并用分层实验去检验这条连接。





