80.GPN:原图、模型逻辑与研究范式

论文题名: DNA language models are powerful predictors of genome-wide variant effects

期刊与年份: PNAS,2023。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

本篇问题: 无需功能标签的DNA语言模型能否预测全基因组变异效应?

不用功能标签,为什么仍可能知道变异有影响

如果一个序列位置在相似上下文中通常出现某种碱基,另一种碱基可能破坏被进化保留的模式。GPN 将这个直觉变成遮盖预测:不使用实验功能标签,单凭多个近缘物种未比对的参考基因组学习条件分布。本文主要证据来自拟南芥及七个近缘十字花目物种,没有直接验证人类 AD。对研究构思的推测是:蛋白语言模型已有无标签变异评分经验,作者试图将它扩展到全基因组、不同机制的变异,并摆脱非编码区多物种比对的覆盖限制。

GPN 输入 512 bp 的单碱基 token,以 25 层残差膨胀卷积生成每个位置的上下文表示,交叉熵学习被遮盖的 15% 碱基。评分时仅遮盖变异位置,计算 log P(ALT)/P(REF),越负表示替代等位更不符合学到的上下文。它并不直接拟合适应度、细胞类型或疾病风险,正值也不意味着有益。训练窗口偏重外显子与启动子,并对重复区损失降低权重,所以所谓无监督并不等于没有采样和生物学先验。

这是“自监督序列规律—零标签变异评分—独立群体/关联证据检验”的范式。它与用自监督权重再加病理分类头不同,评价标签在本文主要用于检验评分,而非训练疾病预测器。卷积能高效整合短程序列,选择它也表明 DNA 语言模型不必等同于 Transformer。

Figure 1:GPN遮盖碱基预测与变异评分

Figure 1

原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。

无字母的流程图同时定义训练与使用时的任务,二者都问给定背景下该出现哪个碱基。单碱基 token 让参考、替代概率的含义明确,避免重叠 k-mer 造成解释困难。预测分数具有跨注释类别排序的便利,但“同一数轴”不代表各类别分数同等校准为致病概率。局部序列统计受到突变偏好、重复复制和参考等位选择影响,功能约束只是来源之一。

训练时 A. thaliana 第四、第五染色体留作验证与测试,但近缘物种中的同源片段仍可能帮助预测,这是跨物种学习的设计。若要检验对完全新调控语法的发现,应另建按同源簇或家族留出的任务,而不是把染色体留出视为所有层次的独立性保证。

子图 讲的是什么,以及如何理解
全图(无字母) 512bp序列经卷积预测遮盖碱基概率,变异效应用替代/参考等位对数似然比,无需功能标签;本篇主要验证拟南芥模型。

Figure 2:无监督表示区分基因组区域

Figure 2

原图来源:所用 PDF 文件第 3 页,Figure 2。点击图片可查看原图。

A 平均 100 bp 表示后用 UMAP,并根据已知注释着色;分离出编码、内含子等说明表示含有结构信息,不意味着模型自己命名了这些类别。B 加逻辑回归并按染色体验证,是有标签的下游探针,定量检验可读出的信息。它和自监督骨干的训练应清楚区分。

注释模糊的窗口被排除,重复区又作为特定类别分析,因此这个混淆矩阵反映较清楚区域上的判别。中间层分群可由 GC、三联体周期、长度和重复家族驱动,作者与 k-mer 基线比较是必要的一步。若把方法用到 AD 细胞状态,不能仅凭 UMAP 中病理颜色分离就宣称新机制;要检验供体、技术和家族组成能否同样解释这种结构。

子图 讲的是什么,以及如何理解
A 100bp区域嵌入UMAP按注释着色,检查无监督学习是否自动分离编码、内含子等区域。
B 嵌入加逻辑回归的区域分类混淆矩阵,并跨染色体验证,定量评估表示中的注释信息。

Figure 3:概率logo与启动子模体发现

Figure 3

原图来源:所用 PDF 文件第 4 页,Figure 3。点击图片可查看原图。

A 的概率 logo 是每个位置独立遮盖后得到的分布,高度反映确定性,不是传统物种频率 logo,也不是归因贡献。编码前两位与剪接端点通常更确定,符合功能约束的预期,但易预测的重复模式同样可以很确定。B 从启动子高置信区域寻找模体,再与数据库匹配,提供不依赖 TF 实验标签的候选发现方式。

模体发现过程过滤了重复与编码外显子,强调的是特定背景下的调控模式。未匹配的回文结构可提出 DNA/RNA 二级结构假说,但尚未测得这种结构或功能。将它迁移到 TE 时不能照搬过滤再声称研究了 TE 语法,应重新定义家族内背景与去冗余策略,避免简单的复制保守性主导模体发现。

子图 讲的是什么,以及如何理解
A 浏览器中的逐碱基概率logo,高度反映预测确定性,展示剪接/编码等位置的上下文约束。
B 从高置信启动子片段发现的代表模体,展示已知匹配及候选新模式;仅凭模体发现不能证明新功能。

Figure 4:不同变异类型的预测效应

Figure 4

原图来源:所用 PDF 文件第 5 页,Figure 4。点击图片可查看原图。

一段测试染色体中的全部可能 SNV 按注释比较,破坏剪接、终止与起始等类别低分,为评分的生物合理性提供检查。排序依据分布的低百分位,不是各类变异的临床敏感度。标签由基因注释推断,同一类内部效应仍不同;这张图也没有直接制造突变测量结果。

重复区是本图最有启发的例外:年轻家族的相似拷贝可能使模型过于确信共识序列,任何偏离都得到很低分,但偏离未必降低个体适应度。作者通过降低重复损失减少这种过度评分,并承认只是部分缓解。对用户的 TE 研究,这不是可以忽略的噪声,而是需要单独解释、建立外部功能评价的核心问题。

子图 讲的是什么,以及如何理解
全图(无字母) 1Mb区域全部可能SNV按类型展示分数分布,剪接、终止获得、起始丢失等通常更低,检验评分是否符合功能破坏的预期排序。

Figure 5:低分变异与群体稀有性的关系

Figure 5

原图来源:所用 PDF 文件第 5 页,Figure 5。点击图片可查看原图。

A–C 用自然群体中的罕见/常见变异做独立检验,低分富集于罕见变异,与净化选择一致。这里“罕见”是单个纯合材料携带,“常见”是频率阈值,不能把植株群体定义直接换算成人类患者诊断。稀有性还受突变率、人口历史与检测影响,因此不是金标准有害标签。

D 与保守分数比较时先限制到共同可评分区域,减少覆盖差异的不公平;极端尾部优势较明显,在宽松阈值或不同注释类别中未必总胜出。分析把频率超过一半的替代等位转换为次要等位方向,说明参考碱基不一定是普遍或祖先状态。复用评分时应保留等位方向,避免将符号错读为固定参考有益、替代有害。

子图 讲的是什么,以及如何理解
A 1001基因组超过千万变异的GPN分布,大多数接近中性,负尾部为候选功能变异。
B 不同分数区间的平均等位频率,低分平均更罕见,符合净化选择预期。
C 低分候选在稀有对常见变异中的列联表和优势比,定量检验富集。
D GPN与phyloP、phastCons的富集比较,检验模型相对传统保守分数的效果。

Figure 6:GPN结合连锁信息识别GWAS关联

Figure 6

原图来源:所用 PDF 文件第 6 页,Figure 6。点击图片可查看原图。

A–C 用 LD 加权后更容易覆盖 GWAS 命中,评价的是与关联信号的相符程度。GPN×LD 的实际计算为附近变异绝对分数乘 r² 再求和、加负号,信号会在连锁邻域传播;它不是把 LD 从每个变异中消除,也不是直接确定因果位点。高富集说明重要序列邻域更常有表型关联,不能把一个被传播到的高分标签 SNP 当成已精细定位的原因。

D 保留共同比对范围,E 扩展到所有可评分变异,分别回答排序能力和覆盖价值。未比对区的收益确实突出,但可能混合重排、局部适应与传统方法缺失等来源。只有在真实因果位点标签或精细定位的独立验证下,才能进一步证明同一关联区域内的排序更好。

子图 讲的是什么,以及如何理解
A 示例区域六个变异的关联及GPN×LD分数,展示连锁校正后能区分关联与非关联变异。
B GPN和GPN×LD各分位的GWAS命中比例,检验使用LD的收益。
C 低分GPN×LD候选的GWAS富集列联表,量化关联识别。
D 可跨物种比对变异集合上不同方法的优势比,进行共同覆盖范围的比较。
E 完整变异集合的优势比,展示GPN还能覆盖传统保守评分无法比对的区域。

对转座子研究最直接的启发

本文提供了一个具体、可检验的创新入口:比较 TE 家族及年龄分层的语言概率,判断模型究竟学习了复制共识还是功能选择,再使用独立开放度、等位偏倚或 MPRA 效应来区分。需要按家族/同源簇留出,并与共识距离、GC、拷贝年龄和可比对性等简单基线比较。异常分数只有在预测真实调控效应时才有生物学价值,否则只是“长得不典型”。

对 AD,可先得到不含疾病标签的序列表征,随后冻结模型,检验候选 WGS 在相应细胞调控模块中的富集与功能方向。不能仅凭全基因组无监督评分和 AD GWAS 重叠就声称疾病机制。原始训练使用四张 80 GB A100,论文小于巨型蛋白模型的相对规模并不能证明本机原样训练可行;实际可行路径是预训练特征、小模型及严格留出验证。

继续阅读与公开资源