8.AlphaMissense:原图、模型逻辑与研究范式

论文题名: Accurate proteome-wide missense variant effect prediction with AlphaMissense

期刊与年份: Science,2023。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

阅读来源说明: Science 2023 正文;当前下载 PDF 含 2026-09-24 更正说明:分类阈值基于未平衡的 ClinVar 全集,不应与基因平衡基准混淆。

研究瓶颈怎样转化为问题

AlphaFold 已能提供大量结构信息,但结构预测对单碱基引起的氨基酸变化常不敏感,不能直接用结构是否变化判定致病。AlphaMissense 选择迁移其内部序列和残基对表示,并用新的错义任务训练。依据设计逻辑推断,idea 是利用结构模型已经学到的几何上下文,而不强迫它生成突变后的结构;同时用自然人群代理标签减少临床收录偏倚。

输入、目标与证据链

模型接收参考蛋白序列及 MSA,结合 AlphaFold 衍生 Evoformer 表征,预训练包含结构与掩码氨基酸任务,再以常见人/灵长类变异和未观察变异的弱标签微调。频率加权是为了降低稀有变异代理标签的噪声。输出是指定氨基酸替换的分数,不是突变结构、功能方向或某位患者的患病概率。临床标签、病例新生变异、MAVE、细胞必需性与复杂性状分别检查不同外推;训练没有使用这些具体临床/功能标签,阈值校准仍使用 ClinVar。

Figure 1:AlphaMissense 架构与训练

Figure 1

原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。

子图 讲什么,以及怎样理解
A 参考序列及多序列比对进入 Evoformer,结合残基对表示、循环计算及掩码残基预测,输出结构与错义致病分数。
B 常见人类/灵长类变异作为偏良性训练信号,未观察到变异作另一类,按等位基因频率加权减少罕见变异的不可靠监督;这是人群代理标签。
C 用 ClinVar、疾病新生变异及多重变异效应实验三个方向评估,避免只凭一种基准下结论。

A 说明结构语境如何进入表征;B 说明监督信号来自人口频率,而不是实验确定的二分类。未观察变异含很多真正良性,常见变异也可能有较弱或环境相关效应,所以训练只是弱监督。C 设置三类不同测试,能发现模型只符合某一个标签体系的风险。此处重要创新是迁移和标签设计的结合;不宜把它说成 AlphaFold 计算了每个突变的三维形变。

Figure 2:临床变异分类性能

Figure 2

原图来源:所用 PDF 文件第 5 页,Figure 2。点击图片可查看原图。

子图 讲什么,以及怎样理解
A 在按基因平衡良性/致病数量的 ClinVar 集合比较 AUROC;直接用 ClinVar 训练方法的灰色结果可能有训练重叠优势。
B 对至少各有五个良性、致病标签的 612 个蛋白求平均逐基因 AUROC,防止标签多的基因主导总体结果。
C 比较 DDD 病例与健康对照的疾病相关新生变异,检验另一种临床证据下的区分能力。
D 分箱比较平均预测分数与真实致病比例,并显示良性/致病分数分布;评估分数校准而非只看排序。
E 改变要求的预测精确率,统计可明确分类的变异比例;揭示可靠性与覆盖率的权衡。
F ACMG 可采取临床措施的基因示例:左按位置展示变异分数,右在结构上着色平均分数;定位关键区域及已注释变异。
G 对优先开展 MAVE 实验的基因作同样展示,说明资源能指导后续实验选择。

A 的基因平衡与 B 的逐基因平均意在防止基因标签比例造成虚高表现;D 校准和 E 覆盖率则是另一问题。当前 PDF 更正指出分类阈值依据未平衡 ClinVar 全集,因此‘90% precision’依赖该集合比例,不能搬到任意筛选人群。F/G 的结构着色解释敏感区域,但临床使用还需表型和遗传证据。不同疾病基因的基线风险不同,整体分数校准不能保证每个基因都同样可靠。

Figure 3:与大规模功能实验的一致性

Figure 3

原图来源:所用 PDF 文件第 7 页,Figure 3。点击图片可查看原图。

子图 讲什么,以及怎样理解
A 比较 ProteinGym 72 个蛋白的逐蛋白 Spearman 相关分布,评价分数对实验效应的排序。
B 限制到所有方法均覆盖的 25 个人类蛋白、608,175 个变异,避免覆盖差异混淆比较。
C 在另收集的 20 个人类蛋白上检验相关性,提供额外独立验证。
D SHOC2 的实测、AlphaMissense、EVE 替换热图;对应结构域及界面注释,检验模型是否恢复敏感区及特定替换效应。
E 把 SHOC2 平均分数映射到与 MRAS/PP1C 的复合物,突出结合界面的敏感残基。
F 在 GCK 结构上显示高分催化及配体结合位置,也标出变构区域,解释功能敏感性。
G 比较 GCK 体外活性与致病分数;失活变异总体高分,但部分过度活化致病变异分数低,提示功能获得机制是局限。

共同覆盖的蛋白集合控制方法缺失预测造成的优势,新增实验集合进一步检验泛化。D/E 的 SHOC2 说明替换差异与复合物界面能对应,G 的 GCK 则主动展示重要失败模式:过度活化也可能致病,较低预测分数不能排除该机制。DMS 测的是特定功能和实验条件,Spearman 评价排序而不是临床风险校准。研究中应保留功能方向标签,避免把失活与获得功能折成一个未经检查的强弱轴。

Figure 4:基因必需性与短基因

Figure 4

原图来源:所用 PDF 文件第 9 页,Figure 4。点击图片可查看原图。

子图 讲什么,以及怎样理解
A 展示中性选择下每基因预期 LoF 变异数;预期不超过 10 个的基因,人群 LOEUF 统计效能不足。
B 在统计效能不足/充分两组比较基因分数识别细胞必需基因的 AUROC;AlphaMissense 对短、低变异数量基因补充人群约束指标。
C 在 LOEUF 效能不足的基因中,按平均致病分数和 LOEUF 十分位展示必需/非必需基因比例;高 AlphaMissense 分数组富集必需基因。
D SF3b 复合物结构中突出较小、LOEUF 效能不足的亚基,给出具体生物例子。
E 各 SF3b 亚基蛋白长度,说明为何小亚基的自然人群变异不足。
F 表格比较各亚基细胞必需性、预期 LoF、AlphaMissense 与 LOEUF 排名;小亚基仍可被模型识别为敏感。

小蛋白在自然人群中预期 LoF 数少,LOEUF 的统计功效不足;预测全部替换可补充缺失的观察。A–C 在效能不同的基因组分开评估,D–F 用 SF3b 小亚基展示具体例子。这是基因级汇总用途,和逐变异用途不相同。细胞必需性依赖细胞系与培养条件,也不同于人体单倍剂量不足或 AD 风险;基因平均分数高只能提示功能敏感,不能指定疾病机制。

Figure 5:开放预测资源的用途

Figure 5

原图来源:所用 PDF 文件第 10 页,Figure 5。点击图片可查看原图。

子图 讲什么,以及怎样理解
A 展示全蛋白组错义预测表的一行,包括变异及分数/分类,说明可查询资源的内容。
B 按人群频率及 MAVE/ACMG 基因集统计预测类别;罕见变异和功能重要基因集合中有害预测比例更高。
C 比较各类罕见变异与约 4,000 个 UK Biobank 性状关联的比例;检验预测致病类别是否富集可观测的性状关联。

资源表把大规模预测变成可复用输入,B 的频率和基因集比较验证预期趋势,C 的 UK Biobank 性状关联检查群体层价值。但预测类别的性状关联富集不说明全部标记都有因果作用,也不意味着每个 likely pathogenic 会导致某一疾病。用这些结果设计新研究,应固定模型版本、转录本和阈值,并保持预测证据与实际临床/功能标签来源可追溯。

我的理解与可迁移设计

最值得借鉴的是承认弱标签噪声并用多个正交终点验证。对于 AD 非编码序列,不应照搬蛋白模型,也不应把常见或跨物种出现等同绝对良性;可借其策略,冻结已有序列表征,再用真实 MPRA 等位效应训练更小的头。尤其要保留功能方向和细胞背景,让模型知道不同机制可能都与疾病有关。当前更正也提醒我:排版中一个‘平衡/未平衡’差异会改变精确率的含义,写作必须交代阈值在哪个分母上校准。

继续阅读与公开资源