2.HumanSplicingCode:原图、模型逻辑与研究范式

2.HumanSplicingCode:原图、模型逻辑与研究范式
Perry论文题名: The human splicing code reveals new insights into the genetic determinants of disease
期刊与年份: Science,2015。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
阅读来源说明: Science,2015;以当前 PDF 为准。
研究瓶颈怎样转化为问题
这篇文章把临床判读中常被分开的两个问题重新接起来:一个变异是否改变蛋白,以及它是否改变蛋白产生之前的 RNA 剪接。内含子变异没有氨基酸变化,同义变异也可能被默认忽略;但两者均能破坏成熟转录本。研究因此选择正常组织的外显子包含比例作为可测中间表型,先学习调控规则,再对疾病变异提出独立于疾病数据库的功能预测。按设计逻辑推断,其 idea 的关键是绕开稀缺而偏倚的致病标签,用数量更多的正常剪接观测建立模型;这不是对作者心理过程的陈述。
输入、目标与研究范式
输入并不是今天常见的原始序列大模型:作者从外显子三联体及邻近内含子提取 1,393 个序列特征,并提供组织类型;用 10,689 个可变剪接外显子、16 种组织 RNA-seq 训练预测连续 Ψ 及贝叶斯置信度。上下文依赖模型允许同一个基序在不同 cis 序列和 trans 组织中产生不同方向的效应,适合多因子共同决定外显子识别的机制。变异评分时分别计算参考和变异序列的 Ψ,结合跨组织变化与置信度。它预测的是剪接调控后果,疾病风险还需基因功能、遗传和实验支持。
Figure 1:剪接模型及预测验证
原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 上方把健康组织的序列特征与外显子包含比例联系起来训练模型,下方用模型筛查各类疾病变异;解释从规律学习到疾病分析的流程。 |
| B | 输入某个外显子周围序列及细胞类型,输出外显子包含比例 Ψ;模型学习的是外显子进入成熟转录本的程度。 |
| C | 按 RNA-seq 实测 Ψ 分箱,展示模型预测分布;预测随实测包含比例上升,说明模型捕捉了不同组织与外显子的剪接程度。 |
这幅图先检验中间任务能否成立:如果正常外显子包含比例都不能恢复,后续疾病分数便失去量化基础。C 按实测 Ψ 分箱能检查动态范围,避免只展示几个好看的基因。正文给出全部合格观测 R² 为 0.65、高置信一半为 0.94;两者必须连同覆盖范围一起读,置信筛选改善准确性也舍弃了难预测样本。训练外显子上的精确拟合不等于对未见变异的精确 ΔΨ,因此后面还需要突变实验。
Figure 2:RNA 结合蛋白的信息是否已被模型捕捉
原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 比较 98 次体外实验测得的 RBP 结合亲和力与 RNA-seq Ψ 的相关性;一些蛋白的结合与剪接水平相关。 |
| B | 从实测 Ψ 减去模型预测后,再与 RBP 亲和力关联;大多数相关性消失,说明模型已解释了相当部分 RBP 相关剪接规律。 |
A→B 是残差检验:如果模型已解释 RBP 相关剪接规律,扣除预测后,实测结合亲和力与剩余剪接变化应大幅减弱。这比只把显著基序列出来更接近机制解释,但仍属统计解释度。相关性消失可能来自与真实机制共变的特征,不证明每个 RBP 的直接作用都被正确复原;RNA 结合实验与组织背景也不同。借鉴时可把残差是否仍依赖细胞类型、批次或 GC 含量作为模型诊断。
Figure 3:全基因组变异对剪接的影响
原图来源:所用 PDF 文件第 4 页,Figure 3。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 分别预测参考与变异序列在各组织的 Ψ,取最大变化 ΔΨ,并结合置信度定义调控分数。 |
| B | 统计 658,420 个内含子和外显子 SNV 的预测 ΔΨ,显示大量变异可能改变外显子包含程度。 |
| C | 按变异距外显子的位置比较疾病注释 SNV 与普通 SNP;疾病变异的预测剪接效应分布更分散、较大效应更多,且不只集中于经典剪接位点。 |
A 规定计算变异效应的方法,B、C 才讨论基因组分布。参考/变异成对计算控制了其余序列背景;距剪接位点分层则检验模型是否仅学到经典二核苷酸。疾病变异远离边界仍有较强预测效应,说明值得扩展检测范围。这里跨组织最大值是筛查策略,可能偏向最敏感组织;不能把最大 ΔΨ 直接当作患者目标组织的实际变化,也不能从大量高分预测倒推出等量确证的疾病原因。
Figure 4:疾病证据与剪接调控分数
原图来源:所用 PDF 文件第 5 页,Figure 4。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 比较内含子中 GWAS 相关 SNP、其他 SNP、疾病 SNV 的调控分数分布;考察疾病关联变异是否更倾向影响剪接。 |
| B | 按致病、体内外验证、仅关联、关联加功能证据分层比较疾病 SNV;检验较强疾病证据是否对应较强剪接效应,图中标示组间检验。 |
按疾病证据强弱分层,是为了询问分数是否不仅区分数据库来源,还随功能证据增强。GWAS SNP 常是连锁标记,真正影响剪接的比例本就可能低于经过功能验证的疾病突变,所以两组差异不意味着 GWAS 没有价值。解读分布时还要考虑位置、频率和收录偏倚;它支持把剪接分数作为独立证据加入判读,而不是以分数代替遗传显著性或临床诊断。
Figure 5:脊髓性肌萎缩症中的 SMN 剪接
原图来源:所用 PDF 文件第 5 页,Figure 5。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 说明 SMN1 功能丢失与疾病的关系,以及 SMN2 四个碱基差异导致外显子 7 包含减少;改变 SMN2 剪接有潜在补偿作用。 |
| B | 在内含子进行所有单碱基替换的计算筛选,选出三个预测能提高 SMN2 外显子 7 包含的突变。 |
| C | RT-PCR 检验筛出的突变及 SMN1/SMN2 差异位点;预测与实验方向相符,Spearman 相关为 0.82。 |
| D | 把四个区域中 85 个突变的预测 ΔΨ 与 RT-PCR 实测变化对应,相关为 0.74,支持模型在具体疾病基因中的定量预测。 |
SMN1/SMN2 构成有生物学方向的验证:提高 SMN2 外显子 7 包含有补偿潜力,因而可以从计算扫描中挑选预期提高包含的突变,再用 RT-PCR 检查。已知差异位点同时作为方向对照,其他区域 85 个突变检验预测并非只适用于几个精选候选。相关系数说明排序和量化趋势,却不说明每个突变幅度都准确;minigene 的剪接改善也不能直接外推到病人体内疗效。
Figure 6:Lynch 综合征基因的剪接突变
原图来源:所用 PDF 文件第 6 页,Figure 6。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 展示 MLH1 和 MSH2 患者突变的预测 ΔΨ,定位可能影响剪接的编码区及邻近变异。 |
| B | 用 RT-PCR 已检验的 134 个 MLH1 与 73 个 MSH2 变异验证分类;ROC-AUC 分别为 92.4% 与 93.8%,说明分数能区分剪接异常与无异常变异。 |
MLH1/MSH2 将模型放到另一类疾病基因,降低只在 SMN 特殊背景有效的担忧。RT-PCR 提供的是有无剪接异常标签,ROC-AUC 评估排序能力;它与 Ψ 回归相关是不同任务。尤其编码突变可同时改变蛋白和剪接,不能因为有剪接证据就排除蛋白机制。临床应用需结合转录本、杂合状态和错义功能实验,而图中结果主要支持剪接异常候选的优先选择。
Figure 7:自闭症病例中的预测剪接异常
原图来源:所用 PDF 文件第 7 页,Figure 7。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 在 5 个 ASD 病例、12 个对照中,用普通 SNP ΔΨ 的第 2 或第 3 百分位阈值识别至少含一个降低外显子包含变异的基因。 |
| B | 病例筛出的异常基因比对照筛出的基因更常在脑组织高表达,提示结果具有神经组织相关性。 |
| C | 改变 ΔΨ 阈值,查看中枢神经系统发育基因的富集优势比;不同阈值下均有富集,说明关联对阈值选择有一定稳健性。 |
病例与对照的高分基因比较,再问这些基因是否在脑中表达和富集于神经发育,建立的是疾病相关性链条。5 个病例与 12 个对照的规模非常有限,阈值改变后的稳定性只能缓解阈值选择问题,不能消除人群背景和样本选择混杂。应把它看作提出新候选的探索性分析,而非可推广的 ASD 诊断模型;独立队列及患者 RNA 的直接验证仍必要。
Figure 8:ASD 异常剪接基因的功能网络
原图来源:所用 PDF 文件第 7 页,Figure 8。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| 全图(无字母标签) | 节点表示病例相对对照富集的 GO/通路基因集;颜色区分两个检测阈值,大小表示基因数,连线粗细表示共享基因比例。功能相近集合形成神经发育等模块,旁边基因颜色区分已知 ASD、具有神经表型的新候选及其他基因;这是候选功能归纳,不能把所有节点直接视为已证实致病基因。 |
网络图把大量候选压缩为共享基因的功能模块,帮助找到可实验化的共同过程;连线表示集合重叠,并不等于物理蛋白相互作用或已验证调控边。相近 GO 术语常共享大量基因,多个显著节点未必是多份独立证据。更可信的迁移方式是先固定候选筛选和基因集检验,再选择一个具体转录本后果验证,而非从网络颜色直接宣布新的疾病机制。
我的理解与可迁移设计
我最看重的是把疾病标签、功能标签和机制实验分开:正常数据训练降低疾病收录偏倚,变异实验检验局部机制,病例队列检验疾病联系。用于 AD 时,可先问特定变异是否改变神经元或小胶质相关转录本的外显子包含,再接病例统计和 RNA 证据。不能把模型分数较高的一批位点自动称作 AD 致病位点。若计算资源有限,保留预训练特征、组织条件和置信度评估,比从零训练更现实;评估还应报告高置信预测覆盖了多少候选。










