17.GEARS:原图、模型逻辑与研究范式

论文题名: Predicting transcriptional outcomes of novel multigene perturbations with GEARS

期刊与年份: Nature Biotechnology,2024。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

阅读来源说明: Nature Biotechnology,2024;以当前 PDF 为准。

研究瓶颈怎样转化为问题

组合扰动数量增长很快,且有些基因从未在训练中被扰动。只为已见基因学习独立字典,很难推断这些新组合。GEARS 将基因关系图作为信息桥梁:未见基因仍有已知功能或表达邻居,可从邻居传播扰动先验。依据设计逻辑推断,其 idea 同时针对两个瓶颈——未见单扰动与非加性组合——而非只在表达空间把两个单扰动相加。

输入、目标与结构

输入包括对照表达和被激活/抑制基因集合,基因与扰动嵌入通过关系图聚合,再组合、跨基因处理和基因特定输出层预测扰动后表达。图先验降低未见扰动的冷启动困难,非线性层容纳交互。监督来自真实单细胞扰动表达;图关系不必等于直接物理调控。输出是表达表型,对增殖、疾病逆转或药物协同仍需另设实验读出。

Figure 1:GEARS 的问题与架构

Figure 1

原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 输入未扰动表达及被扰动基因集合,预测每个基因的扰动后表达。
b 基因与扰动嵌入分别通过关系图的图神经网络聚合,组合扰动信息后经跨基因层和专属输出层产生表达;图先验帮助对未见扰动泛化。

a 明确模型从对照状态出发,b 说明图增强如何把未测基因与训练信息联系。若某基因缺图邻居或网络来自不同细胞,泛化也会困难。关系图可包含测试基因的已有生物知识,这属于方法输入,不能描述成完全无先验的新基因预测。新研究应固定图版本,并用去图、随机图及简单相加消融辨别真正信息增量。

Figure 2:单基因及双基因扰动预测

Figure 2

原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 单基因训练/测试划分示意,测试基因的扰动未在训练中出现。
b 比较前 20 个差异基因的标准化均方误差,检验是否比“无扰动”及其他模型更准确。
c 比较全基因预测与真实表达差的 Pearson 相关,关注响应而非基线表达。
d 统计前 20 个差异基因预测方向错误比例,评估上/下调是否正确。
e 双基因测试按两个基因已见情况划分类别,区分组合未见与单个基因未见。
f 各类双基因测试的标准化均方误差,检验泛化难度。
g FOSB+CEBPB 的真实差异基因箱线图与预测均值;训练只见过 FOSB 单扰动,检验组合表达方向和幅度。
h 预测与真实差异基因集合的 Jaccard 相似度,检查响应基因是否找对。

将双基因分为两个单基因均见、一个见或均未见,是比随机拆细胞更有意义的外推评估。前 20 DEGs 的误差、变化相关和方向错误刻意避开基线表达高相关的陷阱。g 的具体例子必须与总体指标一起看,h 则检查是否找对响应集合。差异基因根据真实测试结果定义可用于评价,但不能反过来作为模型预测时可知的输入。

Figure 3:非加性遗传相互作用

Figure 3

原图来源:所用 PDF 文件第 5 页,Figure 3。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 以两个单扰动效应相加定义简单加性预期。
b 示意协同、抑制、新形态、冗余、上位性等交互类型,说明组合如何偏离加性。
c 比较前十预测组合真正具有对应交互的比例 precision@10,评估模型推荐实验的效率。
d PTPN12+ZBTB25 的真实表达、单扰动相加及 GEARS 预测比较;GEARS 更能捕捉非加性组合后果。

a/b 先定义加性基线及交互类别,之后的 precision@10 问模型是否能优先推荐真正强交互,贴近有限实验预算。表达非加性不必等于细胞生长的药物协同,交互类型还依赖选用的表达距离和回归定义。PTPN12+ZBTB25 的单扰动相加对照说明为何需要非线性,但一个成功案例不能证明所有组合有效;推荐集合仍需实际实验检验。

Figure 4:搜索新的表达表型

Figure 4

原图来源:所用 PDF 文件第 6 页,Figure 4。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 对给定基因集合全部两两组合预测的流程。
b 训练中 102 个单基因及 128 个双基因扰动的低维表达表型图,作为已见范围。
c 预测 5,151 个两两组合后的表型分布,许多预测落在已见表型之外;颜色按 marker 注释群集,提示后续可实验检验的新状态。

预测 5,151 组合扩大可探索空间,UMAP 中离开已见表型提示候选新状态,而非新细胞状态已存在。降维会压缩距离,聚类 marker 也来自模型输出,不能作为独立验证。实际选择应考虑训练距离、不确定性和生物可行性,优先检验多个代表组合,而不只挑最大视觉位移。

Figure 5:大规模遗传交互图

Figure 5

原图来源:所用 PDF 文件第 7 页,Figure 5。点击图片可查看原图。

子图 讲什么,以及怎样理解
a 从组合表达预测计算五种交互分数的流程。
b 102 个基因全部两两组合的多维交互地图,以不同颜色表示交互类型,展示模型可筛选的候选组合空间。

交互地图汇总五种评分,方便为不同目标选择组合,但整张地图是推断产物。相同训练表达、图先验和评分函数会造成相关误差,彩色网络不能算多个正交证据。与已测交互的比较为局部可靠性提供支持,未测边仍保留候选性质。使用者应保存预测版本和阈值,避免后续从模型地图中挑最符合故事的边再宣称发现。

我的理解与可迁移设计

GEARS 值得借鉴的是把‘未见’拆清楚,及用响应增量而非终点总表达评估。AD 公共观察数据没有随机基因扰动,不能直接训练出相同意义的组合干预模型;需有与目标细胞相关的 Perturb-seq 或 CRISPR 表达数据。对 DNA 变异,也应区分未见替换、未见位点和未见研究,位点内随机拆分通常过于容易。图先验可以连接 enhancer 和基因,但关联边仍须验证。资源有限时先建立小的真实扰动任务和相加基线,再询问图信息是否增加跨基因泛化,而不是直接生成巨大的 AD 治疗组合表。

如果两个候选都只有同一背景的功能信息,组合预测所需的是它们相互作用的证据;用模型补全可以提出假说,但不能替代实验标签。应明确哪些边已测,哪些是插值,哪些为真正外推,并把失败条件同样保留。

此外,未见基因扰动仍可能有该基因的普通表达和公共图知识,数据契约必须逐项列清楚。对新的细胞类型,网络和响应可能都变,不能只依据旧细胞系验证就承诺泛化。独立测试的目标应是干预条件或研究,不是随机单细胞;预测均值和细胞间方差也应分别评价。只有这样,模型推荐的实验才有可解释的成功概率。

继续阅读与公开资源