20.CPA:原图、模型逻辑与研究范式

20.CPA:原图、模型逻辑与研究范式
Perry论文题名: Predicting cellular responses to complex perturbations in high-throughput screens
期刊与年份: Molecular Systems Biology,2023。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
阅读来源说明: Molecular Systems Biology,2023;以当前 PDF 为准。
研究瓶颈怎样转化为问题
药物、剂量和细胞背景组合几乎不可能穷举。CPA 把表达状态分解为基础细胞、扰动与协变量,再在潜空间组合,用非线性解码还原表达。依据设计逻辑推断,idea 是让可解释的组合结构与灵活表达映射共存:潜变量加法并不要求基因响应加法。缺少的某种组合可以预测,完全未见药物则需要化学输入等额外桥梁。
输入、目标与结构
CPA 训练时拿到一个细胞的表达、药物/遗传扰动标签、剂量以及细胞背景,目标先是重建这个已观测条件,不是直接学习每个细胞未测的反事实答案。编码器得到基础向量 z;独立分类器努力从 z 猜药物和细胞标签,编码器则努力让这些分类器猜不出来,同时还要保持表达可重建。随后加回药物、剂量和背景的嵌入,解码器预测各基因表达的均值与方差,以高斯负对数似然监督。分类器与编码器的竞争促使条件信息走独立通道,不能把“对抗”理解为两个真实细胞实验之间的竞争。
药物效应用一个向量表示,再由剂量的小网络缩放;剂量为零时缩放必须为零。组合预测将 A、B 的缩放向量和基础/背景向量相加,再通过非线性解码器。示意上像先把“这类细胞+A剂量+B剂量”组成一个状态,再问各基因如何响应;不是把两个药的表达计数直接相加。因此潜空间是加法,最终 RNA 响应可以非加性。训练需要足够交叉条件来区别药物、细胞与批次:若 A 只在一种细胞/批次出现,对抗结构也不能凭空补出缺失信息。
测试时保持参考细胞的基础向量,换入目标条件,回答“在这个背景下另一处理可能怎样”。原始 CPA 的药物字典需要见过该药物;chemCPA 再以化学指纹或预训练分子表示、扰动映射及剂量网络生成向量,让新药至少有可输入的结构。它输出转录分布,不直接输出治疗获益。作者的不确定性主要是目标条件到已见条件的潜空间距离,属于分布外风险提示,并非患者疗效的置信区间。
Figure 1:CPA 的可组合解释框架
原图来源:所用 PDF 文件第 4 页,Figure 1。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 编码表达后,通过判别器去除扰动/协变量得到基础状态;再加药物、剂量及细胞背景嵌入并解码恢复表达,使响应可组合。 |
| B | 展示解释药物/细胞嵌入、剂量曲线插值及未见组合预测三种用途。 |
A 的信息流值得逐步看:表达进编码器成为基础状态,判别器检查是否残留药物/协变量信息;重建时这些条件从独立字典加回。如果基础向量已经暗藏全部药效,换字典也不会真正改变预测,对抗模块正为这个失败模式而设计。B 的药物/细胞嵌入相似性、剂量曲线和组合补全,是同一拆解结构的三种用途。零剂量约束提供可解释锚点,非线性解码提供组合响应的灵活性。该结构最适合训练里出现多个条件交叉而测试缺少某些组合;完全没有响应资料和化学输入的新药,不属于仅靠字典能解决的情形。
Figure 2:大规模药物及细胞系表示
原图来源:所用 PDF 文件第 6 页,Figure 2。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | sci-Plex 三细胞系、约 29 万细胞的 UMAP 按药物靶通路着色,展示响应表型背景。 |
| B | A549 高剂量 Momelotinib 的前五差异基因对照/真实/预测分布,检查响应变化。 |
| C | 训练未见最高剂量的四药物平均表达散点,突出主要差异基因,检验剂量外推。 |
| D | 36 药物、108 留出条件的 R² 分布,与随机细胞均值基准比较整体表现。 |
| E | 在某细胞系或细胞系组合中,留出指定剂量下全部药物的处理条件,再比较全基因/前 50 差异基因 R²。评估的是药物—剂量—细胞背景组合的泛化,并非把某细胞系所有剂量的资料都删除。 |
| F | L1000 中 82 个细胞系嵌入按组织来源着色,检验协变量表示是否包含生物关系。 |
| G | 药物潜嵌入按表观调控、激酶、蛋白降解等通路着色,显示机制相关聚集;插图比较细胞系嵌入。 |
| H | 在 L1000 最常测试千药物的嵌入中检验同类通路结构,扩展到 bulk 数据。 |
A 是 188 药、三细胞系、四剂量的实测表达背景;B 的 Momelotinib 前五差异基因比较对照、实测和预测分布,用来检查模型是否只返回“平均细胞”。C/D 的分布外测试把效应最强的 36 药最高剂量 10 µM 在三种细胞系全部留出,共 108 个条件,较低剂量仍用于训练。这是剂量外推,不是完全未见药物。散点比较处理后基因均值,R² 还分别评估均值、方差及差异基因;均值好不保证异质性也对。E 再留出特定细胞背景中的药物—剂量条件,检验组合覆盖变化。F–H 使用组织/靶通路等外部标签解释 L1000 与药物嵌入,说明统计表征具有生物对应,而不是说二维位置就是实际通路强度。
Figure 3:新药物组合实验验证
原图来源:所用 PDF 文件第 8 页,Figure 3。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 约 6.3 万细胞的组合实验 UMAP、训练划分和五个分布外条件,说明真实验证任务。 |
| B | 列出五个留出组合的性能及定性难度:单药主导组合较容易,含 Alvespimycin 的新表达模式更难。 |
| C | 比较 CPA、线性和随机基准的全变异基因/差异基因 R²;检查复杂模型优势是否依赖评价基因集合。 |
| D | 预测/真实治疗后平均表达散点,突出主要响应基因。 |
| E | 各留出条件前两个差异基因的对照、真实与预测分布,检验响应幅度及分布。 |
| F | 单药及组合潜向量的 UMAP,解释组合如何与单药关系对应。 |
这批新组合实验让模型的“可组合”承诺有真实答案。A 定义留出的五个条件,B 不只报告平均分,还区分单药主导的容易情况与 Alvespimycin 引起新模式的困难情况。C 把 CPA 与直接合并单药表达的线性/随机基准放在相同全基因、DEG 集合上比较:如果组合几乎由一个单药决定,复杂模型未必必要。D 的预测/实测均值散点检查基因幅度,E 的前两个差异基因分布继续检查单细胞变化是否被平均掉,F 则用潜向量解释组合接近哪种单药。最有用的迁移设计是先列出哪些组合应当容易、哪些真有新模式,再同时保留成功和失败,不用整体高相关掩盖后者。
Figure 4:化学结构使未见药物可预测
原图来源:所用 PDF 文件第 9 页,Figure 4。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | chemCPA 将化学结构/指纹编码成药物嵌入,取代只靠已见药物的字典,使模型有机会处理新药。 |
| B | 九药物测试集上比较 CPA、chemCPA 与忽略药效的基线,全基因和差异基因分开评价。 |
| C | Givinostat/Dacinostat 跨剂量与细胞系表现,检查同机制药物的预测。 |
| D | 最高剂量的中位性能及完全留出九药物的结果,评价新药外推。 |
| E | 在含 Panobinostat 的九种组合上比较模型,检验新组合反应。 |
| F | 展示差异基因 R² 差最大的两个条件,定位具体改善/困难。 |
| G | 连 Panobinostat 单药也不训练时,组合差异基因中位分数从 0.85 降到 0.38,说明化学信息不能完全补偿缺失响应。 |
| H | 比较完全未见与已训练 Panobinostat 的单药预测,解释 G 的下降来源。 |
A 的结构改动专门解决新药没有字典向量:分子表示先给它化学位置,再由训练好的映射和剂量网络生成条件向量。B–D 分开检验九药物、剂量和细胞背景下的预测,C 用同机制的 Givinostat/Dacinostat 具体查看是否能够转移,不能只凭化学近邻作判断。E/F 继续问包含 Panobinostat 的组合是否可由该桥梁恢复。G/H 最能说明信息成本:当 Panobinostat 的单药响应也从训练去掉,组合差异基因中位 R² 从 0.85 降至 0.38,化学输入无法完整替代真实响应。这条证据支持“结构能改善某些冷启动”,同时清楚显示仍需有相近机制、剂量与背景的功能标签。
Figure 5:组合遗传扰动
原图来源:所用 PDF 文件第 11 页,Figure 5。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| A | 281 个单/双基因扰动潜表示按已知基因程序着色,检验机制结构。 |
| B | 已知协同基因对的真实/CPA 表达比较,检查非加性响应。 |
| C | 已知上位性基因对的前十差异基因比较,检查另一交互类型。 |
| D | 131 组合分别留出时的全基因/前 100 差异基因 R²,与线性及基础基准比较。 |
| E | 比较真实细胞数量与预测 R²,说明测量样本量影响评价稳定性。 |
| F | 训练所见组合数量与 R² 的关系,检验组合信息对泛化的作用。 |
| G | 284 个已测和 5,329 个预测组合的表达 UMAP,展示可探索的扩展空间。 |
| H | 在同一图上以相似度衡量预测不确定性,提醒远离已见组合的预测可靠性不同。 |
| I | 按主要扰动基因标记群集,突出 KLF1,解释表型群结构。 |
| J | 所有含 KLF1 的组合 UMAP,检查不同伙伴带来的响应差异。 |
| K | 用单扰动拟合双扰动的回归参数作层次聚类,比较真实/预测交互模式。 |
| L | 精选基因真实/预测表达变化热图及回归系数,检验协同/抑制等交互方向是否一致。 |
B 的 CBL+CNN1 案例关注共同过表达引起的红系程序,HBA/HBG 等标记是否比单扰动更强;C 的 DUSP9+ETS1 则是 DUSP9 表型主导的上位性,二者检验不同交互形态。D 系统留出 131 个双扰动时,简单基准总体也能取得与 CPA/线性模型相近的准确性,说明该数据很多条件的转录变化相似,不能据此宣布深度模型普遍胜出。E/F 进一步把真实细胞量与训练组合覆盖放到横轴,辨别误差是否受测量和信息量限制。G–J 扩展到未测组合并附潜距离的不确定性,仍需标记预测来源;K/L 用单扰动回归参数和精选基因变化核对协同/抑制方向。最值得复用的是具体非加性案例加系统基准,而不是只展示大规模模拟 UMAP。
我的理解与可迁移设计
可迁移的是明确分解条件并验证不同外推类型,尤其承认完全未见条件需要额外信息。AD 的静息/炎症 MPRA 若有同构建配对标签,可借组合思路定义序列、细胞及刺激条件;若没有配对,就不能声称已学到环境交互。病例/对照观察标签也不能自动视为药物扰动。16 GB 首轮适合小条件头或固定序列嵌入,比较单环境预测、简单效应相加与条件模型;只有真实留出环境标签才能证明跨环境收益。







