19.scFoundation:原图、模型逻辑与研究范式

19.scFoundation:原图、模型逻辑与研究范式
Perry论文题名: Large-scale foundation model on single-cell transcriptomics
期刊与年份: Nature Methods,2024。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
阅读来源说明: Nature Methods,2024;以当前 PDF 为准。
研究瓶颈怎样转化为问题
单细胞读深差异并非普通独立噪声:低读深会系统丢掉基因,约两万个基因的完整注意力又昂贵。scFoundation 针对这两个限制设计读深感知预训练和非对称结构。依据设计逻辑推断,idea 是明确让模型知道原始与期望读数,学习相同细胞在不同测量深度下的表示,而不假定归一化已消除所有差异。
输入、目标与结构
100M 参数模型覆盖 19,264 个基因,50 百万以上人类单细胞用于预训练。连续表达嵌入保留数值,稀疏非零编码器与完整解码器减少成本;降采样、随机掩码及原始/降采样总计数指示共同训练表达恢复。推理可设期望读深高于实测,以得到模型估计值;这属于推断增强,不是新增测序。细胞/基因上下文嵌入再接药物、注释或 GEARS 下游模型,需各自标签。
Figure 1:scFoundation 预训练
原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 收集 50 百万肿瘤/非肿瘤细胞,以掩码表达及原始/降采样总计数训练表达恢复,学习读深感知表示。 |
| b | 贝叶斯降采样、掩码、非零编码、完整解码及回归损失的流程;细胞嵌入也可直接提供下游使用。 |
| c | 展示嵌入用于聚类、药物响应、扰动、注释及基因模块的途径。 |
把读深目标放入训练契约,是区别于只做掩码恢复的重要因素。编码器只处理非零输入以利用稀疏性,解码器仍预测完整基因空间,使结构与测量特性相配。预训练多组织和疾病状态增加多样性,也需追踪与下游研究重叠。模型恢复的零/低表达不应直接作为真实分子计数用于差异检验,否则可能强化模型已经学到的共表达假设。
Figure 2:读深增强和聚类
原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 比较不同参数及计算量下的训练损失,检验规模带来的表达恢复能力。 |
| b | 在未见数据比较非零基因相对误差与全基因相关性,评价提升读深后的表达恢复。 |
| c | 改变期望读数倍数,比较各插补方法聚类指标,检验读深提升是否保留生物差异。 |
| d | 降采样与各恢复方法 UMAP 及映射到原始 UMAP 的聚类,检查丢失群集的恢复。 |
| e | Zheng68K 原始表达与模型恢复嵌入的 UMAP 对比。 |
| f | 在 Zheng68K 比较 scFoundation、scVI 与原始资料的聚类性能,量化 e 的差异。 |
降采样后有原始高深度数据作对照,是表达增强能被评估的关键;c/d 检查恢复后是否保留群体,e/f 再在实际数据看聚类。人工降采样不能涵盖所有真实低质量原因,如降解或细胞破裂。更好的聚类也不证明每个插补数值准确,更不产生新独立样本。后续关联应以原始观测为主要证据,并把增强作为表征或敏感性分析。
Figure 3:癌细胞系药物反应
原图来源:所用 PDF 文件第 6 页,Figure 3。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 用预训练嵌入代替表达输入药物响应回归模型的结构。 |
| b | 按药物及癌种比较基线/嵌入模型的 PCC,检查改善是否广泛。 |
| c | WZ-1-84 在低级别胶质瘤中的 IC50 真实/预测散点,展示具体剂量敏感性预测。 |
| d | 每次留出一种药物的盲测,比较相关增益及化疗/靶向药类型,检验新药物泛化。 |
| e | 在预测敏感细胞系作 GSEA,显示阿霉素的鞘脂及伏立诺他的 mTOR 等通路关联,提供响应机制线索。 |
a 用相同下游模型替换输入,b/d 分药物、癌种和未见药物检验嵌入增益。细胞系 IC50 与病人治疗反应不是同一终点,药物结构等输入也会影响新药泛化。GSEA 针对预测敏感集合能生成机制线索,但该集合由模型选出,不构成独立功能验证。应在真实敏感性或外部实验中复核通路。
Figure 4:单细胞药物敏感分类
原图来源:所用 PDF 文件第 7 页,Figure 4。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 将细胞嵌入接入单细胞药物敏感/耐药分类的流程。 |
| b | 四药物 ROC 与 SCAD 基线比较,评价嵌入的分类价值。 |
| c | 比较预测敏感概率与 EpiSen 分数的关系,检查生物状态与药物响应一致性。 |
| d | 用嵌入及原始数据作 PCA、按 EpiSen 着色,检验与响应有关状态的分离。 |
| e | 三个 bulk 药物数据敏感/耐药聚类比较,检查不同资料尺度的表征。 |
单细胞敏感/耐药分类与 bulk 表达回归不同,需有相应标签才能校准。EpiSen 与预测概率一致为状态关联,但不能证明衰老程序导致药物反应;表达和分类可能同时受同一背景影响。PCA/聚类用于观察,不宜替代 ROC 和外部测试。若迁移到 AD,应先定义可测分子/病理终点,不能把癌细胞药敏标签直接当神经细胞风险。
Figure 5:基因扰动及遗传交互
原图来源:所用 PDF 文件第 8 页,Figure 5。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 细胞特异基因嵌入进入 GEARS 的结构,增加上下文信息。 |
| b | 与原 GEARS 比较扰动后表达 MSE,检验嵌入能否减少误差。 |
| c | 主要差异基因预测落在真实分布 45–55% 分位区间的比例,与 10% 背景比较,检验预测是否接近真实中心。 |
| d | ETS2+CEBPE 的前 20 差异基因预测/真实表达箱线图,观察方向及幅度改善。 |
| e | 逐组合比较预测与真实交互 magnitude 分数,检验对非加性程度的估计。 |
| f | 比较各方法筛选前 20 协同/抑制组合与已验证集合的交集,评价候选交互发现。 |
GEARS 接入细胞特异基因嵌入检验上下文是否增加扰动能力;MSE、方向分布、交互 magnitude 和前 20 推荐分别评价不同收益。45–55% 分位命中说明预测接近真实分布中心,并非完整单细胞异质性重建。遗传交互评分仍依赖表达定义,不能替代生长或疾病功能交互。额外嵌入有效不意味着无标签即可预测所有未知基因。
我的理解与可迁移设计
我会借鉴把读深和条件写进数据契约,而不是把技术差异统统交给黑箱。AD 单核数据的核内 RNA、降解和细胞状态可能与训练中的普通细胞不同,增强前应检查适用范围。16 GB 可优先提取固定细胞/基因表征,用真实供体切分做小头评价,避免从零预训练。针对 DNA×AD,scFoundation 只能提供细胞状态背景;真实等位、构建和序列仍需另一数据层。生成表达可以帮助探索,但不应与实测数据混合后宣称增加了独立验证数量。
关键检验是收益出现在哪里:若只提高细胞类别分离,却没有改善目标等位或病理效应的外部预测,就不能把它当主机制创新。可用不增强、简单读深归一及固定嵌入三种方案比较,保持全部其他输入和切分一致。 必须把模型恢复值和原始计数明确标记,保留后续分析可追溯性。







