60.scBasset:原图、模型逻辑与研究范式

论文题名: scBasset: sequence-based modeling of single-cell ATAC-seq using convolutional neural networks

期刊与年份: Nature Methods,2022。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

研究问题: 从峰下 DNA 序列学习的单细胞 ATAC 模型,能否改进细胞表示、批次校正、去噪及 TF 活性解释?

难点与构思:把序列信息带进细胞表示

scATAC的峰很多,每个细胞的读段却少,普通矩阵方法主要利用峰共变,motif方法则用较粗的已知规则。scBasset尝试同时获得表达能力与机制接口。我的推测是,它的构思来自多任务序列网络的一次角色转换:把每个单细胞当成一个预测任务,最后一层为了重建该细胞开放模式而学到的参数,就成为细胞表示。峰的序列信息不再只是聚类后的注释,而是参与建模。

这一接口的收益来自参数共享:同一段序列在许多细胞中测到的开放模式共同约束编码器,稀疏单细胞不必独立学一套复杂规则。但共享也可能优先拟合数量多的细胞,稀有状态的特征容易被压缩。因此要分别报告细胞类型、深度及供者的性能,而不只用全体平均值证明稀有疾病状态也得到恢复。

另一点是开放矩阵的零不能简单等同于真正关闭。低深度细胞常因未采到读段产生假阴性,模型预测概率同时反映真实状态和测量过程。截距吸收深度有帮助,却不能完全校正所有质量差异;TE区域的比对偏差也可能呈现家族特异模式。研究TE时应检查多重比对、峰构建及不同深度下结论是否稳定,避免把技术缺失转换成疾病模块。外部验证最好来自独立供者或不同测量,而不是只在同一个矩阵中再次聚类。

输入、目标与架构为何合适

输入是每个峰中心1344 bp DNA及实际峰×细胞二值开放矩阵。八个卷积块把序列压缩到32维瓶颈,最终线性层为每个细胞输出开放概率,以二元交叉熵训练。序列共享编码器利用多个细胞的测量学习模式,细胞权重表达这些模式对其开放性的相对贡献,截距吸收部分测序深度信息。

这里不需要诊断或细胞类型标签来学习嵌入,属于利用观测开放矩阵的表征学习;序列到开放预测又有明确实验目标。不能简单说它完全没有标签,也不能把末层权重视为每个TF真实活性。32维是压缩表示,多个调控因素可能混合,机制解释要通过后续motif查询和外部验证。

已有peak注释表不够训练这个模型。至少需要每个细胞的实际开放矩阵、峰坐标与匹配参考基因组,只有峰属于TE还是基因附近的信息不能恢复细胞异质性。模型的每个细胞是训练输出,留出峰验证不等于零样本新供者、新细胞泛化。应用于AD资料时,需要额外定义怎样拟合新细胞和怎样做供者外验证,不能直接复用本图的序列留出宣称患者泛化。

表征、去噪与解释的证据链

论文先确认留出峰预测,再检验细胞结构,与同一细胞的RNA邻居比较,接着平衡批次混合和类型保留,最后验证去噪及TF活动。multiome的两种真实测量提供额外参照,而不是把TE家族汇总当成一个新的独立模态。RNA本身也有噪声,邻居一致性是支持证据,不是ATAC状态的唯一真值。

TF活动通过在打乱二核苷酸背景中插入motif,比较预测开放变化得到,模型因此可以回答同一模式在不同细胞背景的响应。这个活动是motif响应代理,未直接测量蛋白量、磷酸化或结合占据。与TF RNA相关及CRISPRi区分结果形成更具体的验证,仍需保留同家族TF共享motif的识别限制。

Figure 1|架构和学习到的细胞表示

Figure 1

原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。

a解释为何最后一层的细胞权重可作为嵌入,b分别按细胞和峰评价留出峰,c与已知造血谱系对应。两个AUROC方向不同:一个问每个细胞哪些峰开放,另一个问某个峰在哪些细胞开放,后者更接近特异性。c的分化顺序来自原研究知识,不是模型单靠t-SNE推导出真实时间;漂亮分群需由b的测量关系及后面的外部参照共同支持。

子图 讲解
a 1,344 bp 峰中心序列输入 CNN,预测每个单细胞的开放性;末层每个细胞的权重成为其嵌入表示。
b 留出峰的 AUROC 分别按细胞和峰评价,确认模型学习到可泛化的序列–开放性关系。
c 末层细胞嵌入的 t-SNE 与造血分化谱系对照,同类细胞聚集,说明参数可作为状态表示。

Figure 2|细胞表示的多数据集评价

Figure 2

原图来源:所用 PDF 文件第 3 页,Figure 2。点击图片可查看原图。

a、b使用流式分选标签作表征评价,并用邻居同标签比例减少聚类参数依赖;c–f在PBMC及鼠脑multiome用RNA聚类和独立RNA邻居结构比较。不是把RNA标签用于训练scATAC模型,所以它们提供不同测量的验证。RNA与ATAC本来关注不同分子层次,完全一致也非必然最优;这里证明的是在所用资料中,序列表征更好保留了与RNA共享的状态结构,不是所有ATAC特异变化都应被抹平。

子图 讲解
a Buenrostro2018 的聚类一致性、ASW 等比较,scBasset 更好地保留细胞类型。
b 同数据的邻居同标签比例,避免只依赖特定聚类参数,scBasset 在多个邻域大小下较优。
c multiome PBMC 的聚类指标,使用配对 RNA 结构作参考,验证另一人类数据。
d PBMC ATAC 邻居与独立 RNA 邻居的重合比例,更高表示两种测量的状态结构一致。
e multiome 小鼠脑的聚类比较,检验跨组织/物种表示。
f 小鼠脑 RNA/ATAC 邻居重合,scBasset 再次较高,提供与聚类互补的验证。

Figure 3|批次校正的平衡

Figure 3

原图来源:所用 PDF 文件第 4 页,Figure 3。点击图片可查看原图。

a–c展示加入批次专属输出路径后的变化,d、e同时比较kBET混合与类别保持。独立批次路径希望让细胞参数少承担技术差异,但正则越强可能越丢失真实生物差异。平衡PBMC和不平衡造血设计的结果不同,说明一个批次混合参数不能跨资料照抄。AD与对照若分别来自不同批次,混合优化可能消除病理,必须用合理采样及供者外证据检验,而非只追求UMAP颜色均匀。

子图 讲解
a 混合两种 10x 化学平台的 PBMC,原模型按批次分开,scBasset-BC 后批次更混合。
b 造血数据未校正的细胞类型/批次图,同一 HSC 等类型因批次被分成多个群。
c 校正后的对应图,批次合并且细胞结构保留。
d 化学批次平衡数据中 kBET 与 label score 对照,Harmony 与 scBasset-BC 均较好,说明需兼顾混合和类型保持。
e 不平衡造血数据的同类比较,scBasset-BC 更好平衡两目标,而过度混合会抹去生物差异。

Figure 4|去噪和跨模态整合

Figure 4

原图来源:所用 PDF 文件第 5 页,Figure 4。点击图片可查看原图。

a从稀疏矩阵中恢复类别模式,b与配对RNA比较,c在表征及每细胞、每基因相关中显示方法权衡,d、e测试跨模态嵌入是否更接近。去噪不是发现新的实测读段,而是模型对潜在开放性的估计;因此不能把填补数值当作增加了样本量。与RNA更一致支持共享生物结构恢复,但也可能弱化独有ATAC信息,图c保留不同指标没有统一赢家的事实,比只报告一个最佳分数更可信。

子图 讲解
a 原始稀疏峰×细胞矩阵与去噪后对照,去噪显现细胞类型相关开放模式,减少深度主导的结构。
b 每细胞基因开放性与 RNA 表达相关的前后对照,去噪提高一致性,低测序深度细胞改善较多。
c 去噪方法的细胞结构和 RNA/ATAC 相关比较;scBasset 在结构上较优,但每细胞/每基因相关存在权衡,没有所有指标的统一赢家。
d RNA 与原始/去噪 ATAC 的联合 UMAP,去噪后相同状态的两模态更靠近。
e 同一细胞 RNA–ATAC 嵌入距离的定量比较,scBasset 与 MAGIC 较好,支持联合分析的实际改善。

Figure 5|单细胞及单碱基 TF 活性

Figure 5

原图来源:所用 PDF 文件第 7 页,Figure 5。点击图片可查看原图。

a–c将motif响应与TF表达及细胞背景比较,d用GATA1、GATA2的CRISPRi资料检查干预后的可区分性。GATA1较好而GATA2仍困难,说明该接口有实证价值但未解决所有TF。e–g在β-globin增强子做单碱基虚拟突变,并沿已知红系谱系比较GATA1和KLF1敏感性;这是特定序列与状态的相互作用,不应称为模型直接证明整个分化因果。预测活动与表达方向不同还可能来自抑制作用或共享模式,需结合额外证据。

子图 讲解
a PBMC 细胞类型 UMAP,给后续 TF 解释提供位置参考。
b 203 个差异表达 TF 的活性–表达相关对照,scBasset 总体比 chromVAR 更一致;抑制因子可表现负相关。
c 关键调控因子的表达、scBasset 活性、chromVAR 活性并列,显示 PAX5、TCF7、RUNX3、CEBPB 的细胞特异性;RXRA 的两方法方向不同。
d 用 GATA1/GATA2 CRISPRi 数据比较 PR,scBasset 更好识别 GATA1 扰动,而两法对 GATA2 都较困难,提供干预验证与边界。
e 造血谱系图说明 HSC→MPP→CMP→MEP 的比较顺序。
f β-globin 增强子的饱和突变 ISM 分数,GATA1/KLF1 位点在红系方向的细胞中更影响开放性。
g 每细胞基序–ISM 分数分布沿谱系升高,尤其 MEP 的 KLF1 增强,说明模型可在特定增强子上解释细胞状态依赖的 TF 作用。

依据:对应主图、完整图注及正文 Results;实验结果只按本文给出的对象和条件解释。

我的理解与AD可迁移设计

这篇与目前ATAC-AD条件最接近,但起点应是找到可用细胞矩阵而非只整理峰注释。可以先在一个脑区、一个细胞类型和多个供者中比较LSI、topic、PeakVI与序列模型,再检验TE重叠峰是否贡献可复现的病理模块。训练不用AD标签,病理与供者用于事后验证;选出某个模块后还需和同长度、GC、覆盖度、可比对性的非TE峰对照。

16GB显存下可以从小细胞子集与少量峰起步,控制输出规模和序列批量,不能按百万细胞的口号直接许诺本机训练。更有意义的创新是明确TE信息是否带来超越共变模型的解释或迁移收益,并用独立multiome、TF响应及遗传证据检查。若序列模型没有改善,也应保留非深度topic路线。任何病理梯度都先称状态关联,只有纵向证据才能进一步讨论进展;该论文的造血图不授予AD伪时间疾病时间的含义。

继续阅读与公开资源