62.CREsted:原图、模型逻辑与研究范式

62.CREsted:原图、模型逻辑与研究范式
Perry论文题名: CREsted: modeling genomic and synthetic cell-type-specific enhancers across tissues and species
期刊与年份: Nature Methods,2026。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
本篇问题: 如何统一训练、解释和设计跨组织、跨物种的细胞类型特异增强子?
先把“增强子代码”变成可以检验的任务
一个区域在某种细胞中开放,不意味着它在所有细胞中都是增强子;类似 TF 也可以识别相似 motif,因此“找到一个 motif”还不足以说明细胞特异性。CREsted 的核心困难是把大型 scATAC 图谱变成可比较的序列标签,进而解释不同细胞怎样使用同一类序列。它是一套训练、解释与设计的软件工作流,支持多个模型,而不是一种固定架构在所有组织上通用。小鼠脑、人免疫细胞、癌症状态和斑马鱼分别承担预测、机制比较、迁移和设计验证的角色。
我的推测: 作者将既有 enhancer 模型的经验工程化,是因为决定研究成败的常常不是再换一个网络层,而是细胞类型间开放度可否对齐、稀有特异峰是否被共享峰淹没、解释与设计是否能用同一个预测目标衔接。输入是区域 DNA 的 one-hot 编码,输出是多细胞类型的开放度或二值标签。分类用二元交叉熵;回归兼顾预测向量的方向相似性与对数尺度误差,从而同时关注活性大小和细胞特异模式。训练先用共识峰,再向特异峰微调,体现的是任务匹配的课程设计。
应把模型的 ATAC 标签和报告基因活性区分。开放性提供有用代理读出,真正“设计成功”的证据要来自新序列在预定细胞中的实测表达。论文后半部分因此不是装饰性应用,而是检验代理目标能否跨到功能这一关键问题。
Figure 1:CREsted的模型训练、解释与设计流程
原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。
无字母的流程图已经提出整篇论证的依赖关系:scATAC 预处理先得到每细胞类型的目标矩阵,模型再学习区域序列,核苷酸贡献分数用于聚合 motif,最后才进入序列设计。它还允许 topic 标签与伪总体标签,这两种对象不能混称“单细胞预测”:topic 是由细胞和峰概率形成的潜在程序,伪总体是同类细胞读数聚合。
预处理不是中性的文件转换。不同细胞类型的峰数量会影响 CPM 尺度,作者使用较稳定的峰作跨类型校正;否则模型可能把归一化差异误学成生物差异。图中的 TF 匹配也并非从 motif 唯一推导出蛋白:需结合表达背景,仍会留下同家族歧义。设计模块把预测向量与指定目标比较,所以可以惩罚非目标活性;如果只最大化一个目标的分数,得到的可能只是普遍强序列。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| 全图(无字母) | 从scATAC细胞类型开放度建立序列模型,再用核苷酸贡献分数找模体、匹配TF并设计合成增强子;说明软件端到端的用途。 |
Figure 2:小鼠运动皮层增强子预测与调控代码
原图来源:所用 PDF 文件第 6 页,Figure 2。点击图片可查看原图。
小鼠运动皮层作为高分辨率试验场,要求模型不只区分神经元和胶质,还区分相近神经元亚类。a 说明细胞覆盖,b 的散点汇集非零峰,c 的跨类型相关热图比一个总体相关数字更能辨别细胞特异性。d 又分别评价全部峰与特异峰,检查模型是否靠普遍开放的区域取得好成绩;微调收益也应按对应子集讨论,不能说所有比较都显著。
e 中小鼠测试染色体与鸡同源环境是不同层次的泛化。跨物种个别位点吻合提示规则可共享,但不足以声称所有鸟类脑亚型都能由鼠模型准确预测。f–h 从验证 enhancer 的序列归因推进到模式汇总和 TF 表达匹配。负贡献尤其要谨慎:多输出模型可能用一类细胞的正特征来降低另一类预测,作者指出这会让 motif 看似抑制性。归因正负不是直接测得的 TF 激活或抑制方向。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 运动皮层scATAC的UMAP展示各细胞类型及建模数据来源。 |
| b | 预测与实测非零开放峰高度的散点,检验模型能否从序列预测开放度大小。 |
| c | 分细胞类型的预测/真实相关热图,检查细胞特异的匹配而非仅总体相关。 |
| d | 比较gReLU、CREsted基础与微调模型在全部峰和特异峰的相关性,评估模型选择及微调收益。 |
| e | 测试染色体小鼠基因位点和鸡同源环境的预测轨迹对照ATAC,检查基因组定位和跨物种应用。 |
| f | 三个体内验证增强子的核苷酸归因标出模体,解释哪些序列支持目标细胞活性。 |
| g | 各细胞类型中重要模体的聚类热图,正/负贡献分别表示促进或抑制预测开放度。 |
| h | 结合TF表达与匹配模体重要性,帮助把序列模体归因到可能的细胞类型调控因子。 |
Figure 3:在人PBMC中识别功能性TF结合位点
原图来源:所用 PDF 文件第 4 页,Figure 3。点击图片可查看原图。
这张图检验归因是否定位真实结合位置。a 的 t-SNE 展示模型表示的组织,不提供独立结合验证;b/c 特意把已验证 TFBS 与新提出 TFBS 区分,在 CD79A、TCRα 和 IFNB1 等 enhancer 中,模型复现已知复杂结构,同时也有遗漏。图上的新框不能被文章解读直接升级为已实测位点。
e 的 ChIP 精确率—召回率和 f 的 UniBind 召回回答不同问题:ChIP 峰可包含间接结合,直接结合参考更适合定位短 seqlet,但这些参考本身来自特定实验环境。g 的信号聚合检查模型候选是否富集结合读数。h/i 更有力,因为模型内改变 EBF1 位点的预测与实际 EBF1 降解后的开放图谱比较;二者干预对象仍不同,前者改 DNA、后者改蛋白并可引起间接效应,因此是机制一致性检验,不是对全部预测 SNP 的原位验证。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 细胞类型特异区域的模型嵌入t-SNE,检查序列表示是否组织出细胞类型差异。 |
| b | CD79A与TCRα增强子的归因标出B细胞及T细胞模体,区别既有验证位点与新候选位点。 |
| c | IFNB1增强子双链归因标出增强体区域,检验模型能否找出已知组合调控位点。 |
| d | 各PBMC类型的重要模体热图,概括不同免疫细胞的增强子代码。 |
| e | 模型seqlet对ChIP峰的精确率—召回率曲线,检验归因片段是否对应实验结合信号。 |
| f | seqlet在UniBind结合位点中的召回率,提供另一套实验参照。 |
| g | 不同候选CEBPA位点集合的ChIP峰高度比较,检验模型识别是否富集真实结合。 |
| h | 在小鼠Tcf3位点突变EBF1模体后的预测变化,对照实际EBF1降解后的ATAC变化,检查跨物种机制一致性。 |
| i | h中两个区域的归因显示EBF1、PAX5、MEF2候选位点,解释预测变化的序列来源。 |
Figure 4:跨癌种、细胞系和活检的MES样调控状态
原图来源:所用 PDF 文件第 8 页,Figure 4。点击图片可查看原图。
癌症案例问的是:跨癌种反复出现的 MES 状态,是否共享序列调控逻辑,而不只是表达或开放总量相似。a/b/c 分开训练细胞系模型和患者活检 topic 模型,加入非 MES 细胞系及另一种建模方式作参照。d 的 AXL 区域同时展示 ChIP、ATAC 与序列贡献,比仅展示一张相似性热图更能追踪候选机制。
e 比较 motif 组成,f 则让读者看到 patient-specific 与共享 topic 并存。g/h/i 在贡献分数层面比较两类模型,希望减弱拷贝数等非序列变化对总开放度的影响。这并不意味着患者效应已完全消除,也不能用 topic 8 的对应直接诊断临床 MES 亚型;贡献分数间相关依赖相同解释工具和候选区域选择。较可靠的阅读是:本文找到跨环境重复的 AP-1、TEAD 等候选程序,并提供可进一步实验核验的序列实例。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 展示基于癌细胞系的DeepCCL及胶质母细胞瘤活检的DeepGlioma训练流程。 |
| b | DeepCCL各细胞系预测/真实开放度相关热图,并标出MES样状态。 |
| c | 比较基础、微调模型及ChromBPNet集成在全部峰和特异峰的预测相关,评估不同建模方案。 |
| d | AXL内含子区域的ChIP、ATAC与活检轨迹配合归因,寻找MES状态共用的功能模体。 |
| e | 比较胶质母细胞瘤与黑色素瘤MES细胞的重要模体计数,检查跨癌种共享代码及微调影响。 |
| f | 活检细胞t-SNE按患者和调控主题概率着色,定位组织样本中的状态群体。 |
| g | DeepCCL与DeepGlioma归因的Spearman相关,检验细胞系与真实活检中的调控代码能否对应。 |
| h | DeepCCL各类的重要模体热图,展示癌细胞系的状态代码。 |
| i | DeepGlioma各类的重要模体热图,与h对照观察活检中是否出现对应状态。 |
Figure 5:从Borzoi迁移学习与外部增强子基准
原图来源:所用 PDF 文件第 9 页,Figure 5。点击图片可查看原图。
模型大不大与目标合不合适在这里被直接拆开。a/b 改装 Borzoi、选择冻结或微调,并比较共识峰与特异峰训练顺序;观察的是同一任务上预训练表示能否被有效转用。c 使用外部鼠脑图谱匹配类别,检查训练数据内部的成功能否延伸;d 的体内验证 enhancer 是另一种读出,能检验开放性代理对功能特异性的实际价值。
e 把同一 SstChodl enhancer 交给不同模型解释,提示原始大模型缺少某些细胞亚型的适配,不能把它的低分当成序列本身无效。相近表现也不意味着小模型在所有全基因组任务都胜过大模型:本文比较的是局部开放性及特异 enhancer。值得借鉴的是目标与评价对齐,再决定预训练是否值得,而不是将“基础模型”当作自动正确的选择。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | Borzoi改装、冻结或微调后用共识峰/特异峰训练的流程,说明迁移方案。 |
| b | 比较不同训练顺序及冻结策略的平均相关,检验预训练表示与任务适配的作用。 |
| c | 在小鼠脑图谱匹配细胞类型的测试峰上评估,检查外部数据的细胞特异预测。 |
| d | 体内验证增强子上的特异性精确率—召回率曲线,检验预测是否转化为真实细胞定位。 |
| e | 验证的SstChodl增强子在不同模型中的归因,比较模型对同一功能序列的解释。 |
Figure 6:斑马鱼体内验证单一和双重细胞代码设计
原图来源:所用 PDF 文件第 11 页,Figure 6。点击图片可查看原图。
图的证据必须从设计分数与动物实测两条线读。a/b 先确认斑马鱼细胞与既有 enhancer 的对应;c–e 是计算优化曲线,箱线图显示整组候选,线显示选去实验的序列。分数单调变好首先说明搜索服从预测器,f–h 的荧光才检验是否在目标组织表达。内皮设计并非全部同样成功,正是代理目标到功能之间仍有误差的证据。
i/j 指定心肌和体肌的目标比例,k–m 展示双活性;模型分数比例不能改写成精确的体内表达强度比例。Methods 明确说明该报告设置不能控制每细胞的构建体拷贝数,因此主要评估定位特异性,而非定量表达水平。图中分数是像代表图那样的胚胎数与总观察数之比,不是所有组织细胞的阳性率。n–p 的 motif 分析解释双代码如何组合,但实验筛选还有人工查看归因的步骤,不能把所测少量序列的表现外推到所有优化候选。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 48小时斑马鱼胚胎及scATAC UMAP标出目标类型,定义设计对象。 |
| b | 已验证增强子的模型分数与胚胎活性比例热图,检查设计前模型的实验一致性。 |
| c | 心肌增强子在逐轮优化中的分数变化,展示总体序列分布及实际测试序列。 |
| d | 体肌增强子的逐轮分数,展示针对另一类型的优化过程。 |
| e | 内皮增强子的逐轮分数,检查第三种目标的优化。 |
| f | 设计心肌增强子的胚胎荧光图,验证表达是否定位心肌。 |
| g | 设计体肌增强子的胚胎荧光图,验证表达是否定位体肌。 |
| h | 设计内皮增强子的胚胎荧光图,验证血管内皮定位。 |
| i | 双代码增强子逐轮的体肌和心肌分数,展示同时优化两种活性的过程。 |
| j | 最终全部双代码序列的两种类型分数,比较预设目标比例。 |
| k | 心肌/体肌1:1设计的体内报告图,检验双组织活性。 |
| l | 心肌/体肌2:1设计的体内图,检验偏心肌的目标。 |
| m | 心肌/体肌1:2设计的体内图,检验偏体肌的目标;图内分数给出代表图对应的胚胎比例。 |
| n | 各设计组代表序列的归因,定位实现不同目标的模体。 |
| o | 心肌/体肌设计序列的模体计数热图,检查双代码如何组合两类调控模式。 |
| p | 内皮设计序列的重要模体,展示第三种类型的序列代码。 |
我的理解:模型创新也可以发生在任务与实验之间
CREsted 给我的启发是,最有说服力的工作流应能同时暴露成功和失败。局部多输出模型可以在合适标签和微调策略下达到大模型相近的细胞特异预测,但解释工具会把类别竞争误标成抑制,优化目标会把预测比例误当成表达比例;这些边界都应由评价或实验发现,而不是在文章末尾笼统说“还有局限”。
这篇属于序列到功能监督建模、代码解释、逆向设计与体内验证相接的范式。若只做 AD 公共数据计算,我会借其共识峰到特异峰的训练思路,研究特定脑细胞中 TE 重叠峰的序列决定因素,同时设置同样开放强度、距离和可定位性的非 TE 峰。它不能直接提供 AD 病理标签或 AD 因果证明。若加入疾病状态,应按供体留出并验证是否只是细胞比例变化;若提出负贡献 TF,需要真实扰动才能判断抑制机制。
一个明确的失败标准是:模型仅在共享峰上提高相关性,却无法改善独立脑细胞亚型或等位功能标签。遇到这种结果,不应继续用更漂亮的 motif 图解释特异性,而应重新审查标签归一化和任务目标。
来源核对: 依据本地原文正文 Figure 1–6、讨论与 Methods 的训练、TFBS验证、序列设计、报告基因筛选和实测判定说明。





