82.EvoSemanticDesign:原图、模型逻辑与研究范式

82.EvoSemanticDesign:原图、模型逻辑与研究范式
Perry论文题名: Semantic design of functional de novo genes from a genomic language model
期刊与年份: Nature,2026。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
本篇问题: 基因组功能上下文能否提示模型生成序列新颖但具有所需功能的基因?
这项设计的起点:让基因组上下文承担功能提示
我对问题形成过程的推测是:Evo已经能生成像基因的DNA,但“像”并没有指定功能;原核基因常以操纵子相邻组织,一个已知基因周围的序列因而可能携带其伙伴的功能信息。作者把这种邻近关系变成提示方式,用天然毒素、抗毒素或抗CRISPR相关基因的DNA及其上下游序列引导续写。这里的“语义”是基因组关联所隐含的生物功能,并非给模型输入中文或英文指令。论文将关联学习转成设计,再通过实际功能筛选决定是否成功。
Evo 1.5延续Evo 1的原核、噬菌体和质粒DNA自回归预训练,输入已有DNA,目标仍是预测后续碱基,不额外以目标功能标签微调。它延长8,192碱基上下文模型的训练;主文概述约4500亿token,Methods给出训练至112,000步、累计4700亿token的细节,因此不宜把两个描述当完全一致的精确计数。生成后还要识别开放阅读框、去低复杂度、搜索同源,并用结构及相互作用预测挑选实验候选。“无需任务微调”并不意味着最终筛选流程没有结构先验或监督分类器。研究范式是自监督生成加计算筛选加功能验证,最有价值的证据集中在后两步的分工。
Figure 1:基因组上下文驱动的语义设计
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
这张图先问提示能否传递局部功能关系,而不是直接宣布发现了新蛋白。a、b解释条件续写的逻辑;c从已有基因的一部分补全,比较版本和提示长度。补全准确说明模型学到了编码规律,却不能单独排除训练同源序列带来的帮助。d把任务推进到相邻基因,并同时检查正反向提示,检验的才是操纵子上下文信息是否被利用。此处结构相似度来自预测结构,不是测得的蛋白构象。
e在核苷酸与氨基酸两个层次比较位置熵:若同义位点变化较大而关键氨基酸保持,生成就有可能遵守编码约束,而不是简单逐字复制。这比只报低序列相似度更有说服力;但分析挑选了与参考蛋白相似度超过80%的生成物,不能据此概括所有生成DNA。我的理解是,这张图提供设计方法可工作的前提,真正的功能判定还要看后面的培养与救援实验。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 自然语言中同功能词共享邻词的类比,解释语义上下文概念。 |
| b | 基因组模型把相关功能基因放入相近语义空间,据此生成序列多样但功能相关的基因。 |
| c | 三个保守基因自动补全的恢复率比较,Evo1.5优于早期8k/131k模型。 |
| d | 正反链提示补全大肠杆菌trp操纵子,检查序列恢复与预测结构保守。 |
| e | 天然与生成modB的碱基/氨基酸位置熵,显示保留关键残基同时保持较高核苷酸多样性。 |
Figure 2:低序列相似度的功能毒素—抗毒素系统
原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。
这一组把最关键的判定改成“生成物在细胞里做了什么”。a、b建立毒素和抗毒素的生长读数:表达毒素抑制细菌生长,加入候选抗毒素能否恢复生长;未诱导与阴性蛋白对照用于区分表达负担和特异救援。c、d显示经筛选的生成抗毒素可以救援,且不等同于天然抗毒素的交叉作用范围。e、f将结果与计算共折叠比较,目的在于考察结构预测能否解释功能配对。某些实际交叉救援并没有高置信度共折叠,因此“模型没有预测结合”并不等于“生物学没有作用”。生长恢复也尚未直接测得每一对的结合常数。
g、h的序列与结构搜索用于描述新颖程度,要分清远同源、混合来源和完全新机制。数据库无显著命中依赖搜索阈值和覆盖,不能自动推出全新折叠。i的生成毒素EvoT1具有生长抑制作用,j、k中的RNA抗毒素EvoAT6救援的是天然ToxN;论文没有证明EvoAT6能救援EvoT1,因此不能把两者合并成已经验证的全新匹配系统。还有一个实践细节:部分蛋白经宿主密码子优化后才实验表达,功能验证针对这一表达构建,不意味着未经处理的整段生成DNA可直接作为完整天然系统运行。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 先由基因组上下文生成毒素并测抑制,再以有效毒素生成配对抗毒素并测生长恢复。 |
| b | II型蛋白抗毒素与III型RNA抗毒素的中和原理。 |
| c | EvoRelE1与最近天然匹配的结构预测对照,检查毒素折叠。 |
| d | 诱导毒素后的细菌存活率,EvoAT1–4救援EvoRelE1、EvoAT6救援ToxN,直接验证配对功能。 |
| e | EvoAT1–4氨基酸比对,展示离散保守区和整体多样性。 |
| f | 生成抗毒素对多种天然毒素的存活救援,EvoAT2/4具有跨毒素作用。 |
| g | 生成抗毒素与天然家族的序列/结构匹配数量,评估其新颖程度。 |
| h | 抗毒素—毒素复合结构及天然对照,展示低序列一致性下仍可能保持结合构型。 |
| i | 新毒性蛋白EvoT1的结构预测,展示无明显天然类似物候选。 |
| j | EvoT1序列与结构相似性搜索,检验其不易归入已知天然蛋白。 |
| k | EvoAT6的最低自由能RNA结构及序列,显示与ToxI抗毒素的共同结构特征。 |
Figure 3:语义生成抗CRISPR蛋白
原图来源:所用 PDF 文件第 6 页,Figure 3。点击图片可查看原图。
抗CRISPR实验把“保护”设计成两个不同的可观测后果。a、b说明如何用相关基因上下文生成候选,并用PaCRISPR得分筛选;后者本身是监督分类模型,因此前段富集结果仍是计算预测。c展示候选多样性,为避免最终全是近似拷贝提供依据。d、e使用Cas9切割抗性质粒的生存读数,f、g再用噬菌斑检验能否抵消细胞的CRISPR防御。两种读数共享Cas9相关生物学,却改变了被保护对象和实验终点,相互支持比重复同一种得分更强。
h至k讨论五个有效候选与已知序列、结构的距离。低置信度预测结构不能承担“新折叠”的强结论;发现类似sigma因子的片段也只是机制线索。这里实验证明的是在所用菌株与表达条件下具有抗CRISPR作用,并没有逐个解析直接阻断Cas9结合、切割或表达的分子步骤。17%的实验有效率属于经过多级过滤后测试集合,不是所有随机续写的成功概率。若将这套思路迁移,实验候选数量、计算筛选率和最终有效率应分别报告,避免只保留最好的五个故事。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 抗CRISPR基因与相关aca基因的天然邻接背景,定义提示来源。 |
| b | 用已知Acr周围基因组上下文生成候选蛋白的流程。 |
| c | PaCRISPR判断生成序列的Acr富集,检验提示导向性而非实验活性。 |
| d | 候选Acr序列一致性矩阵,展示生成集合的多样性。 |
| e | Cas9切割抗性基因、Acr阻止切割从而恢复存活的实验流程。 |
| f | EvoAcr1–5的细菌存活救援,EvoAcr3–5活性接近已知AcrIIA2,验证生成候选功能。 |
| g | T4噬菌体噬斑保护实验,提供独立Acr活性读出。 |
| h | EvoAcr1–2低置信度结构预测,说明不能据此强推稳定结构机制。 |
| i | EvoAcr3与最近匹配蛋白结构,显示与sigma-70家族仅有限相似。 |
| j | EvoAcr4–5与已知Acr对照结构,展示部分保留的形状。 |
| k | BLAST与OpenGenome序列检索,区分无明显匹配、极低相似度和有限已知Acr相似的候选。 |
Figure 4:SynGenome生成数据的结构与功能关联
原图来源:所用 PDF 文件第 8 页,Figure 4。点击图片可查看原图。
SynGenome将同一种条件生成扩大到数据库层面。a、b说明提示与生成数据规模;网站上的GO和InterPro检索首先关联的是提示来源注释,不能把这些词当成每条生成序列已经验证的功能标签。c的密码子使用、e的蛋白长度、f、g的结构域分布检查生成物是否保留总体生物学统计。它们能筛掉明显不合理的生成物,却不保证任一序列具有活性。d中主要由生成序列组成的聚类可能反映新组合,也可能反映模型偏差或采样条件,不能仅凭UMAP的分离宣布发现新功能类别。
h、i把提示结构域和响应结构域的共现变成假说图谱:一个未知功能域经常与某类已知域相邻续写,就得到可检验的功能线索。这仍然利用了训练世界中的基因邻近关系,不能把共现边直接解释为物理结合。j筛选潜在结构域融合,提出可供实验探索的组合,但没有为数据库里的融合蛋白逐一验证活性。我认为这张图的价值是生成候选与整理研究线索,而不是把数百亿碱基包装成同等强度的功能证据。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 从天然基因上下文提示生成并注释SynGenome的流程。 |
| b | 提示、生成序列数量及特征,说明1200亿碱基数据规模。 |
| c | 天然提示和生成ORF密码子偏好,检查模型保留组成特点。 |
| d | 主要嵌入聚类中天然/生成比例,检查生成覆盖哪些序列区域。 |
| e | 天然与生成ORF长度分布相近,验证基因长度结构。 |
| f | 两集合Pfam家族计数长尾分布,检查蛋白家族组成规律。 |
| g | 逐Pfam家族频率的相关,检验具体家族丰度是否保留。 |
| h | 提示Pfam与生成响应Pfam的富集连线,展示模型学到的功能邻接关系。 |
| i | 两个未知功能家族DUF的上下文关联,提出与既有假说相符的功能线索。 |
| j | 生成嵌合蛋白的新结构域融合例子,展示新组合候选,尚不等同已实验确认功能。 |
我会怎样迁移:保留条件关系,把每层结论分开
对AD或转座子研究,最值得迁移的是“用可解释的上下文提出候选,再用独立功能读数裁决”的组织方式,而不是直接使用原核Evo给人类序列贴病理标签。原核邻近基因的功能耦合很强,人类远程增强子、染色质状态和细胞类型依赖并不遵循相同的操纵子规律。可以先在人类模型中测试TE序列及其宿主邻域是否携带特定细胞调控信息,再让生成或变异评分服务于候选筛选;不能用模型认为自然,就替代ATAC、MPRA或疾病关联证据。
一个纯计算项目可以具体比较:相同TE家族与相近GC背景下,保留真实邻域是否改善对未见染色体调控状态的预测;将邻域交换、打乱或换成匹配非TE背景,观察信号是否消失。这样的反事实对照能够检查上下文贡献。至于生成新序列,至少分别记录序列新颖度、预测功能和已有独立实验数据支持,避免把三者写成同一结论。本篇最深的启发是:基础模型可以把自然界的关联变成候选空间,但“功能”这个词最终需要与实际测量逐一对齐。






