81.Evo:原图、模型逻辑与研究范式

论文题名: Sequence modeling and design from molecular to genome scale with Evo

期刊与年份: Science,2024。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

本篇问题: 基因组语言模型能否同时理解蛋白、RNA与DNA功能,并生成多组件生物系统?

Evo 为什么把单位从分子改为基因组

蛋白模型看氨基酸,RNA 模型看 RNA,调控模型看局部 DNA;但一个功能系统常由这些组分共同完成。Evo 把全部信息放在 DNA 的连续序列中,希望学习跨组分的共同变化。关于构思的推测是:原核基因常在附近排列,基因组上下文天然提供共演化线索,因此长序列模型可能比彼此分离的分子模型更适合研究系统层次的功能。这种设计在原核背景成立的条件,并不自动适用于人类复杂、远距且细胞依赖的调控结构。

模型以单碱基 token 自回归预测下一碱基,使用 70 亿参数 StripedHyena,将少数注意力层与长卷积算子组合,先以 8 kb、再以 131 kb 上下文预训练。数据是细菌、古菌、噬菌体与质粒,没有人类基因组功能标签。长卷积降低纯注意力在长序列中的计算负担,但训练仍是大规模集群工作,不能把架构高效理解成单卡可完整训练。

本文包含三类不同研究:零样本功能评分、加特定系统序列微调后的生成、长序列组织评价。它们各有独立的证据要求。语言概率描述自然序列的统计合理性,不直接等同于活性、必需性或可存活性;只有与真实实验比较或验证的部分,才进入相应功能结论。

Figure 1:原核基因组基础模型预训练

Figure 1

原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。

A 是跨模态研究的愿景,B 是实现方式,C–E 则限定了模型真正见过的生物范围。分类群与基因组长度不均衡会影响学到的先验,所谓覆盖广不能解释为每类生物同样可靠。F、G 在相近计算预算下比较多种架构的困惑度缩放,支持 StripedHyena 的工程选择;这个胜出是给定数据、单碱基分辨率及预算下的结果,不证明它对所有监督 DNA 任务优于 Transformer。

困惑度降低说明下一碱基预测改善,是否增加功能信息,需要图 2 和图 5 另检验。参数与训练数据扩大会耗费不同资源,compute-optimal 曲线提醒我们,模型大小不应脱离训练 token 数讨论。个人项目可以借鉴这种预算意识,而不是把最大公开模型当作默认起点。

子图 讲的是什么,以及如何理解
A DNA同时编码调控序列、蛋白和RNA及跨基因关系,说明基因组层级建模的目标。
B 自回归预测下一碱基的StripedHyena架构,结合注意力和长序列算子。
C 70亿参数Evo的细菌、古菌及病毒训练数据来源,定义模型见过的生物范围。
D GTDB基因组长度分布,说明长上下文需求。
E GTDB界与门的组成,展示训练分类群覆盖及不均衡。
F 模型规模增加时困惑度下降,比较不同架构的DNA预训练缩放规律。
G 在最优计算分配下比较架构缩放速度,用于选择Evo的结构和规模。

Figure 2:蛋白、非编码RNA和调控DNA的功能预测

Figure 2

原图来源:所用 PDF 文件第 5 页,Figure 2。点击图片可查看原图。

A、C 定义突变扫描的实测功能读出,B、D 用多个蛋白和 ncRNA 数据集比较零样本概率排序。它们支持同一 DNA 模型包含多类功能信息,却主要来自原核系统;作者在人类蛋白 DMS 上表现有限,直接否定了“天然可用于所有人类疾病”的推论。概率与功能相关也并非功能校准,尤其不同研究的 fitness 含义不同。

E–G 必须区分直接似然和有标签训练的回归/CNN。Evo 特征加 CNN 表现改善,说明表示有价值,不能把这部分称为零样本。启动子与 RBS 合并后蛋白表达排序更好,支持上下文互补;GC 等简单组成也具有不低相关,必须保留这些基线,才能判断模型新增的信息。

子图 讲的是什么,以及如何理解
A 蛋白深度突变扫描实测适应度对语言模型似然的评估流程。
B 九套原核蛋白DMS上的相关,比较DNA语言模型和蛋白模型的零样本功能预测。
C 非编码RNA突变功能预测的对应评估流程。
D 七套ncRNA DMS相关,检验同一DNA模型能否理解RNA功能。
E 调控序列对应mRNA/蛋白表达的评估流程。
F 四套启动子活性的零样本、GC和监督模型比较,检验Evo表示及直接似然的作用。
G 约12000个启动子—RBS组合的蛋白表达预测,联合提供两段序列时Evo表现更好。

Figure 3:生成CRISPR蛋白—RNA复合系统

Figure 3

原图来源:所用 PDF 文件第 6 页,Figure 3。点击图片可查看原图。

A、B 的生成任务在基因组底座上加入特定系统微调与条件 token,C 的类别控制证明提示能改变生成内容,D 的相似度体现多样性。低相似度不是可靠功能的保证。E–J 中真正的功能证据是 F 的体外切割与非靶向向导控制;G–J 的 RNA、蛋白和复合物结构是计算预测,增加合理性但不替代活性测量。

验证候选来自约两百万生成序列的多层筛选,最终测试 11 个系统,一个显示稳健活性。因此不能把 1/11 解读为随机生成的原始成功率。筛选使用序列注释、结构置信及人工检查,说明生成模型之外的领域知识非常重要。体外目标上的活性也不等于细胞内编辑效率或全基因组脱靶安全性。

子图 讲的是什么,以及如何理解
A 共同生成Cas蛋白与非编码RNA的任务示意。
B Evo用CRISPR基因组片段与Cas类型条件token微调,定义定向生成策略。
C 不同Cas提示生成的主要Cas类别,检验条件控制。
D 仅专用训练对基础模型微调的蛋白序列相似度分布,评估生成多样性。
E EvoCas9-1生成位点的蛋白与RNA注释,显示系统组件共同出现。
F EvoCas9-1和SpCas9体外切割时间曲线及不匹配向导对照,验证生成系统的活性和特异性。
G 生成sgRNA二级结构及与天然参考差异,展示RNA组件的结构。
H 生成Cas9蛋白结构预测与SpCas9晶体比对,检查折叠合理性。
I 生成sgRNA结构预测对天然晶体RNA,比较RNA几何构型。
J 生成Cas9与共同设计sgRNA的复合结构预测,展示组件配合;此处为计算预测。

Figure 4:生成转座蛋白、RNA和DNA末端系统

Figure 4

原图来源:所用 PDF 文件第 8 页,Figure 4。点击图片可查看原图。

A–C 解释为何移动元件是跨组分建模的合适案例:蛋白与两端 DNA 的匹配,部分系统还包含 RNA 组分。D 定义实验如何识别切出和插入产物,E/F/G 与 H/I/J 各组成一个设计—活性—产物序列的链条。催化位点失活和不同底物类型提供关键机制控制,纳米孔测得连接产物比仅看到一条凝胶带更具体。

验证主要支持 TnpA 与共同设计 DNA 末端的体外功能。更复杂元件中 TnpB、RNA 的序列或结构预测,没有因此全部完成各自功能验证。候选仍经过天然系统相似性和结构筛选,11/24、3/24 的成功比例属于筛选后的两组设计。这里研究细菌转座系统,不能直接把其活动机制转移到人类 LINE、SINE 或 LTR 对 AD 的调控影响。

子图 讲的是什么,以及如何理解
A IS200/IS605的TnpA、末端发夹及可选TnpB-RNA组件,说明多模态设计任务。
B 使用天然IS200/IS605片段微调Evo的流程。
C 生成TnpA/TnpB与训练集最相近蛋白的序列一致性分布,检验新颖程度。
D 体外转座切出与插入产物PCR检测示意,定义实验读出。
E ISEvo1生成元件的DNA与蛋白组成,展示设计实例。
F ISEvo1凝胶证明单链DNA底物上的活性依赖催化Y124,双链底物活性较低。
G ISEvo1产物的纳米孔读段,验证连接产物序列。
H ISEvo2生成元件的DNA、RNA与蛋白组成,展示更复杂系统。
I ISEvo2凝胶证明单链底物活性依赖Y125,检验另一生成实例。
J ISEvo2产物纳米孔读段,确认转座相关连接结果。

Figure 5:全基因组突变评分预测基因必需性

Figure 5

原图来源:所用 PDF 文件第 9 页,Figure 5。点击图片可查看原图。

A 是继续训练后的上下文扩展,B 将提前终止引入基因,再比较变异与原序列概率;C 用真实必需基因标签评价,但这些标签没有参与该评分的训练。增加到 8 kb 后通常明显改善,继续到 66 kb 的平均收益有限、部分难例改善,说明“更长”不是每个任务都单调提升。

D 的两个具体物种表现较好,还需与 C 的全部研究分布一起读,不能只取最好案例。位置和保守性控制帮助排除简单替代解释,但长上下文收益可能含操纵子、功能类别与邻域组成,不足以声称模型已逐一识别所有基因相互作用。必需性依赖实验生长条件,原核结果也不是人类组织中的基因必需性或 AD 风险。

子图 讲的是什么,以及如何理解
A 从8k训练扩到131k上下文的阶段,说明基因组任务的长度适配。
B 对每个基因引入提前终止,用突变/原序列似然比预测必需性,定义筛选。
C 58套细菌/噬菌体实验的AUROC,加入8k基因组环境明显改善,66k在部分研究进一步提高。
D λ噬菌体及铜绿假单胞菌必需/非必需基因评分分布,展示具体物种区分。

Figure 6:长生成序列的基因组结构合理性

Figure 6

原图来源:所用 PDF 文件第 10 页,Figure 6。点击图片可查看原图。

A 的物种提示来自训练时的分类条件,B、C 对比编码密度和同链成簇,D、E 为预测蛋白寻找结构与功能相似,F–H 检查组成和终止密码子规则。这些检查说明生成比均匀随机序列更像天然原核基因组;随机背景较容易区分,不能代替与更强生成或重排控制的比较。

关键限制在正文中很明确:生成序列缺失许多保守标记基因,rRNA 很少,许多结构预测置信度低,并未重建可存活的完整基因组。GO 类别来自预测结构与天然蛋白匹配,也不是逐个蛋白的实测功能。百万碱基生成超过上下文长度,模型需连续采样,局部语法可能正确而全局协调不足。图的精美组织外观不应遮住这个边界。

子图 讲的是什么,以及如何理解
A 用物种token生成约650kb序列的流程,定义长生成任务。
B 生成、天然及随机序列的编码密度分布,检查生成是否保留天然基因组织。
C 131kb区域的基因箭头方向,生成和天然序列都出现同链成簇的操纵子样结构。
D 约1Mb生成序列的基因布局,展示长距离组织。
E 生成蛋白结构预测及相似天然蛋白功能类别,检查候选基因的结构/功能合理性。
F 生成对天然基因组四核苷酸使用偏差TUD的相关,检验物种组成特点。
G 基于TUD的层次聚类,检查生成序列是否接近对应物种。
H 三种阅读框终止密码子使用比例,比较编码规则;这些结构分析本身不等于整段生成基因组已经可存活。

我会借鉴的部分与暂不适合照搬的部分

本文最值得迁移的是“共同上下文包含组分协调信息”的问题意识。研究 TE 调控时,可以同时描述元件自身序列与附近调控区,比较局部模型和带邻域模型对独立实验效应的增益,再追问增益来自哪一类关系。这样的消融能把长上下文从口号变成可检验假说。

对纯计算 AD 项目,优先使用经过人类数据验证的较小模型,Evo 可作为方法思想或原核模型对照,不能仅因它能生成转座系统就视为最佳 AD 底座。16 GB 显存也不支持原样重做这套训练;量化推理、冻结特征和小模型蒸馏都需要实际兼容性与任务验证。更现实的创新是证明一种 TE 内部或邻域的协调特征在独立供体中关联病理,并能解释 MPRA 的等位效应,而不是从“模型更大”推出“机制更深”。

这些层次在报告结论时应分别列出。

继续阅读与公开资源