90.PersonalExpressionFineTuning:原图、模型逻辑与研究范式

论文题名: Fine-tuning sequence-to-expression models on personal genome and transcriptome data

期刊与年份: Genome Biology,2026。论文原文。

范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。

返回专题总目录

本篇问题: 个人基因组与表达数据微调能改善哪些泛化任务,仍有哪些限制?

从失败基准走向“个人数据微调是否能补上缺口”

我对问题形成的推测是:前两篇基准指出参考序列模型常读错个人表达差异,最直接的修复想法就是让模型在训练时看到这些差异。本文将这一自然想法做成可检验研究,同时把“新的人”“新的人群”和“新基因”分开。最重要的结果不是微调后一个数字提高,而是提高发生在哪里、仍不能泛化到哪里。

作者用Geuvadis 421人的配对WGS与LCL RNA,微调Enformer。输入缩短为TSS周围49,152 bp,两单倍型生成个人预测;主模型随机选同一基因的两人,拟合标准化表达差值,损失为差值均方误差。它借用对比学习的思想,却仍是使用表达标签的监督学习,并非无监督训练。配对消除了同一基因的平均表达偏移,让梯度集中于个体差异;配对数增加也不等于独立供体变多。

输出通过中央十个bin的注意力池化与线性头汇总,全部模型权重默认参与微调。卷积与Transformer仍提供预训练的局部及远程表示,末端映射适配RNA任务。对照还包括单样本回归、配对分类、几种基因型线性模型和随机初始化。疾病或病理标签没有进入任务,讨论“个人转录组”也不意味着能预测AD进展。研究范式是冻结划分后的监督微调与泛化审计。

Figure 1:以个人表达差值微调Enformer

Figure 1

原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。

无字母流程图的关键是先固定同一基因,再随机选两个人,而非比较两个基因平均表达。两人序列往往只差少量变异,差值目标因此鼓励网络利用这些位置。但个人表达还包含非遗传因素,目标不能被理解为纯粹遗传真值。基因间方差被标准化,避免少数高方差基因支配损失;这一处理需要在实际复现中记录,不能把标准化值当绝对RNA数量。

我认为图1是一项清楚的目标设计,而不是自动解决因果识别的方法。两人同时携带许多连锁变异,预测差值正确仍可能靠相关代理。要知道网络是否找到功能位点,必须看后续图4的独立线索与未见基因测试。

子图 讲的是什么,以及如何理解
全图(无字母) 同一基因随机取两个人的基因组和标准化表达,以预测表达差值的均方误差训练,直接让模型学习个体变异的作用。

Figure 2:已见基因、新人群与未见基因评估

Figure 2

原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。

a建立三个互不重叠基因组:200随机个体划分基因、200欧洲训练/Yoruba测试基因、670未见基因;还以不同染色体避免区域泄漏。b显示微调对已见基因的新供体明显改善,跨人群稍弱,未见基因未改善。这意味着模型更会解释已经见过的调控变化,并未形成普遍可迁移的新语法。

随机个体留出大多是已见常见变异的新组合,不是全部新变异测试。跨人群改变等位频率与LD,也改变可见变异,因此不能只称“同一任务换样本”。线性模型与微调在相同人数、输入范围和划分比较,使收益具有可解释对照。0.28和0.17是跨基因平均的个人相关,不能写成28%或17%的病例分类准确率。

子图 讲的是什么,以及如何理解
a 随机个体划分、人群划分及未见基因三套评估,严格区分新组合、未见祖源及全新序列任务。
b 微调模型对基线的平均个体间相关:随机划分约0.28、未见人群约0.17;对已见基因有提升,未见基因未改善。

Figure 3:冻结、混合训练与预训练消融

Figure 3

原图来源:所用 PDF 文件第 7 页,Figure 3。点击图片可查看原图。

a冻结CNN、Transformer或二者,性能只轻度变化,说明本数据下末端映射调整承担了相当部分收益;但冻结实验不能证明所有内部特征完全不变或无关。b同时加入原Enformer数据或MPRA没有明显改善,排查遗忘与序列多样性不足的简单解释。MPRA只有短片段且背景不同,结果不能扩展为“功能数据永远无用”。c随机初始化较差,说明预训练表示仍重要。整组消融告诉我们,利用已有语法和重新学会通用语法是两件事。

子图 讲的是什么,以及如何理解
a 冻结CNN、Transformer等组件后性能仅轻度下降,说明微调主要调整末端MLP映射。
b 个人数据与原Enformer或MPRA混合训练的表现,检验额外功能数据能否改善泛化。
c 从随机权重开始训练的表现较差,验证原预训练表示的作用。

Figure 4:因果变异优先级能力

Figure 4

原图来源:所用 PDF 文件第 8 页,Figure 4。点击图片可查看原图。

a以MAGE统计精细定位的高PIP对低PIP位点比较,限定为各模型训练时都见过的变异,并在同一基因中选背景。因此它检验的是已见基因内的候选优先级,并未证明对未见罕见变异有同等能力。高PIP仍是统计证据,不是每个变异的实验因果确认。

b在DNase足迹中检查驱动变异富集,并控制TSS距离,因为模型偏向启动子、足迹也密集于启动子。去掉这一步会把位置偏差误当机制解释。足迹富集支持预训练的调控信息被利用;实际TF占据还受切割偏好及检测方法影响,不能把一个重叠点当直接结合验证。这里预训练模型本身也有较好富集,显示总体表达不准与找不到重要序列并不等价。

子图 讲的是什么,以及如何理解
a 用同一基因的高PIP(>0.9)与低PIP(<0.01)eQTL比较ROC,配对微调模型的AUROC最高(约0.85)。这里以统计精细定位作为参照,尚未逐个实验确认变异的因果作用。
b 控制TSS距离后的驱动变异DNase足迹富集,配对微调最高、原Enformer接近,支持预训练调控代码有用。

Figure 5:深度预测近似变异线性加和

Figure 5

原图来源:所用 PDF 文件第 10 页,Figure 5。点击图片可查看原图。

左右两图以ISM权重乘变异剂量近似深度网络,预测相关几乎相同,说明个人变异在本数据范围主要呈加和。它没有否定网络在motif内部学习非线性,也没有证明生物调控本质上线性。个人常见变异通常较稀疏,当前人数和读数可能不足以识别强交互。深度模型如果不能在相同测试上超过线性近似,研究就应解释它额外提供何种机制或新变异能力,而不只以模型复杂命名。

子图 讲的是什么,以及如何理解
左:随机划分基因 深度模型与用ISM作为权重的变异剂量线性近似相关几乎相同,说明个体变异作用主要可加。
右:人群划分基因 跨人群也表现接近,提示当前性能收益未明显依赖变异间强非线性交互。

Figure 6:常见与罕见变异的预测贡献

Figure 6

原图来源:所用 PDF 文件第 10 页,Figure 6。点击图片可查看原图。

逐步替换低频次要等位为主要等位,再观察预测下降,将输入中的遗传信息作有针对性的计算剥离。常见变异贡献最大,罕见变异少量补充,频率来自训练供体以避免偷看测试频率。删除某类等位同时改变真实单倍型,结果是模型依赖性实验,不等同于逐个罕见变异因果效应。对临床新发变异能力,仍需单独外部任务与足够可靠标签。

子图 讲的是什么,以及如何理解
全图(无字母) 逐步把低于MAF阈值的次要等位替为主要等位后,个体预测相关下降;常见变异贡献最大,稀有变异有少量额外贡献。

Figure 7:训练个体数量的缩放

Figure 7

原图来源:所用 PDF 文件第 11 页,Figure 7。点击图片可查看原图。

配对模型与BLUP的训练人数缩放相近,已见基因随人数增长改善、未见基因不稳定改善。扩大供体能改善已见统计关系,却未自动跨越序列任务泛化瓶颈。误差来自重新抽样和模型重复,不是每个基因独立的个人置信区间。BLUP没有未见基因预测分支,图中空缺不应写成其在这项任务获得零分。

子图 讲的是什么,以及如何理解
左:配对微调 已见基因随训练人数增加而提高,未见基因表现不随人数稳定改善,显示泛化瓶颈。
右:BLUP 线性模型对已见基因的缩放与微调类似;该方法没有可应用于未见基因的对应预测。

对有限显存与AD课题的启发

本文主要实验用了八张A5000或TITAN RTX,不能直接承诺5060 16 GB可复现同等吞吐。但冻结主干的消融为小资源方案提供根据:预计算固定模型表示,训练较小输出头,再与全微调或线性剂量模型做明确比较。资源节省本身不是创新,目标是在独立脑数据和TE候选中得到更可信的方向或泛化。

我会先将任务限定为某一脑细胞类型、已见调控模块的新供体预测,再把未见TE家族或未见基因作为独立挑战。若疾病标签仅用于后验联系,应锁定模型后再分析,不能借病理调参又宣称无监督发现。所有个人两单倍型、配对样本与同一供体应整体划分,近邻TE副本还要考虑同源泄漏。

最深的启发是:微调可以修正预测,却不一定带来可迁移机制。只有当模型在此前没有见过的位点、变异或队列里仍能正确解释方向,才有理由说它学到了新的调控规律。这个开放缺口比简单模仿论文加一层网络更适合作为研究问题。

实际实施时还应保存每次供体划分和随机种子,用统一测试集比较所有消融,防止不同划分使架构改进与抽样运气混在一起。

继续阅读与公开资源