57.Sei:原图、模型逻辑与研究范式

57.Sei:原图、模型逻辑与研究范式
Perry论文题名: A sequence-based global map of regulatory activity for deciphering human genetics
期刊与年份: Nature Genetics,2022。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
研究问题: Sei 能否把全基因组 DNA 序列映射到可解释的调控功能类别,进而理解变异、表达和疾病遗传力?
研究难点与构思
序列模型能预测某个TF或组蛋白标记,但疾病研究需要知道多个变化合起来代表哪一种调控功能。二万多个输出虽全面,却难以直接用于遗传解释。我的推测是,Sei的构思是先用多任务监督模型把序列投射到统一染色质空间,再从全基因组预测中提取功能词汇,使复杂输出变成可比较的组织增强子、启动子或边界程序。这个词汇层连接模型与遗传数据,是主要研究贡献。
这个摘要层也使变异的方向更容易讨论。单个染色质输出改变可能难对应整体功能,类别分数则把多个相关标记一起解释。但相同类别内的一些标记可能变化相反,投影会掩盖这种不一致。因此候选变异的机制分析应同时回看底层输出,尤其在类别分数较弱或与独立组织证据矛盾时,不应只保留一个方便的总分。
遗传力归属也有自己的信息边界。相邻SNP通过LD相关,统计富集需要合适的背景模型;序列类占基因组比例与占遗传力比例不同,才有相对富集的含义。一个类别含很多SNP时,即使遗传力份额大也不必然特别富集。论文将份额和显著性分别编码,使读者能区分信号规模与统计支持。用于AD时还需要对应GWAS及祖源资料,不能把英国生物样本库某类脑性状的结论直接改写成AD结论。
输入输出与学习范式
输入4 kb DNA,输出中心位置21907个染色质特征的概率,训练目标来自TF结合、组蛋白和可达性峰。残差网络的线性及非线性路径帮助联合预测不同层级的序列信息。之后给均匀铺满基因组的三千万窗口评分,降维并在邻居图上用Louvain社区发现40类。前一阶段是监督多标签预测,后一阶段是无监督组织预测空间,不能把整个框架称为没有实验监督的DNA聚类。
类别分数是把预测投影到类别中心方向,不只是一个硬标签。比较参考与替代等位基因分数,就能描述某个程序增强或削弱。这里的分数不是疾病概率,也不是目标基因表达量;它首先表示模型所学染色质特征组合。模型只能直接覆盖训练中存在的组织和实验体系,缺少的脑细胞状态不会因为类别命名就自动出现。
作为摘要,类别便于解释;作为机制,仍要核对实际标记和组织条件。命名给出的是功能假设,不能替代验证。
证据链与统计层级
训练来源的标记富集能帮助命名类别,但不足以独立证明词汇的生物用途。论文继续用组织表达、带方向eQTL、群体变异频率与性状遗传力作检验。组织表达检验序列类是否对应预期功能,eQTL检验变异方向,负选择检验强效变化是否受约束,GWAS则检验复杂性状信号的组织归属。这四个问题不能互相替代,更不能从群体富集越级证明一个变异致病。
整合词汇还带来限制:相近程序被归到一类后,细胞状态内部的差异可能丢失。40类是该模型、资料和聚类下有用的摘要,不是固定不变的生物本体。低信号也不代表DNA没有任何功能,而是对所测目标缺少强信号。对重复元件,这一点特别重要:TE富集可能描述某类序列构成,并不自动意味着这些TE在某组织承担已证实的增强作用。
Figure 1|全基因组调控类别图谱(实图 PDF 第 3 页;图注第 2 页)
原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。
a给出监督预测后无监督提取词汇的流程,b展示全局空间,c用等位基因分数差建立变异解释接口。UMAP距离与分支是可视化,不应读成演化路径或细胞进展。把原始序列换成可量化功能空间使新序列也能被评分,这是纯实验注释地图无法直接做到的。需要注意文件实图位于PDF3,而完整图注位于PDF2;两页对应同一主图,不能把图注页作为结果图资产。
| 子图 | 讲解 |
|---|---|
| a | 在 21,907 个染色质特征上训练 CNN,给铺满基因组的三千万条序列评分,再以降维和社区检测提取序列功能类别。 |
| b | UMAP 显示组织特异增强子、启动子、CTCF/cohesin、TF 特异及异染色质等类别,提供可解释的全局地图。 |
| c | 比较参考和变异序列的类别分数,定义增加/降低特定调控程序的变异效应。 |
Figure 2|类别的功能注释和表达方向
原图来源:所用 PDF 文件第 4 页,Figure 2。点击图片可查看原图。
a按已知标记和重复注释说明类别,b用TSS周边类别比例与对应组织表达检验功能,c将变异分数方向与GTEx表达效应关联。a的富集用于解释训练空间,b、c提供不同层级的外部支持。c限定了靠近TSS且预测效应较强的变异,因此不能把相关推广为任意远端位点都准确。预测调控增强与表达增加相符,是证据链的一环,不保证最近基因必然就是作用靶点。
| 子图 | 讲解 |
|---|---|
| a | 各序列类对组蛋白、TF、重复序列的富集热图验证类别与已知调控标记对应。 |
| b | TSS 周围增强子类别比例与对应组织特异表达的相关性,检验分类是否反映组织功能。 |
| c | 预测类别变异效应与带方向 GTEx eQTL 效应的相关/显著性,说明模型可提示表达增加或减少,而不只是有无作用。 |
Figure 3|调控强效变异的群体选择信号(实图 PDF 第 6 页;图注第 5 页)
原图来源:所用 PDF 文件第 6 页,Figure 3。点击图片可查看原图。
a比较各类常见变异比例及双方向效应约束,b按正负效应强弱分箱,问大幅提高或降低某程序是否都较少见。需要注意源文件的小差异:图注将a的横轴描述为1−常见变异频率,实际图轴标为常见变异频率且从左到右递减;二者都使右侧对应较少常见变异,读取具体数值应按实图刻度。两侧强效变化均受约束,支持调控平衡而非仅“失活有害”。这是群体统计的负选择线索,不是某个碱基的功能测量;变异频率还受人口史、突变率和连锁背景影响。图提供类别尺度的生物可信度,不能由一个稀有高分变异直接认定其是AD病因。
| 子图 | 讲解 |
|---|---|
| a | 各序列类常见变异比例与双方向效应约束 z 分数;实图横轴递减,图注写 1−常见变异频率,详见本图分析。 |
| b | 按类别和正/负效应强弱分箱比较常见变异频率;最强增加或降低效应的变异常见率更低,显示功能双方向都可能受约束。 |
Figure 4|序列类别与性状遗传力
原图来源:所用 PDF 文件第 7 页,Figure 4。点击图片可查看原图。
这张无字母矩阵用行表示UK Biobank性状、列表示类别,点大小表示保守估计的遗传力份额,颜色表示相对SNP份额的富集显著性。它问疾病和性状的多基因信号是否落在合理组织程序中,比挑一个显著位点更全局。血液、脑等块支持词汇的解释价值,但遗传力分层依赖LD及统计模型,并不表示类别内每个SNP有效,也不能把组织富集直接叫成细胞因果来源。
| 子图 | 讲解 |
|---|---|
| 全图(气泡矩阵,无字母标签) | 行是 UK Biobank 性状、列是四十个序列类;点大小表示遗传力占比、颜色表示相对 SNP 比例的富集显著性。血液、脑、跨组织及启动子相关性状块把疾病/性状与相应调控组织连接,属于 GWAS 统计归因。 |
Figure 5|疾病非编码变异的功能分类
原图来源:所用 PDF 文件第 8 页,Figure 5。点击图片可查看原图。
极坐标把HGMD非编码致病变异按预测程序与正负效应排列,圆内外区别程序增加和减弱,点大小表示效应幅度。它把已知疾病案例变成可提出机制的图谱,也展示获得功能与丧失功能都可能与疾病有关。案例的已知致病注释与模型的调控解释应分开:前者来自既有数据库,后者是新增计算假设。若提出新病例机制,还需目标基因、细胞背景和实验响应等证据,不能只靠极坐标的位置。
| 子图 | 讲解 |
|---|---|
| 全图(极坐标,无字母标签) | 每点为 HGMD 非编码致病变异,扇区为预测影响的序列功能类;圆内为增强该类别、圆外为削弱,点大小表示效应。疾病基因注释显示变异可破坏启动子、CTCF 或组织特异增强子,也可通过功能增强产生异常。 |
阅读说明
- Figure 4 和 Figure 5 是整张无字母图,按原图编码方式解释。类别分数、选择约束与 GWAS 富集是不同层次证据,不应将其中任一直接当作单变异致病实验。
依据:对应主图、完整图注及正文 Results;实验结果只按本文给出的对象和条件解释。
我的判断与可迁移设计
我会借鉴Sei的两层结构来设计AD的TE问题:先预测或建模真实脑细胞可达性,再把TE重叠峰的表征组织成可解释模块,与非TE峰及常规topic模型比较。这样可以问TE是否承载病理相关的特定程序,而不只是重复序列多。脑公共数据的供者、区域和病理应作为独立验证来源,不能先按AD标签构造模块再宣布无监督发现。
还可用已有模型对候选风险等位基因评分,将其与脑细胞ATAC、eQTL及GWAS精细定位交叉。但应分别报告遗传证据、序列功能预测和细胞病理关联,哪一层缺失就保留缺口。16GB显存条件下,使用现成权重做受控推断比完整重训21907任务合理;研究创新应来自新的脑病理问题、严格匹配对照和外部复现,而不是把通用类别换成AD标签。







