86.inDelphi:原图、模型逻辑与研究范式

86.inDelphi:原图、模型逻辑与研究范式
Perry论文题名: Predictable and precise template-free CRISPR editing of pathogenic variants
期刊与年份: Nature,2018。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
本篇问题: 无模板Cas9修复结果能否准确预测,并用于精确纠正致病变异?
从“修复很随机”转向“预测分布是否偏向一个结果”
我的推测是,这篇的突破来自改变问题表述:Cas9后出现许多产物,并不意味着每种产物的概率不可预测;如果某段序列使一个修复结果占优势,就可以选择这段序列做精确编辑。作者因此没有要求神经网络把所有细胞变成同一结果,而是预测修复产物分布,并寻找天然序列所支持的高精确候选。疾病相关的微重复恰好为这种思路提供用途:删除额外重复的一份,可能恢复参考序列而不需要外加模板。
inDelphi是机制约束的混合模型。它列举微同源介导的候选删除,用微同源长度、GC与删除长度学习评分,再将竞争候选归一化;无微同源删除用另一神经模块按长度建模。单碱基插入则由k近邻模块结合切口碱基及删除倾向预测。神经网络并没有替代全部生物学流程,输出也不是任意长度、任意结构变异,而是主要切口附近+1至−60 bp产物。无微同源删除部分首先预测长度集合,不等于完全确定每一种位置的基因型。
监督来自整合sgRNA—靶序列文库的真实测序,删除模块联合学习删除长度与微同源基因型频率,插入与删除按竞争比例结合。局部序列决定相对偏好,细胞背景还影响总体插入/删除比例。研究范式是机制分解的监督预测加候选设计验证,与仅从motif推断修复结果的规则工具不同;也不是无监督模型。其问题意识值得借鉴:先定义可预测的局部任务,明确哪些复杂事件在任务范围外。
Figure 1:DNA修复数据支持inDelphi设计
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
a把设计靶序列与对应向导绑定,提供可系统变化的训练实验。b与c比较文库和真实内源位点的修复组成,检验人为短序列背景是否仍覆盖主要事件。它们相近支持文库用途,却不能保证所有内源长程染色质和细胞状态均被保留。d的微同源修复过程解释为何模型列举候选并计算相对竞争,而不是只给每个motif独立分数。e将这一机制落实成三模块及可核对的产物表。
这里最值得读透的是“模型覆盖率”和“预测精度”必须分开。主要插缺覆盖多数测到事件,仍留下长插入、复杂事件和更大重排;即便范围内预测很准,也不能据此声称一次编辑所有风险都可预测。文库长度与测序方法共同限定了可见事件,超出窗口的损伤不会因为模型没列出就不存在。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 整合向导—靶序列文库测量Cas9修复产物,定义大规模训练实验。 |
| b | 小鼠胚胎干细胞文库产物的微同源删除、无微同源删除和插入比例,描述修复组成。 |
| c | HEK293内源位点的对应组成,检验文库是否代表真实基因组。 |
| d | 微同源末端连接的切除、退火、去瓣和连接过程,解释删除的序列决定因素。 |
| e | 模型依据微同源、长度、GC和切口附近碱基预测每种+1到−60插缺频率,说明它预测分布而非单一结果。 |
Figure 2:单碱基插入的上下文规则
原图来源:所用 PDF 文件第 3 页,Figure 2。点击图片可查看原图。
a、b分别检验插入碱基是什么与插入发生多少,两者并非同一变量。经常复制PAM前−4位置的碱基提供局部模板线索,A或T背景还偏向较高插入频率。c以简单回归展示位置规律,目的是解释而非代替最终模型。d、e在几个固定低微同源背景中系统改变切口附近碱基,比全基因组统计关联更接近序列干预证据:其余背景保持,产物比例随局部变化而变。
但这种实验只覆盖特定短背景,不能把某个双碱基组合变成在任何染色质环境都成立的硬规则。低微同源条件也降低了删除竞争,所见插入高比例应连同背景一起解释。我认为这张图说明,合理的实验设计可以让小模型学到可验证的规律;数据变化的方式往往比网络深度更关键。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | 插入碱基身份对PAM前第−4位碱基的关系,说明插入常复制局部序列信息。 |
| b | 不同−4位碱基的单碱基插入频率,检验碱基环境影响。 |
| c | 预测插入频率的序列logo,定位重要上下文碱基。 |
| d | 低微同源背景中系统改变−5到−2位的插入频率,直接验证邻近序列作用。 |
| e | 变化−4/−3位后的频率比较,检查特定双碱基组合规律。 |
Figure 3:内源编辑结果预测与高精确位点选择
原图来源:所用 PDF 文件第 4 页,Figure 3。点击图片可查看原图。
a先量化内源事件是否落在模型输出空间,b再看基因型,c看长度,d看阅读框。这种由细到粗的评估避免只报一个总相关。预测长度准确不自动意味着恢复了完整参考序列;保持阅读框也不自动保证蛋白功能。d与已有微同源工具比较说明纳入插入与其他删除的重要性,e则验证模型选中的高插入位点优于背景,真正回答工具是否改善实验选择。
f的全基因组“precision-50”比例是基于模型与特定细胞背景的推算,并不是把全基因组所有位点逐个实验后的成功率。precision分母是主要编辑产物,没有纳入未编辑DNA和任务范围外事件。对疾病候选来说,它适合先筛选,再以实际位点测序确认;不能把这一分数直接称为治疗效率。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | HEK293、HCT116、K562中模型覆盖的修复产物比例,检验主要结果是否包含在任务内。 |
| b | 各位点具体基因型频率的预测相关,中位数约0.83–0.87,验证分布精度。 |
| c | 插缺长度频率相关,中位数约0.79–0.85,检验较粗粒度结果。 |
| d | 阅读框频率预测对实测,inDelphi较仅微同源方法更一致。 |
| e | 模型选择高单碱基插入位点在U2OS和HEK293T的实测频率超过对应基线,验证设计用途。 |
| f | 全人基因组向导最常见插入/删除的预测频率分布,估计可获得高单一产物精确度的位点数量。 |
Figure 4:无模板精确纠正致病变异
原图来源:所用 PDF 文件第 5 页,Figure 4。点击图片可查看原图。
a利用重复序列给修复提供可恢复参考的删除路径;b比较精确基因型恢复,c比较阅读框恢复,明确两种终点。d通过修复基因缺失或抑制相关通路改变结果分配,为不同末端修复路径竞争提供干预支持,但在实验细胞提高精确度不等于在患者中同样操作已经安全。e、f进一步检查LDLR相关报告细胞的GFP与LDL摄取,使证据从序列正确推进到功能恢复。
LDLR功能实验使用导入的全长构建,不能与所有疾病位点的文库纠正混为相同强度。论文还在HPS1与ATP7A患者来源成纤维细胞内源位点得到序列纠正,这比合成文库更接近实际疾病背景,但并未成为全身疾病治疗或长期临床效果证据。每一个层次都各有意义;把它们分开反而能看出作者怎样逐步提高验证难度。
| 子图 | 讲的是什么,以及如何理解 |
|---|---|
| a | LDLR重复变异通过Cas9末端修复回到野生型序列,示例实测为编辑产物中的65%。 |
| b | 致病等位序列预测/实测野生型基因型纠正频率,检验精确序列恢复。 |
| c | 野生型阅读框恢复频率预测/实测,区分恢复框架与恢复完整序列。 |
| d | 模型预测纠正≥50%的位点在不同修复基因背景的实测频率,检验高精确候选。 |
| e | LDLR重复报告细胞编辑前后的流式GFP与LDL摄取,检查修复是否恢复功能。 |
| f | 对应显微荧光图,验证功能恢复;频率主要以已编辑产物为分母,不能直接理解为全部细胞的纠正率。 |
我会学它的机制分解,不把局部可预测误当全局可控制
对AD的TE研究,可以借鉴“列举有生物学意义的候选状态,再学习竞争概率”。例如在同一家族TE副本中,先定义与调控相关的motif组合和细胞状态,再判断哪些背景影响其相对使用,而不是给所有重复片段一个泛化的异常分数。这需要明确可观察标签和独立验证;不能从TE序列有微同源就推断它导致AD。
更直接的用途在后续内源验证:如果要删去TE片段或修改附近候选变异,必须预先考虑真实修复产物分布。名义上的“删除一个元件”可能产生许多基因型,若只测向导丰度,不测实际产物,就容易把混合结果写成一个干净的因果干预。对大片段TE删除,这篇+1至−60 bp的模型范围尤其不足,需另行验证结构事件。
它也提供一个可在普通显存上工作的创新方向:用小网络结合机制特征建立一个狭窄而清楚的问题,并把新增数据用来挑战预测。真正有说服力的创新不一定是参数规模增长,而可以是把过去以为随机的现象变成可预注册、可复现的定量问题。原文实验未随机化或盲法,患者来源验证样本有限;这些局限不会抹去结果,但应保留在解释边界中,避免将方法研究写成普遍可用的治疗方案。
模型输出的是实验测得分布的近似,重复同一位点测序增加读深不会增加独立靶点数量。因此评估泛化时应留出靶点或序列背景,并把技术读段数、细胞数和独立实验次数分开报告。






