23.P-NET:原图、模型逻辑与研究范式

23.P-NET:原图、模型逻辑与研究范式
Perry论文题名: Biologically informed deep neural network for prostate cancer discovery
期刊与年份: Nature,2021。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
阅读来源说明: Nature,2021;以当前 PDF 为准。
研究瓶颈怎样转化为问题
患者分子特征很多、样本有限,黑箱模型容易过拟合且难以产生可实验化发现。P-NET 从生物通路规定稀疏连接,把预测与解释放进同一个架构。依据设计逻辑推断,idea 是用已知层级限制假设空间,再让数据指出哪些已有通路和候选基因值得进一步验证;并非通过命名隐藏节点就自动拥有机制因果。
输入、目标与结构
实际主体输入为突变和拷贝数,经过基因、3,007 个整理通路及更高层生物过程预测前列腺癌状态。稀疏先验减少参数,适合较小患者集;贡献通过 DeepLIFT 回溯,节点总重要性是样本贡献绝对值的汇总,正负激活与重要程度不能混为一谈。训练目标是癌症状态,生化复发与功能实验用于额外支持。其他组学在示意中出现,不代表所有性能结果均使用它们。
Figure 1:P-NET 生物学架构
原图来源:所用 PDF 文件第 2 页,Figure 1。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| 全图(无字母标签) | 输入患者突变与拷贝数改变,依次连接基因、通路、生物过程和疾病结果;实线为预测方向、虚线为贡献回溯。生物学连接使每层节点可解释,并可将重要基因转为实验假设。 |
全图显示预测流与贡献回溯不同方向,重要性使候选可追溯到基因和通路。但通路边来自先验知识,缺失或过度注释会影响解释;模型学到沿此结构的关联并不证明这些是样本真实信号传递路径。参数少的先验模型适合此处数据规模,也可能限制新机制。应把相同参数量的无先验网络、随机连接和传统方法作为参照,避免把通路名字本身当作生物学发现。
Figure 2:分类性能与预后关联
原图来源:所用 PDF 文件第 2 页,Figure 2。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 在 204 个留出患者比较 PR 曲线,P-NET AUPRC 0.88 高于列出的传统模型。 |
| b | 在两个独立外部队列比较局限与转移病例分类,真阴性约 73%、真阳性 80%,检验泛化。 |
| c | 样本逐步减少时比较 P-NET 与参数相同的全连接网络 AUC,体现生物先验在较小样本下的优势。 |
| d | 原发患者按 P-NET 分数高低比较无生化复发生存,高分组更易复发,提示模型分数具有风险分层关联。 |
a 的 AUPRC 与类别比例有关,b 的外部分类检验平台/队列变化,c 的同参数网络比较定位生物先验收益。d 的分数与无生化复发生存关联说明风险分层潜力,但模型原目标不是前瞻性复发预测。高分可能共同反映已知病理和治疗背景,需多变量、外部及校准分析后才适合临床用途。204 例内部留出也不等于 204 次独立研究验证。
Figure 3:解释模型的重要基因及通路
原图来源:所用 PDF 文件第 3 页,Figure 3。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| 全图(无字母标签) | Sankey 图从变异类型到基因、通路和输出展示相对重要性,深色节点更重要;AR 的贡献主要来自扩增、TP53 来自突变、PTEN 来自缺失。图解释模型利用什么生物信号,重要性不等同于已证明的因果机制。 |
Sankey 将 AR 扩增、TP53 突变和 PTEN 缺失等贡献连到通路,能检查模型是否利用已知合理特征。带颜色的重要性与流宽是计算量,不能解释为实际分子流量。作者考虑节点过度注释偏倚,仍应关注不同特征相关性;一个基因低贡献可能因另一共现标志物已代表它,而不是没有生物作用。图真正作用是选择待验证候选,而非证明每层网络。
重要性本身也依赖参考输入和汇总方式。绝对值汇总便于定位总体重要节点,但会把在不同样本上促进或抑制预测的效应合在一起;要讨论方向需回到样本级有符号贡献和对应变异。一个大型通路因包含更多基因容易获得贡献,注释度校正有必要,仍不能完全消除先验数据库选择。网络重复训练后的排名稳定性,比一次图上的前几名更适合作为实验优先级。
Figure 4:MDM4 的临床与功能证据
原图来源:所用 PDF 文件第 4 页,Figure 4。点击图片可查看原图。
| 子图 | 讲什么,以及怎样理解 |
|---|---|
| a | 1,013 个前列腺癌样本的 AR、TP53、MDM4 改变交集图,检查候选基因与已知驱动改变的共现模式。 |
| b | LNCaP 的全基因 ORF 过表达筛选以恩扎卢胺耐药程度作 Z 分数,MDM4 是突出耐药命中。 |
| c | 在四种前列腺癌细胞系用两个 sgRNA 删除 MDM4,与 GFP 对照比较相对细胞数量。MDM4 删除显著降低增殖/存活,支持这些模型对该基因的功能依赖。 |
| d | 比较不同细胞系对 RO-5963 的剂量—存活曲线,TP53 野生型比突变型更敏感,支持按 p53 背景选择候选治疗的思路。RO-5963 同时抑制 MDM4 和 MDM2,药理结果应结合 c 的基因删除证据理解。 |
MDM4 从模型候选走向临床改变、过表达耐药、两 sgRNA 删除与药理剂量曲线,是解释能否产生发现的关键。共现本身不是功能,ORF 与 CRISPR 提供方向不同的干预证据;RO-5963 同时抑制 MDM2/MDM4,不能把药效全归 MDM4。TP53 背景差异给出机制限制,但细胞系增殖/药敏不等于患者疗效。阴性或背景不响应同样应纳入可迁移条件。
我的理解与可迁移设计
我会借鉴‘可解释架构→具体候选→独立干预’,而不是以可解释性代替实验。对 AD 非编码位点,可用明确 enhancer–gene–pathway 先验构建小网络,但必须先有位点到基因的证据;把最近基因连接到通路可能形成很漂亮却错误的故事。16 GB 环境能处理这种稀疏小模型,真正难点是标签、先验可靠性和外部验证。可比较随机图、无图及可信联系图,证明生物结构增加何种预测,并把所有节点贡献保留为模型解释而非已证实因果。
疾病相关模型还应固定临床目标:当前状态分类、未来复发和药物耐药具有不同数据时间点和分母。不能因为同一模型分数与三者都相关,就把它们合成一种准确率。用于纯计算论文,独立数据中的明确增益与有边界的机制候选,比将所有高分通路宣称为新靶点更可信。
若疾病样本中基因拷贝数与治疗状态相关,模型可能读出取样时已经发生的变化,而不是未来耐药原因。临床预测必须确保输入在预测时间可获得,不能使用结局后分子状态;外部队列的结局、平台和取样组织也需一致。纯计算 AD 工作更适合先证明一个功能评分在独立标签中有效,再将通路解释限定为待检验假说。 评价时还应报告精确率对应的病例比例、阈值和置信范围;不应把内部留出阈值未经校准直接应用于患病率不同的外部群体。






