30.DeepTCR:原图、模型逻辑与研究范式

30.DeepTCR:原图、模型逻辑与研究范式
Perry论文题名: DeepTCR is a deep learning framework for revealing sequence concepts within T-cell repertoires
期刊与年份: Nature Communications,2021。论文原文。
范围为正文全部编号主图及其子图,包含流程示意图。Extended Data 和 Supplementary Figures 不在本次范围。页码指阅读时所用 PDF 的文件页码。
阅读来源说明: Nature Communications,2021;以当前 PDF 为准。
研究瓶颈怎样转化为问题
抗原相关 TCR 淹没在大量无关序列中,简单距离或已知基序难以识别复杂组合。DeepTCR 将 CDR3 序列和 V/D/J 使用共同建模,并把单受体学习扩展到整个受体库弱标签。依据设计逻辑推断,idea 是让局部卷积学习抗原相关模式,再以多实例注意力从噪声群体汇总少量信号,而不是认为所有扩增受体都具有相同特异性。
输入、目标与结构
CNN 编码 α/β CDR3,基因使用嵌入补充重排背景;VAE 重建形成无监督表示,监督头分类抗原或回归 pMHC 多聚体计数。MIL 汇总受体的潜概念比例用于库分类。计数是结合信号代理,受受体表达和技术影响,不是平衡亲和力;受体库刺激标签也不是每条序列的已知抗原标签。本文对不同数据层分别验证,序列替换/Logo仍是模型解释。
Figure 1:无监督 TCR 表示的质量
原图来源:所用 PDF 文件第 3 页,Figure 1。点击图片可查看原图。
| 子图 | 讲解 |
|---|---|
| a | 变分自编码器 VAE 联合编码 α/β 链 CDR3 序列与 V/D/J 使用,再重建输入;得到可用于距离、聚类和分类的连续受体表示。 |
| b | 九种小鼠抗原数据上,对不同表示方法生成的聚类比较方差比和调整互信息;后者核对聚类是否与真实抗原标签一致。 |
| c | 在同一小鼠数据上用 K 近邻识别抗原,比较 AUC、召回率、精确率和 F1;评估表示是否方便区分抗原特异 TCR。 |
| d | 七种人抗原数据的聚类指标,重复 b 的评估以检验跨物种/数据来源的表示效果。 |
| e | 人抗原数据的 K 近邻分类指标;与 c 对照,检查序列加基因使用等表示在另一任务上的泛化。 |
重建表示和 KNN分类检验无监督特征是否保留抗原信息,小鼠/人资料重复检查范围。聚类方差比没有抗原标签,而调整互信息有真实类别,二者不能互换。α/β配对与V/D/J使用可带来额外信息,公平比较需说明哪些基线也拿到这些输入。跨物种数据上好用不表示同一抗原空间可无条件混合。
Figure 2:监督学习与可解释的序列模式
原图来源:所用 PDF 文件第 5 页,Figure 2。点击图片可查看原图。
| 子图 | 讲解 |
|---|---|
| a | 用相同特征编码模块接分类或连续值输出层,将 TCR 表示用于抗原标签预测或回归。 |
| b | 在九种小鼠抗原 TCR 中做 100 次 Monte Carlo 训练/测试划分,比较监督分类与无监督 VAE 距离分类的 AUC;监督学习通常进一步提高抗原识别。 |
| c | 展示代表性 Db、Kb 抗原的高分 CDR3 序列比对与卷积核模式;模型提取了抗原相关序列特征,而不只是返回标签。 |
监督分类比无监督距离改善是任务标签贡献,100次随机划分检查内部稳定性。高分序列对齐和卷积模式可定位候选识别规则,但同克隆或高度相似序列跨测试会使任务更容易;要评新患者/新抗原需更强留出。Db/Kb抗原基序的解释也依赖相应MHC背景,不能把一个模式普遍用于所有人群。
Figure 3:回归结合信号与定位敏感残基
原图来源:所用 PDF 文件第 6 页,Figure 3。点击图片可查看原图。
| 子图 | 讲解 |
|---|---|
| a | 用 10x 单细胞 α/β 配对 TCR 对 pMHC 多聚体的计数作结合信号代理,比较三种抗原的预测与实测计数。它不是直接测得的平衡结合常数。 |
| b | 在独立 McPAS-TCR 数据中用该回归模型识别抗原特异序列,并画 ROC/AUC;检查计数训练出的模型能否迁移到外部序列。 |
| c | 对已有晶体结构的 Flu-MP 与 BMLF1 TCR 逐残基替换,观察预测信号敏感性,分别分析 α 链和 β 链。 |
| d | 将逐残基替换影响压缩成 Residue Sensitivity Logo,展示哪些位置及氨基酸对模型预测最重要。 |
| e | 晶体结构上标出 α/β 链 CDR3 区域,与 c/d 对照解释这些模型敏感位置的结构背景。 |
计数回归、外部抗原ROC与晶体结构对应提供不同证据。敏感性替换是预测反事实,logo高度表示模型响应,不等于该氨基酸真实结合能贡献。结构接触能支持解释,但静态结构未覆盖表达和动态;只有实际突变测量才能验证逐残基因果。分类AUC好也不能推断对亲和力幅度已准确校准。
Figure 4:从单条 TCR 扩展到整个受体库
原图来源:所用 PDF 文件第 7 页,Figure 4。点击图片可查看原图。
| 子图 | 讲解 |
|---|---|
| a | 多实例学习 MIL 以注意力把受体序列分配到多个潜在概念,再汇总其在样本中的比例,用于整库分类。 |
| b | 抗原刺激培养与非对应抗原/空白对照的三重复设计;每次留出一个培养孔测试,保证后续解释使用未参与对应训练的数据。 |
| c | ROC 检查模型能否区分对应抗原与对照条件;高区分能力支持该培养条件引起了抗原相关受体库改变。 |
| d | 计算对应抗原与对照培养孔平均预测差异,表示反应幅度;它补充 c 的区分能力,不是同一个指标。 |
| e | 对抗原培养孔内每条 TCR 给出预测,从背景中提取候选特异序列,并以敏感性 Logo 展示其序列特点。 |
培养孔留出让模型按未见实验评价,MIL把整库标签转成候选序列,是其重要扩展。但三个培养重复不等于三个独立供体,刺激后的频率可能受增殖或存活影响。预测差异和AUC分别反映幅度和区分,不可互换。高注意力序列仍需直接抗原实验,不能只因为库分类正确便确认每条候选。
Figure 5:HIV 表位变体对应不同 TCR 免疫反应
原图来源:所用 PDF 文件第 9 页,Figure 5。点击图片可查看原图。
| 子图 | 讲解 |
|---|---|
| a | 汇总受筛 HIV 表位的受体库分析;红色为共识表位、粗体为满足作者 AUC>0.90 判定标准的抗原特异扩增候选。 |
| b | 将预测差异幅度与 AUC 对照,区分强区分能力和反应大小,显示不同表位的反应谱。 |
| c | ES8 的 GAG TW10 表位变体两两比较热图,用 1−预测差异表示受体库相似性;观察哪些变体引发相近或不同的反应。 |
| d | 对高置信抗原相关序列训练多类模型,再按逐序列预测作 UMAP,密度着色;显示不同 TW10 变体所对应 TCR 群体的相似与分化。 |
| e | 共识表位与三突变表位的残基敏感性 Logo,展示相关受体序列的关键位置差异,为变体反应差异提供序列解释。 |
阅读提醒
- 序列替换和注意力/Logo 是模型解释;结合计数、受体库分类和真实亲和力测量属于不同证据层次。
HIV变体比较显示表位变化可对应不同TCR库响应,共识与突变序列的logo形成解释假说。作者AUC>0.90用于筛选候选扩增,不意味着疾病保护或临床控制。UMAP来自模型预测且选择高置信序列,不能当独立验证;两个表位库相似也不等于每条TCR交叉识别。需要配对序列与真实抗原测量才能进一步确认。
我的理解与可迁移设计
我想迁移的是当标签属于集合时,承认单条序列的标签未知,并用适当弱监督而非强行赋值。AD脑细胞或TE候选也常有集合标签;一批AD相关位点不能自动让每个位点成为致病阳性。若有真实MPRA,可以把它作为逐构建功能终点,病例关联作为另一层。16GB适合小CNN/MIL,但切分必须按供体、克隆或位点,以免相似序列泄漏。模型敏感性图是实验设计工具,只有正交测量才将候选模式推进为机制。
还应明确病理或免疫关联的距离:TCR信息来自体细胞重排与抗原选择,不能直接当遗传非编码DNA演化标签。若要联系AD免疫,只能先确认独立队列和可测终点,再建立具体假说,避免把不同序列层次仅因都称‘序列模型’就混在一起。




