1. 领域背景与文献
文献英文标题:Interpretable distillation reveals that deep learning splicing models suffer from pervasive confounders and blind spots
发表期刊:文献未明确提供发表期刊信息;影响因子:未公开;研究领域:计算生物学、RNA剪接调控
深度学习已成为解析基因组序列编码的基因调控信息的核心手段,其在RNA剪接预测领域的应用取得了突破性进展,多款深度学习剪接模型(如SpliceAI、Pangolin)已达到行业领先的预测性能,并开始应用于临床遗传变异解读场景。然而,这类模型的“黑箱”特性导致其预测机制始终不明确,无法区分模型学习到的是真实的RNA剪接调控逻辑,还是基因组中存在的虚假关联模式,这一问题严重制约了模型在临床应用中的可靠性,成为领域内未解决的核心问题。当前研究的空白在于缺乏能够全局解析深度学习剪接模型预测逻辑的方法,无法系统评估模型的失效场景与偏差来源。针对这一问题,本研究构建了可解释蒸馏框架,通过训练可解释的“蒸馏”模型复制原深度学习模型的预测,进而解析其内在逻辑,为评估模型可靠性、改进模型性能提供了关键方法,具有重要的学术与临床应用价值。
2. 文献综述解析
作者对领域内现有研究的分类维度主要包括模型架构类型(任务特定型CNN模型、多任务基础Transformer模型)、模型应用场景(参考序列预测、临床变异解读)以及模型局限性(可解释性不足、混杂因素干扰、结构信息缺失)。现有研究的关键结论显示,深度学习剪接模型在基于参考基因组序列的预测任务中表现优异,能够较为准确地估计外显子包含水平(PSI),部分模型已被用于临床变异的剪接效应评估;技术方法优势在于,卷积神经网络(CNN)、Transformer等架构能够有效提取基因组序列的局部与全局特征,大幅提升剪接预测的精度;但现有研究也存在明显局限性,即模型的可解释性不足,仅能通过单核苷酸贡献得分等方法解释单个预测,无法全局解析模型的预测规则,且未系统评估模型在非参考序列上的性能偏差,临床应用中存在误判风险。
通过对比现有研究的未解决问题,本研究的创新价值凸显:首次采用可解释蒸馏框架实现了对深度学习剪接模型预测逻辑的全局解析,突破了传统局部解释方法的局限;系统识别出模型依赖的虚假混杂因素(CpG二核苷酸、终止密码子)与RNA结构盲区,明确了模型在非参考序列上性能下降的核心原因;为基因组深度学习模型的可靠性评估与改进提供了范式,其发现不仅适用于RNA剪接预测,也为其他基因调控预测任务的模型优化提供了参考。
3. 研究思路总结与详细解析
本研究的整体框架为:以解析深度学习剪接模型的预测逻辑、评估其可靠性为研究目标,核心科学问题聚焦于“深度学习剪接模型是否学习到真实的RNA剪接调控逻辑,还是依赖基因组中的虚假混杂因素”;技术路线遵循“构建可解释蒸馏模型→复制原模型预测→解析模型特征→验证混杂因素与盲区→提出改进方向”的闭环逻辑,通过合成序列训练蒸馏模型,结合实验数据集与基因组数据验证模型偏差,最终揭示模型的核心局限性。
3.1 深度学习剪接模型性能验证
实验目的是验证三款主流深度学习剪接模型(SpliceAI、Pangolin、AlphaGenome)对exon inclusion的预测准确性,确认其作为后续解析对象的合理性。方法细节为:选取三个覆盖不同序列背景的实验数据集(Liao等的合成外显子文库、FAS exon6突变文库、MFASS内源外显子文库),将模型预测结果与实验测量的外显子包含水平(PSI)进行对比,采用等渗回归对模型预测进行校准以消除尺度差异。结果解读显示,三款模型在三个数据集上均表现出较好的预测相关性,其中Liao等数据集的Pearson相关系数为0.83-0.86(文献未明确样本量,基于图表趋势推测),FAS exon6数据集为0.81-0.88(文献未明确样本量,基于图表趋势推测),MFASS数据集为0.37-0.44(文献未明确样本量,基于图表趋势推测),MFASS数据集相关性较低的原因是其采用荧光测量而非直接RNA-seq定量。这一结果表明,三款模型的预测可作为外显子包含水平的可靠估计。文献未提及具体实验产品,领域常规使用Python机器学习库(如PyTorch、scikit-learn)、基因组序列比对工具(如STAR)等。
3.2 可解释蒸馏模型构建与验证
实验目的是构建可解释的蒸馏模型,复制原深度学习剪接模型的预测逻辑,从而实现对原模型的全局解析。方法细节为:生成约100万条三外显子合成序列,其中中间外显子包含70nt可变区域,使用三款原模型对这些序列进行预测,得到exon score作为训练标签;训练蒸馏模型,其架构包含卷积层(提取局部序列基序)、神经基础层(分配位置特异性贡献)、求和层(聚合特征贡献),通过L1正则化促进特征稀疏性。结果解读显示,蒸馏模型与原模型的预测高度一致,Pearson相关系数达0.94-0.99(文献未明确样本量,基于图表趋势推测),其中SpliceAI的蒸馏模型98.4%的预测值落在原模型预测值的±15%范围内(图1)。这一结果表明,蒸馏模型可准确复制原模型的预测,且原模型主要通过简单的序列基序加性组合识别外显子,未依赖RNA结构或特征交互。文献未提及具体实验产品,领域常规使用深度学习框架(如PyTorch)、序列基序可视化工具(如logomaker)等。

3.3 CpG混杂因素的识别与验证
实验目的是验证CpG二核苷酸是否为深度学习剪接模型学习到的虚假混杂因素,而非真实的剪接调控信号。方法细节为:分析模型预测误差与序列CpG组成的关联,采用协方差分析(ANCOVA)控制PSI的影响;同时检查基因组中内含子CpG岛附近的模型假阳性预测,评估CpG偏差对基因组预测的影响。结果解读显示,CpG组成与三款模型的预测误差均显著相关(所有模型p<5×10^-3,文献未明确样本量,基于图表趋势推测),高CpG含量的序列预测值显著偏高,低CpG含量的序列预测值显著偏低(图2A);SpliceAI的假阳性剪接位点预测在内含子CpG岛附近富集,排除这些假阳性后,含CpG岛基因的剪接供体top-k准确率从93.8%提升至94.5%(误差降低11.3%)(图2B、C)。进一步分析显示,蛋白编码外显子的CpG含量高于内含子,模型将这一基因组关联作为外显子的虚假标记,导致非参考序列(如lncRNA外显子)的预测性能下降。文献未提及具体实验产品,领域常规使用基因组注释数据库(如UCSC Genome Browser)、统计分析工具(如R、Python)等。

3.4 终止密码子混杂因素的识别与验证
实验目的是验证终止密码子是否为深度学习剪接模型学习到的另一虚假混杂因素。方法细节为:分析模型预测误差与序列中终止密码子数量的关联,采用ANCOVA控制PSI的影响;检查基因组中含终止密码子的内部外显子的预测偏差,以及临床变异的误判案例。结果解读显示,终止密码子数量与三款模型的预测误差显著相关(所有模型p<1×10^-20,文献未明确样本量,基于图表趋势推测),无终止密码子的序列预测值偏高,含5个及以上终止密码子的序列预测值偏低(图3A);基因组中含终止密码子的内部外显子的剪接位点预测得分显著低于不含终止密码子的外显子(图3B);CFTR G542X变异(无剪接效应)被模型错误预测为剪接破坏(图3C),表明终止密码子偏差可能影响临床无义变异的解读。这一偏差的原因是蛋白编码外显子通常不含终止密码子,模型将这一模式作为外显子的虚假标记,而非基于剪接调控逻辑。文献未提及具体实验产品,领域常规使用变异数据库(如ClinVar)、统计分析工具等。

3.5 RNA结构盲区的识别与验证
实验目的是验证深度学习剪接模型是否存在RNA结构识别盲区,无法捕捉RNA结构对剪接的调控作用。方法细节为:分析模型预测误差与RNA结构稳定性(最小自由能MFE)的关联,采用ANCOVA控制PSI的影响;测试结构扰动突变的模型预测与实验结果的一致性,以及临床结构变异的预测案例。结果解读显示,模型对RNA结构更稳定的序列预测值显著偏高(所有模型p<1×10^-20,文献未明确样本量,基于图表趋势推测)(图4A);MAPT exon10变异的结构变化未被模型正确预测(图4B);BLTP1 c.13476C>T变异通过增强RNA茎环结构导致外显子跳跃,但三款模型均未预测到剪接效应(图4C)。进一步测试显示,模型对仅改变RNA结构的突变的剪接变化预测完全错误,表明模型对RNA结构变化不敏感。这一盲区的原因是基因组序列的结构多样性有限,且当前模型未整合RNA结构预测的专门架构或热力学知识。文献未提及具体实验产品,领域常规使用RNA结构预测工具(如ViennaRNA、VARNA)等。

4. Biomarker研究及发现成果
本研究中未涉及传统意义上的疾病诊断或预后生物标志物(Biomarker),但识别出深度学习剪接模型依赖的虚假预测特征(可视为模型层面的“偏差标志物”),包括CpG二核苷酸、终止密码子,以及模型的RNA结构盲区。这些特征的筛选与验证逻辑为:通过可解释蒸馏模型识别对模型预测影响最大的序列特征,然后结合实验数据集验证这些特征与模型预测误差的关联,再通过基因组数据与临床变异案例确认其对模型可靠性的影响。
研究过程详述:CpG特征的来源为合成序列与基因组外显子的CpG组成,验证方法包括协方差分析(ANCOVA)、假阳性预测富集分析,结果显示CpG组成与模型预测误差显著相关(p<5×10^-3),高CpG序列预测值偏高;终止密码子特征的来源为合成序列与基因组外显子的终止密码子数量,验证方法包括ANCOVA、临床变异案例分析,结果显示终止密码子数量与预测误差显著相关(p<1×10^-20),无终止密码子序列预测值偏高;RNA结构盲区的验证通过RNA结构稳定性与预测误差的关联分析、结构扰动突变的预测测试,结果显示模型对结构稳定的序列预测值偏高,且无法正确预测结构驱动的剪接变化。
核心成果提炼:本研究首次系统识别出深度学习剪接模型的两类虚假混杂因素(CpG、终止密码子)与RNA结构盲区,这些因素导致模型在非参考序列(如lncRNA、含终止密码子的外显子、结构变异)上的预测出现系统偏差,临床应用中可能导致变异解读误判;研究明确了模型预测逻辑的核心是简单的序列基序加性组合,而非真实的剪接调控逻辑;提出的可解释蒸馏框架为基因组深度学习模型的全局解析提供了通用方法,为模型改进(如整合实验数据、加入结构信息)指明了方向。所有统计结果均标注了显著性水平(P值),样本量信息文献未明确提供的部分已按要求标注说明。