1. 领域背景与文献
文献英文标题:Campolina: a deep learning framework for direct segmentation of raw nanopore signals;发表期刊:Genome Biology;影响因子:17.906;研究领域:纳米孔测序与基因组生物信息学。
纳米孔测序作为基因组学领域的革命性技术,具备实时长读长测序能力,可直接分析核酸分子,无需PCR扩增,在宏基因组学、临床测序等场景应用广泛。随着技术发展,直接处理原始纳米孔信号的实时分析框架成为研究热点,这类框架可绕过碱基识别(basecalling)步骤,提升分析效率,实现自适应采样(如Read Until技术)以降低测序时间和成本。然而,原始信号分割作为实时分析的关键步骤,目前主要依赖传统算法如Oxford Nanopore Technologies开发的Scrappie,该方法基于滚动t检验检测信号变化实现事件分割,依赖预定义超参数,对纳米孔信号的噪声、事件长度异质性鲁棒性差,易出现过分割或漏分割错误,且针对新一代R10.4.1纳米孔的适配工具缺失。现有原始信号处理框架如RawHash2、Sigmoni均基于Scrappie分割,需额外后处理纠正分割错误,而Remora框架虽能提供高精度分割,但依赖碱基识别和基因组比对,无法满足实时分析需求。针对这些问题,本研究开发了Campolina,一款基于深度学习的原始纳米孔信号直接分割框架,无需碱基识别和比对,适配R9.4.1和R10.4.1纳米孔,为实时原始信号分析提供高精度分割方案。
2. 文献综述解析
本文综述部分围绕原始纳米孔信号分割与实时分析的现有研究展开,按技术类型分为传统算法分割、原始信号实时处理框架、高精度分割验证方法三类。
传统分割算法以Scrappie为代表,通过滚动t检验识别电流变化实现事件分割,方法简单易实现,但依赖固定超参数,对不同纳米孔版本(如R10.4.1)的信号特征适配性差,在噪声区域易出现过分割(事件被不必要拆分)或漏分割(未检测到信号变化),导致下游分析误差。原始信号实时处理框架如RawHash2、Sigmoni、UNCALLED,均旨在绕过碱基识别直接处理原始信号,提升分析效率,但均依赖Scrappie分割结果,需针对性后处理纠正分割错误,且多数框架仅适配已淘汰的R9.4.1纳米孔,缺乏对R10.4.1的支持。高精度分割验证方法以Remora框架为代表,通过Dorado碱基识别、minimap2比对和信号细化得到真实分割标签,可用于分割方法的评估,但该流程需碱基识别和比对,耗时较长,无法用于实时分析。
与现有研究相比,Campolina的核心创新在于首次实现了基于深度学习的原始纳米孔信号直接分割,无需碱基识别和基因组比对,摆脱了对预定义超参数的依赖,同时适配R9.4.1和R10.4.1两种纳米孔版本;此外,研究开发了一套全面的分割质量评估流程,不仅对比分割边界位置,还评估事件水平与真实标签及参考k-mer水平的一致性,解决了传统评估仅关注边界匹配的局限性;最后,Campolina可直接整合到现有原始信号处理框架中,无需调整后处理流程即可提升分析性能,为实时纳米孔测序分析提供了更鲁棒的分割方案。
3. 研究思路总结与详细解析
本研究的核心目标是开发一款高精度、实时适配的原始纳米孔信号分割框架,解决传统Scrappie算法的鲁棒性差、超参数依赖等问题。整体技术路线为:构建真实分割标签流程→设计深度学习模型架构与多损失函数训练策略→开发全面的分割质量评估方法→验证Campolina在现有原始信号处理框架中的适配性→评估时间效率与实时应用潜力。
3.1 真实分割标签(Ground Truth)Pipeline构建
实验目的:获取高精度的纳米孔信号事件边界标签,用于深度学习模型的训练与评估。
方法细节:采用两步流程,第一步使用Dorado碱基识别工具对原始信号进行碱基识别,同时生成move table作为初始分割近似,并通过minimap2将碱基序列与参考基因组比对;第二步利用Remora框架,以比对结果为锚点,结合k-mer模型(R9.4.1为6-mer,R10.4.1为9-mer)进行信号细化,得到最终的真实事件边界位置;针对R9.4.1的k-mer模型,研究对其进行z标准化以适配Remora的输入格式。
结果解读:该流程可生成与纳米孔信号特征高度匹配的真实分割标签,为模型训练提供可靠监督信息,确保两种纳米孔版本的标签一致性。
产品关联:实验所用关键工具:Oxford Nanopore Technologies的Dorado碱基识别工具、Remora信号细化工具、minimap2比对工具。
3.2 特征提取与模型架构设计
实验目的:构建适合纳米孔信号分割的深度学习模型,提取信号中的事件边界特征。
方法细节:首先将原始信号分割为长度6000的非重叠块,进行z标准化以消除批次效应;然后为每个信号块添加4种特征:滚动窗口(窗口大小3)的均值、标准差、一阶差分、Welch t检验统计量,形成5通道输入;模型采用卷积网络架构,包含5个卷积块,通道数依次为32、64、64、128、128,第一卷积块核大小为3,后续为31,激活函数为GELU;最后通过线性分类头输出每个信号点为事件边界的非标准化概率。
结果解读:特征提取增强了信号中的事件边界信息,卷积网络通过不同大小的核捕捉局部与全局信号特征,实现高精度的边界预测;模型架构轻量化,适配GPU加速,满足实时分析需求。

产品关联:文献未提及具体实验试剂,领域常规使用Python深度学习框架(如PyTorch、TensorFlow)实现模型构建。
3.3 多损失函数训练策略
实验目的:优化模型的边界预测性能,解决类别不平衡(边界点占比极低)、过分割、连续边界预测等问题。
方法细节:采用三损失函数组合:Focal损失用于处理类别不平衡,提升边界点的预测精度;Huber损失约束预测边界数量,防止过分割;自定义Consecutive损失避免模型预测连续信号点为边界,符合纳米孔核苷酸易位的特征。损失函数权重设置为α=5000(Focal)、β=0.05(Huber)、γ=0.1(Consecutive),使用AdamW优化器进行训练,学习率为1e-3。同时开展消融实验,分别移除Huber和Consecutive损失,评估各损失组件的贡献。
结果解读:消融实验表明,三损失函数组合的模型分割质量最优,相比仅用Focal损失或Focal+Huber损失的模型,匹配事件比例更高,与真实事件水平的L1距离更小,与参考k-mer水平的Pearson相关系数更高;在RawHash2的多分类任务中,三损失模型的未分类率更低,分类精度提升显著(文献未明确提供P值,基于图表趋势推测)。
产品关联:文献未提及具体实验产品,领域常规使用PyTorch等框架实现自定义损失函数。
3.4 分割质量评估Pipeline开发
实验目的:全面评估分割方法的性能,弥补传统仅对比边界位置的评估局限性。
方法细节:开发多维度评估指标:1. 边界位置匹配:Jaccard相似度(含扩展Jaccard,允许±1位置偏差)、双向Chamfer距离;2. 事件序列对齐:通过动态时间规整实现预测事件与真实事件的对齐,计算匹配、插入、删除事件比例及对齐得分;3. 事件水平一致性:计算预测事件与真实事件z标准化均值的L1距离,以及预测事件与参考k-mer水平的Pearson相关系数。在R9.4.1和R10.4.1的Zymo模拟群落(n=7000,每个物种1000条reads,排除E. coli)与人类NA12878数据集(n=8000)上开展评估。
结果解读:Campolina的各项评估指标均优于Scrappie(采用Sigmoni和RawHash2的超参数):Jaccard相似度更高,Chamfer距离更小,匹配事件比例提升10%-20%,L1距离降低30%-40%,Pearson相关系数(Match)接近0.9,表明Campolina的分割边界更准确,事件水平与真实标签及参考基因组更一致。

产品关联:实验所用关键工具:自定义评估脚本开源于Campolina GitHub仓库。
3.5 现有原始信号处理框架适配性验证
实验目的:验证Campolina分割结果可直接整合到现有原始信号处理框架,提升下游分析性能。
方法细节:将Campolina替换Sigmoni和RawHash2中的Scrappie分割,在三类任务中评估性能:Zymo二元分类(区分酵母与细菌)、宿主去除(区分人类与细菌)、Zymo多分类(区分7种微生物);数据集采用R9.4.1和R10.4.1的Zymo D6322(每个物种n=1000)与人类NA12878(n=8000),仅保留比对质量60的唯一比对reads作为标签,评估指标为长度加权准确率、精确率、召回率、F1得分及未分类率(仅RawHash2)。
结果解读:在R10.4.1数据集上,Campolina显著提升Sigmoni和RawHash2的性能:Sigmoni的分类准确率提升5%-10%,RawHash2的未分类率降低15%-20%,准确率提升8%(文献未明确提供P值,基于图表趋势推测);在R9.4.1数据集上,Campolina提升Sigmoni的性能,与RawHash2性能相当(未分类率略高2%-3%),表明Campolina可直接适配现有框架,且对新一代纳米孔的适配性更优。


产品关联:实验所用关键工具:RawHash2、Sigmoni原始信号处理框架。
3.6 时间效率与实时应用潜力评估
实验目的:评估Campolina的时间效率,验证其适配实时分析的能力。
方法细节:在R10.4.1人类NA12878数据集(n=8000)上,对比Campolina与Scrappie的分割时间,以及Campolina与Remora真实标签流程的时间;同时评估Campolina分割与RawHash2映射的时间协同性,分析不同批次大小下的分割时间,以及分割质量对映射轮次的影响。
结果解读:Campolina的分割时间与Scrappie相当,且支持GPU批量处理,批次大小达1024时时间效率显著提升30%;与Remora流程相比,Campolina的分割时间缩短80%以上(无需碱基识别和比对);此外,Campolina分割可减少RawHash2的映射轮次,40%以上样本仅需1-2轮映射即可完成,降低了整体分析时间,表明Campolina适合实时分析场景。

产品关联:实验所用硬件:NVIDIA A100 GPU(40GB)。
4. Biomarker研究及发现成果
本文为纳米孔信号分割的方法学研究,核心目标是开发高精度的原始纳米孔信号分割工具,未涉及生物标志物(Biomarker)的筛选、验证及功能研究,因此本模块无对应研究内容。