【文献解析】MLMarker:用于组织推断和生物标志物发现的机器学习框架

1. 领域背景与文献

文献英文标题:MLMarker: a machine learning framework for tissue inference and biomarker discovery;

发表期刊:文献未明确提供;影响因子:文献未明确提供;研究领域:蛋白质组学、生物信息学、机器学习在肿瘤与神经生物学中的应用

领域共识:基于质谱的蛋白质组学技术已成为生物系统蛋白质表达分析的基石,近年来样本制备、仪器和计算方法的进步大幅提升了检测灵敏度、通量和覆盖度,可在微量样本中定量数千种蛋白质。然而,随着蛋白质组数据集规模和速度的增长,数据的复杂性和庞大性使得提取有意义的生物学结论面临挑战。传统的差异表达分析依赖预定义的组间比较,虽然具备统计严谨性,但无法揭示数据中复杂的、非明显的关系,且受预处理步骤(如定量方法、归一化、缺失值插补)影响显著,导致结果一致性差。同时,公共蛋白质组数据(如ProteomeXchange、PRIDE、MassIVE)的积累为改进分析方法提供了潜力,已催生PeptideAtlas、ProteomicsDB等社区知识库,以及MS2PIP、DeepLC等机器学习工具用于质谱数据解读,但公共数据在生物发现中的复用仍有限,尤其是在组织推断和生物标志物发现领域,缺乏可适配不同实验流程、可解释且能处理稀疏数据的工具。

针对上述领域空白,本研究开发了MLMarker——一个基于机器学习的工具,扩展了原有组织预测模型,提供连续的组织相似性概率测量,具备可解释性和稀疏数据处理能力,旨在补充传统蛋白质组分析,实现假设生成和组织推断,解决传统方法的核心局限性。

2. 文献综述解析

作者从传统蛋白质组分析方法的局限性、公共蛋白质组数据的利用现状、现有机器学习工具的应用场景三个维度对领域内现有研究进行评述,核心逻辑为:传统方法无法应对数据复杂性与稀疏性,公共数据的价值未被充分挖掘,现有机器学习工具聚焦质谱数据预处理而非组织推断,进而引出MLMarker的创新必要性。

传统差异表达分析方法通过预定义组间比较筛选差异表达蛋白,优势是具备成熟的统计框架,能聚焦特定分组的差异;但局限性在于依赖刚性的预定义分组,无法捕捉样本的整体差异景观,且受预处理步骤影响大,结果一致性差。公共蛋白质组数据的积累已推动了知识库和预处理工具的发展,如PeptideAtlas用于蛋白质组数据的整合,MS2PIP通过重新打分提升质谱数据的鉴定效率,但这些工具主要聚焦于数据的存储和预处理,而非组织推断或生物标志物发现。现有组织预测模型多为静态分类器,缺乏适配性和可解释性,无法处理稀疏数据或不同实验流程产生的异质蛋白质组数据,难以在实际研究中广泛部署。

与现有研究相比,MLMarker的创新价值体现在四个方面:一是基于公共健康组织蛋白质组图谱,提供连续的、多组织同时比较的组织相似性概率测量,而非刚性的二元分类;二是通过SHAP值实现模型决策的完全可解释性,能识别驱动组织相似性的关键蛋白质;三是自动应用样本内min-max归一化,适配不同的蛋白质组学方法(如数据依赖采集DDA、数据独立采集DIA、亲和蛋白质组学);四是引入可调节的缺失值惩罚因子,处理蛋白质组数据固有的稀疏性问题。这些创新解决了传统方法的核心局限性,为蛋白质组分析提供了新的维度,实现从数据到假设的有效转化。

3. 研究思路总结与详细解析

本研究的整体框架是:以解决传统蛋白质组分析的局限性为目标,开发可适配、可解释的机器学习工具MLMarker,通过三个核心模块改进原有组织预测模型,然后在三个公共数据集(脑黑色素瘤转移、脑脊液、泛癌FFPE组织)上验证工具的性能,评估其处理稀疏数据、组织推断的能力,并进行生物学解读,验证其作为假设生成工具的价值。技术路线遵循“模型开发→性能验证→多数据集应用→生物学解读”的闭环逻辑。

3.1 MLMarker工具核心模块开发

实验目的:将原有静态组织分类模型扩展为可适配、可解释的机器学习框架,解决传统模型在异质蛋白质组数据中的部署难题。

方法细节:基于随机森林(Random Forest)模型,开发三个核心改进:1. 用Shapley Additive exPlanations(SHAP)值重构组织相似性得分,将组织相似性分解为单个蛋白质的贡献,实现模型决策的可解释性;2. 自动对每个样本应用min-max归一化,聚焦样本内的蛋白质丰度比例,降低实验和计算流程引入的全局缩放差异的影响;3. 引入可调节的缺失值惩罚因子(λ),通过初始化时计算的零样本SHAP参考校准缺失蛋白质对结果的影响,处理蛋白质组数据固有的稀疏性。工具以Python包形式实现,包含输入验证、归一化、预测、SHAP解释、可视化等模块化功能。

结果解读:这些改进使MLMarker从静态分类器转变为可适配不同蛋白质组学方法、可解释、能处理稀疏数据的框架,支持通过组织相似性模式关联蛋白质证据,结合外部知识库进行假设生成,为蛋白质组分析提供了新的补充工具。

产品关联:文献未提及具体实验产品,领域常规使用Python的scikit-learn库实现随机森林模型,shap库实现可解释性分析,ionbot、FlashLFQ等工具进行蛋白质组数据的鉴定和定量。

3.2 缺失值惩罚因子的性能验证

实验目的:评估缺失值惩罚因子对MLMarker预测性能的影响,确定最优的惩罚策略,验证工具处理稀疏数据的能力。

方法细节:选取两个极端数据集:高密度的肝脏组织蛋白质组(PXD009021)和稀疏的脑脊液蛋白质组(PXD008029),模拟三种缺失机制:完全随机缺失(MCAR,代表技术变异)、非随机缺失(MNAR,低丰度蛋白优先丢失,模拟质谱检测限效应)、靶向缺失(组织特异性标记蛋白优先丢失,模拟样本与参考的生物学差异),缺失率从0到80%,每次10%递增,每个条件重复10次。评估固定惩罚因子(λ=0、0.5、1、2)和自适应惩罚因子(分段线性、逻辑斯蒂)的性能,使用top-1准确率、排名稳定性、过校正情况作为评估指标。

结果解读:在高密度组织中,完全随机缺失和非随机缺失下,λ=1在低缺失率时略有过校正,但在高缺失率(>65%)时显著提升准确率;在靶向缺失下,λ=1始终提升准确率,平均增益1.3%。在稀疏脑脊液样本中,λ=1在所有缺失类型和缺失率下均提升准确率,平均增益分别为完全随机缺失下0.72%、非随机缺失下0.62%、靶向缺失下1.06%。排名稳定性分析显示,λ=1在两种样本中均能在所有缺失率下保持正确组织的低排名,优于其他方法。过校正分析显示,稀疏样本中无过校正,高密度组织仅在低缺失率下有轻微过校正。



产品关联:文献未提及具体实验产品,领域常规使用Python的numpy、pandas库进行数据处理,matplotlib、seaborn库进行可视化。

3.3 脑黑色素瘤转移数据集应用分析

实验目的:验证MLMarker在肿瘤组织样本中的应用能力,探索脑黑色素瘤转移样本的组织相似性模式,发现传统分析未捕捉的生物学结构。

方法细节:使用Zila等人的脑黑色素瘤转移数据集(PXD007592),包含10例MAPKi治疗良好响应者和26例不良响应者的样本。重新处理数据:用ionbot进行肽段鉴定,FlashLFQ进行定量,MSqRob2进行差异表达分析。应用MLMarker分析样本的组织相似性,比较良好响应者和不良响应者的脑相似性得分,通过SHAP值识别驱动脑相似性的蛋白质,进行过表达分析和差异表达分析,验证MLMarker结果的可靠性(排除数据质量、强度的影响)。

结果解读:传统差异分析仅识别20个差异表达蛋白,无监督聚类无法区分响应者;而MLMarker显示不良响应者的脑相似性得分显著高于良好响应者(Mann–Whitney U检验,p=1.31×10⁻⁷,n=36),呈现明显的梯度。数据质量分析显示,脑相似性得分与总蛋白强度、MLMarker特征蛋白强度相关,但与特征覆盖度无关,且MLMarker特征蛋白的强度比例与非特征蛋白相似,表明结果不受数据质量或强度 artifacts影响。SHAP分析显示脑预测样本的SHAP值显著更高(Mann–Whitney检验,p=6.73×10⁻¹⁶),过表达分析显示脑预测样本富集脑相关过程,非脑预测样本中良好响应者富集免疫相关过程。差异表达分析显示,脑预测与非脑预测样本之间有255个差异表达蛋白,远多于响应者之间的20个,其中10个是已知的肿瘤侵袭标志物,仅在脑预测样本中存在。





产品关联:实验所用关键产品:ionbot(v0.11.0)、FlashLFQ(v1.0.3)、MSqRob2(v1.4.0)。

3.4 脑脊液数据集应用分析

实验目的:验证MLMarker在生物流体样本(稀疏数据)中的应用能力,探索脑脊液样本的组织相似性模式,识别驱动组织相似性的蛋白质标志物。

方法细节:使用Yamana等人的脑脊液数据集(PXD008029),应用MLMarker分析样本的组织相似性,比较有无惩罚因子的结果,通过Streamlit应用进行SHAP分析,识别驱动垂体和脑组织相似性的蛋白质,验证其生物学相关性。

结果解读:无论是否使用惩罚因子,垂体和脑都是脑脊液样本排名最高的两个组织;使用惩罚因子后,低排名组织(如骨髓、睾丸、肺、单核细胞)的相似性得分降低,提升了结果的可靠性。SHAP分析显示,驱动垂体分类的蛋白质主要属于分泌和神经元通路,驱动脑分类的蛋白质是已知的脑相关标志物,部分已在脑脊液中被报道。样本的脑和垂体相似性得分与鉴定的谱图数量相关(Pearson相关系数分别为0.45和0.60),但低覆盖样本若包含高特异性蛋白也能得到高置信度预测。


产品关联:文献未提及具体实验产品,领域常规使用Streamlit框架实现可视化界面,UniProt、Human Protein Atlas进行蛋白质注释。

3.5 泛癌FFPE数据集应用分析

实验目的:验证MLMarker在异质肿瘤样本中的应用能力,比较其与传统参考图谱方法的性能,探索肿瘤组织与健康组织的蛋白质组差异。

方法细节:使用Tüshaus等人的泛癌FFPE数据集(MSV000095036),包含1220例多种癌症类型的样本和健康对照。应用MLMarker分析样本的组织相似性,设置惩罚因子λ=1,将癌症类型映射到最接近的健康组织。比较MLMarker与三个参考图谱(MLMarker训练图谱、Human Protein Atlas、ProteomicsDB)的两种分类策略(Spearman相关、k近邻)的性能,使用top-1准确率、top-k准确率作为评估指标,通过UMAP聚类分析样本的蛋白质组模式。

结果解读:MLMarker的性能最优,扩展映射下top-1准确率为72.9%,严格映射下为50.7%,优于其他参考图谱方法。队列水平分析显示,MLMarker在大多数癌症类型(如DLBCL、胶质瘤、OSCC)中性能稳定,但结直肠癌(CRC)是最具挑战性的队列;健康淋巴结(LN)和嗅上皮(OE)样本在扩展映射下性能提升,表明训练数据中这些组织的代表性不足。UMAP聚类显示,黑色素瘤样本与胶质母细胞瘤聚类,部分为已知的神经转移,但部分非转移样本也呈现相似性,需要进一步研究。HeLa细胞样本被预测为B细胞,分析显示其缺失率较高,但B细胞相似性与缺失特征数量无关,且SHAP值显示存在和缺失的特征都有贡献,表明HeLa细胞的蛋白质组已偏离原始宫颈组织,呈现B细胞样特征。



产品关联:文献未提及具体实验产品,领域常规使用Python的umap库进行降维可视化,scikit-learn库实现k近邻分类。

4. Biomarker研究及发现成果

本研究中,MLMarker作为工具,通过组织相似性分析和SHAP值识别与组织特征、肿瘤表型相关的蛋白质标志物,筛选逻辑为“公共健康组织图谱训练→样本组织相似性得分计算→SHAP值识别驱动蛋白→差异表达分析验证→生物学功能关联”,覆盖从计算筛选到实验验证的完整链条。

Biomarker定位

涉及的Biomarker类型包括组织特异性蛋白质标志物、肿瘤侵袭相关蛋白质标志物;筛选逻辑是:基于MLMarker的随机森林模型从公共健康组织图谱学习组织特异性模式,然后对测试样本计算组织相似性得分,通过SHAP值分解每个蛋白质对组织相似性的贡献,识别驱动组织相似性的蛋白质,再通过差异表达分析验证这些蛋白质在不同样本组中的表达差异,结合外部知识库(如UniProt、Human Protein Atlas)注释其生物学功能。

研究过程详述

Biomarker的来源包括临床肿瘤组织样本(脑黑色素瘤转移)、生物流体样本(脑脊液)、泛癌FFPE组织样本。验证方法包括:SHAP值分析(识别驱动蛋白)、差异表达分析(验证表达差异)、过表达分析(注释功能)、相关性分析(验证与样本特征的关联)。特异性与敏感性数据:在泛癌数据中,MLMarker的top-1准确率在扩展映射下为72.9%(文献未明确提供置信区间),严格映射下为50.7%;在脑脊液样本中,脑和垂体相似性得分与谱图数量的Pearson相关系数分别为0.45和0.60;在脑黑色素瘤转移样本中,不良响应者的脑相似性得分显著高于良好响应者(p=1.31×10⁻⁷,n=36)。

核心成果提炼

该Biomarker的功能关联包括三个方面:一是脑黑色素瘤转移中,脑相似性高的样本富集的蛋白质涉及代谢、细胞骨架组织、信号传导,其中10个是已知的肿瘤侵袭标志物,提示这些样本具有侵袭性表型,可能通过蛋白质组 mimicry适应脑微环境;二是脑脊液样本中,驱动垂体和脑相似性的蛋白质属于分泌和神经元通路,与垂体和脑的功能一致;三是泛癌数据中,黑色素瘤样本与胶质母细胞瘤的蛋白质组相似性提示部分黑色素瘤可能获得神经组织样表型。创新性在于:首次将可解释机器学习与公共健康组织图谱结合,实现复杂蛋白质组数据的组织推断,发现传统分析未捕捉的肿瘤组织适应性表型;首次在脑黑色素瘤转移样本中发现脑相似性与肿瘤侵袭性的关联,为治疗响应的预测提供新的视角。统计学结果:脑黑色素瘤转移中不良响应者脑相似性得分的p值为1.31×10⁻⁷(n=36);泛癌数据中MLMarker扩展映射的top-1准确率为72.9%(文献未明确提供样本量的细分数据)。推测:这些蛋白质标志物可作为脑黑色素瘤转移的预后标志物,以及肿瘤侵袭性的预测标志物,需进一步临床样本验证其特异性和敏感性。

特别声明

1、本页面内容包含部分的内容是基于公开信息的合理引用;引用内容仅为补充信息,不代表本站立场。

2、若认为本页面引用内容涉及侵权,请及时与本站联系,我们将第一时间处理。

3、其他媒体/个人如需使用本页面原创内容,需注明“来源:[生知库]”并获得授权;使用引用内容的,需自行联系原作者获得许可。

4、投稿及合作请联系:info@biocloudy.com。