【文献解析】基于常规临床与实验室数据的肺癌机器学习分类研究

1. 领域背景与文献

文献英文标题:Machine Learning for Classification in Lung Cancer Using Routine Clinical and Laboratory Data;

发表期刊:(文献未明确提供该数据);影响因子:(文献未明确提供该数据);研究领域:肿瘤学-肺癌精准诊断

领域共识:肺癌是全球第二大常见恶性肿瘤,也是癌症相关死亡的首要原因,总体5年生存率不足20%,早期诊断与精准分类可使患者生存率提升20%。组织病理检查是肺癌亚型分类的金标准,对治疗策略制定至关重要,但部分患者因病灶解剖位置难以触及或存在活检并发症风险(如气胸、出血等)无法接受活检,此外表皮生长因子受体(EGFR)突变的非小细胞肺癌(NSCLC)可能转化为小细胞肺癌(SCLC),依赖病理评估的分类方式存在诊断延迟或不确定性,因此非侵入性的肺癌亚型分类工具是当前领域的核心需求。近年来,放射组学、蛋白质组学、代谢组学等非侵入性技术被用于肺癌分类,但放射组学缺乏标准化操作且多为单中心研究,蛋白质组学成本高昂,代谢组学易受饮食等因素干扰,而血清肿瘤标志物虽成本低但单一指标准确性不足,传统线性模型无法整合高维临床数据,这一研究空白促使本研究开展,旨在构建基于常规临床与实验室数据的机器学习分类模型,为无法活检的患者提供精准分类方案。

2. 文献综述解析

本研究综述部分按非侵入性肺癌诊断技术的类型进行分类评述,系统梳理了不同技术的优势与局限性,明确了当前领域缺乏可广泛应用的低成本、易获取的非侵入性分类工具的核心问题。

作者首先阐述了放射组学的研究现状,指出其可实现肿瘤的三维全面分析,弥补活检的局限性,但现有研究多为单中心开展,缺乏外部验证,且无标准化操作流程,导致不同中心结果差异较大。随后分析了蛋白质组学与代谢组学的应用潜力,两类技术可从分子层面区分肺癌亚型,但蛋白质组学需昂贵的质谱设备与抗体芯片,动态监测成本高,不适用于经济欠发达地区;代谢组学结果易受饮食、昼夜节律、药物等因素干扰,且代谢通路复杂需专业生物信息学分析,临床解读难度大。最后聚焦血清肿瘤标志物,明确其在肺癌诊断、分期、突变转化评估中的关键作用,如神经元特异性烯醇化酶(NSE)、胃泌素释放肽前体(ProGRP)是SCLC的核心标志物,癌胚抗原(CEA)、细胞角蛋白19片段(CYFRA21-1)、鳞癌抗原(SCCA)与NSCLC亚型相关,但单一标志物无法精准区分亚型,传统线性模型无法整合高维临床与标志物数据,无法满足临床需求。

通过对比现有研究的未解决问题,本研究的创新价值凸显:首次整合常规临床数据与血清肿瘤标志物两类易获取的指标,采用机器学习算法(随机森林)构建非侵入性肺癌亚型分类模型,解决了无法活检患者的分类难题;同时模型具备良好的可解释性,明确了核心预测因子的贡献,还开发了在线工具便于临床应用,适合资源有限地区推广,填补了领域内低成本、可及性高的非侵入性分类工具的空白。

3. 研究思路总结与详细解析

本研究的核心目标是构建基于常规临床与实验室数据的非侵入性肺癌亚型(SCLC、鳞癌SCC、腺癌ADC)分类模型,核心科学问题是如何利用易获取的临床指标实现精准的肺癌亚型分类,技术路线遵循“数据收集与预处理→特征筛选→多模型构建与优化→模型验证→在线工具开发”的闭环逻辑,最终筛选出最优的随机森林模型并完成临床转化。

3.1 研究队列构建与数据收集

本环节的实验目的是获取符合研究标准的肺癌患者临床与实验室数据,为模型构建提供可靠数据集。方法细节为采用回顾性队列研究设计,纳入四川省肿瘤医院2023年11月至2024年6月、成都医学院第一附属医院2020年2月至2023年8月的原发性肺癌患者,纳入标准为经病理确诊的初诊患者,排除合并其他恶性肿瘤、病理类型无法明确、缺乏指南推荐的5项肺癌标志物结果或无常规实验室检查结果的患者;对缺失率<20%的变量采用多重插补法(随机森林)处理,收集的指标包括人口学特征(性别、年龄)、常规实验室检查(血常规、生化、凝血等30余项指标)、血清肿瘤标志物(CEA、CYFRA21-1、SCCA、NSE、ProGRP),研究结局为肺癌病理亚型分类。结果解读显示,最终纳入1122例主队列患者和119例补充队列患者,主队列中ADC占70.9%,SCC占19.0%,SCLC占10.1%;SCLC和SCC患者中男性占比更高,ADC患者中女性占比更高;SCLC患者的NSE、ProGRP水平显著高于NSCLC患者,SCC患者的CYFRA21-1水平显著高于SCLC和ADC患者(文献未明确提供具体P值,基于图表趋势推测具有统计学显著性)。


产品关联:文献未提及具体实验产品,领域常规使用全自动生化分析仪、化学发光免疫分析仪类仪器检测实验室指标与肿瘤标志物。

3.2 特征筛选与模型构建

本环节的实验目的是从高维临床与实验室指标中筛选出与肺癌亚型分类相关的核心特征,并构建最优分类模型。方法细节为将主队列按7:3比例分层随机分为训练集与测试集,确保各亚型分布一致;采用最小绝对收缩和选择算子(LASSO)回归与Boruta算法共同筛选特征,取两种算法的交集作为最终模型特征;基于训练集构建逻辑回归、极端梯度提升(XGBoost)、类别提升(CatBoost)、随机森林(RandomForest)四种模型,通过五折交叉验证优化模型超参数,采用受试者工作特征曲线下面积(AUC)、准确率、F1评分评估模型性能。结果解读显示,两种算法共筛选出16项核心特征,包括性别、年龄、总胆红素、红细胞、平均血小板体积等临床指标,以及CEA、CYFRA21-1、SCCA、NSE、ProGRP五项肿瘤标志物;


训练集中随机森林模型性能最优,AUC为0.999,准确率为0.984,F1评分为1.000(n=785,文献未明确提供具体P值,基于图表趋势推测具有统计学显著性)。


产品关联:文献未提及具体实验产品,领域常规使用R语言(4.4.1版本)及相关机器学习包(如glmnet、Boruta、randomForest等)进行特征筛选与模型构建。

3.3 模型性能验证与可解释性分析

本环节的实验目的是验证最优模型的泛化能力,并明确核心特征的预测贡献,提升模型的可解释性。方法细节为采用测试集验证随机森林模型的分类性能,采用微平均AUC、宏平均AUC、敏感性、特异性评估;采用节点纯度增加量(IncNodePurity)与均方误差增加百分比(%IncMSE)评估特征重要性;同时仅用排名前6的核心特征(性别、CEA、CYFRA21-1、SCCA、NSE、ProGRP)构建简化模型,在测试集与补充队列中验证性能。结果解读显示,测试集中随机森林模型的微平均AUC为0.969,宏平均AUC为0.940(n=337,文献未明确提供具体P值,基于图表趋势推测具有统计学显著性);对SCLC的敏感性为0.857、特异性为0.993,对SCC的敏感性为0.995、特异性为0.923,对ADC的敏感性为0.667、特异性为0.912;


特征重要性分析显示,性别、CEA、CYFRA21-1、SCCA、NSE、ProGRP是模型的核心预测因子,对分类结果的贡献最大;


简化模型在测试集的微平均AUC为0.943、宏平均AUC为0.899,在补充队列的微平均AUC为0.878、宏平均AUC为0.856,验证了核心特征的预测价值。产品关联:文献未提及具体实验产品,领域常规使用R语言及相关可视化包(如ggplot2、pROC等)进行性能评估与可解释性分析。

3.4 在线预测工具开发

本环节的实验目的是将最优模型转化为临床可及的工具,便于临床医生快速获取分类结果。方法细节为采用R Shiny框架开发在线计算器,整合16项核心特征的输入界面,实现实时计算肺癌亚型的预测概率。结果解读显示,在线工具可通过输入患者的16项指标值,自动输出SCLC、SCC、ADC三种亚型的预测概率,以概率最高的亚型作为分类结果,界面直观易用,可直接应用于临床实践;


工具访问链接为https://nkuwangkai.shinyapps.io/lung-cancer-v1/。产品关联:文献未提及具体实验产品,领域常规使用R Shiny框架开发临床预测工具。

4. Biomarker研究及发现成果

本研究涉及的Biomarker为血清肿瘤标志物,包括CEA、CYFRA21-1、SCCA、NSE、ProGRP,筛选逻辑为通过LASSO回归与Boruta算法从高维临床指标中筛选出与肺癌亚型分类相关的特征,验证逻辑为“训练集模型构建→测试集验证→补充队列验证”的三级验证体系,确保Biomarker的预测可靠性。

这些Biomarker的来源为患者治疗前的血清样本,验证方法为化学发光免疫分析(领域常规检测方法);在测试集中,基于这些Biomarker与性别构建的模型对SCLC的敏感性为0.857、特异性为0.993,对SCC的敏感性为0.995、特异性为0.923,对ADC的敏感性为0.667、特异性为0.912,微平均AUC为0.969,宏平均AUC为0.940(n=337,文献未明确提供具体P值,基于图表趋势推测具有统计学显著性);简化模型仅包含这5项Biomarker与性别,在测试集的微平均AUC为0.943、宏平均AUC为0.899,在补充队列的微平均AUC为0.878、宏平均AUC为0.856,进一步验证了这些Biomarker的核心预测价值。

核心成果方面,这些Biomarker与性别联合,首次被证实可作为肺癌亚型分类的核心预测因子,其中NSE与ProGRP对SCLC的分类贡献最大,SCCA与CYFRA21-1对SCC的分类贡献显著,CEA与ADC的分类相关;模型的创新性在于整合了易获取的血清Biomarker与常规临床数据,无需特殊设备,成本低,适合资源有限地区推广,且模型可解释性强,明确了各Biomarker的贡献,解决了传统“黑箱”模型的临床信任问题;此外,该模型为EGFR突变NSCLC向SCLC转化的动态监测提供了潜在工具,可通过定期检测Biomarker与临床指标更新分类预测,避免频繁活检的负担。

特别声明

1、本页面内容包含部分的内容是基于公开信息的合理引用;引用内容仅为补充信息,不代表本站立场。

2、若认为本页面引用内容涉及侵权,请及时与本站联系,我们将第一时间处理。

3、其他媒体/个人如需使用本页面原创内容,需注明“来源:[生知库]”并获得授权;使用引用内容的,需自行联系原作者获得许可。

4、投稿及合作请联系:info@biocloudy.com。