1. 领域背景与文献
文献英文标题:Deep learning-based subtyping of gastric cancer histology predicts clinical outcome: a multi-institutional retrospective study;
期刊名称:文献未明确提供;影响因子:文献未明确提供;研究领域:肿瘤学(胃癌精准病理分型与预后预测)
胃癌是全球范围内发病率位居前列的恶性肿瘤,其中腺癌占比超过90%。1965年提出的Laurén组织学分类是西方临床实践中应用最广泛的胃癌分型体系,将胃癌分为肠型和弥漫型两类,二者具有不同的遗传学特征与临床结局,晚期弥漫型胃癌通常被认为侵袭性更强、预后更差,目前已有多项临床试验基于Laurén分型制定差异化治疗策略。但胃癌存在高度的肿瘤内与肿瘤间异质性,导致包括Laurén分类在内的所有胃癌组织学分类体系均存在较高的观察者间及观察者内差异,且其预后价值始终存在争议;2019年WHO分类新增“混合型”胃癌定义,进一步增加了分类的观察者差异。近十年来,计算病理学领域的深度学习技术快速发展,基于苏木精-伊红(H&E)染色切片的计算机视觉技术为临床相关的病理评估提供了新途径,但此前尚未有研究系统利用带长期随访数据的多中心大样本队列,开展基于深度学习的胃癌Laurén分型及预后价值研究,仅存在小样本的技术基准研究,因此亟需开展大样本多中心研究验证深度学习在胃癌Laurén分型及预后预测中的临床价值。
2. 文献综述解析
作者对领域内现有研究从Laurén分类的临床应用与局限性、深度学习在病理图像分析中的应用两个核心维度进行评述,明确现有研究的核心结论、技术优势与未解决问题,进而凸显本研究的创新价值。
现有研究表明,Laurén分类是胃癌临床实践中应用最广泛的组织学分型方法,但其主观性强、观察者间差异大,且在不同研究中对患者的预后分层能力不一致,部分研究显示弥漫型胃癌预后更差,但也有研究未发现显著差异,这可能与分类的不一致性直接相关。深度学习技术在病理图像分析领域已展现出优异性能,可实现肿瘤检测、分型、预后预测等多种任务,其核心优势在于可自动化提取图像中的细微特征,减少人为偏倚,但此前针对胃癌Laurén分型的深度学习研究仅为小样本技术验证,未纳入多中心外部队列及长期临床随访数据,无法充分验证模型的泛化能力与临床预后价值。此外,现有研究多聚焦于模型与病理分类的一致性,而未关注模型的预后分层能力,忽略了病理分类本身的局限性。本研究的创新点在于首次采用多中心大样本队列(含TCGA训练队列、欧洲及日本验证队列,总样本量超700例),基于注意力多实例学习技术构建深度学习模型,不仅验证了模型的分型准确性,更重要的是证明其预后分层能力显著优于病理学家的Laurén分类,同时探索了模型与病理分类结合的临床应用场景,为胃癌精准预后预测提供了新的技术范式。
3. 研究思路总结与详细解析
本研究的整体框架为“可靠金标准构建→深度学习模型训练→多中心外部验证→预后价值评估→可解释性与联合应用分析”的完整闭环,研究目标是构建基于深度学习的胃癌Laurén分型模型,验证其泛化能力并评估其预后价值,核心科学问题是深度学习能否减少Laurén分型的观察者差异,提升胃癌患者的预后分层准确性。
3.1 研究队列构建与伦理审批
实验目的是建立具有可靠金标准的训练队列和多中心外部验证队列,最大限度减少分类偏倚对模型性能的影响。方法细节上,训练队列采用TCGA胃癌队列的苏木精-伊红染色全切片图像,由东西方两位资深胃肠道病理学家重新进行Laurén分类,仅保留TCGA原始分类与病理学家重新分类一致的样本,最终得到166例合格样本(肠型116例,弥漫型48例);外部验证队列包括欧洲基尔大学医院的KIEL队列(n=322)和日本神奈川癌症中心的KCCH队列(n=243),所有样本均为未接受新辅助治疗的胃癌切除标本,研究符合赫尔辛基宣言,各参与机构的伦理委员会均已审批通过。结果解读显示,通过严格的金标准筛选,确保了训练队列分类的一致性,多中心外部队列涵盖东西方人群,提升了研究结论的泛化性。产品关联:文献未提及具体实验产品,领域常规使用数字病理扫描仪(如Hamamatsu、Leica系列)、样本管理系统等。

3.2 深度学习模型构建与训练
实验目的是构建适用于胃癌全切片图像Laurén分型的深度学习模型,确保模型能有效提取病理图像中的预后相关特征。方法细节上,采用注意力多实例学习(attMIL)算法,以经RetCCL自监督学习预训练的ResNet-50为特征提取器,该预训练模型基于TCGA的3200张全切片图像训练而成;将全切片图像分割为256µm边长的图像块,去除无组织和模糊的图像块,采用Macenko法进行颜色归一化,并通过旋转、翻转进行数据增强;以五折交叉验证的方式在TCGA队列上训练模型,预设性能标准为平均ROC曲线下面积(AUROC)>85%且最低ROC曲线下面积>80%。结果解读显示,内部五折交叉验证的平均ROC曲线下面积为0.93±0.07,达到预设性能标准,证明模型在训练队列中具有优异的Laurén分型能力。产品关联:文献未提及具体实验产品,领域常规使用Python深度学习框架(如PyTorch、TensorFlow)、病理图像处理库(如OpenSlide)等。

3.3 模型外部验证与预后价值评估
实验目的是验证模型在不同地域人群中的泛化能力,并评估其预后分层价值是否优于病理学家的Laurén分类。方法细节上,将训练完成的模型部署到KIEL和KCCH队列,采用ROC曲线下面积评估模型的分型性能,通过Kaplan-Meier曲线、单因素及多因素Cox比例风险模型评估模型对总生存、癌症特异性生存、无病生存的分层能力,并与病理学家的Laurén分类进行对比;多因素分析中调整了年龄、性别、TNM分期、微卫星不稳定性、EB病毒感染、HER2及cMET状态等临床病理变量。结果解读显示,外部验证中模型与病理学家的分类存在一定分歧,KIEL队列中有33.3%的病理判定弥漫型病例被模型重新分类为肠型,KCCH队列中这一比例为54.3%;病理学家的Laurén分类在两个队列中均未对患者的生存进行显著分层,而深度学习分型在两个队列中均能显著分层所有生存终点,单因素Cox模型中,深度学习判定的弥漫型 vs 肠型的总生存风险比(HR)在KCCH队列为1.46(95%置信区间1.18-1.65,n=243,p<0.005),在KIEL队列为1.41(95%置信区间1.20-1.57,n=322,p<0.005);多因素分析显示,深度学习分型在KIEL队列中是独立的预后因素,在KCCH队列中虽未达到统计学显著性,但所有生存终点的风险比均高于病理学家的分类结果。产品关联:文献未提及具体实验产品,领域常规使用生存分析软件(如R语言survival包)、统计分析工具(如SPSS)等。


3.4 模型可解释性与联合应用分析
实验目的是解析深度学习模型的决策逻辑,明确模型与病理分类分歧的原因,并探索模型与病理分类结合的临床应用价值。方法细节上,通过注意力热图和高权重图像块可视化模型的决策区域,对病理学家判定为弥漫型的病例进行亚组分析,对比模型与病理分类一致和不一致的患者生存差异;同时分析模型对混合型胃癌的分类逻辑。结果解读显示,模型与病理分类的分歧更常见于低分化胃癌,在病理学家判定为混合型的病例中,模型主要识别肠型胃癌的区域;此外,细胞外黏液、细胞死亡及自溶 artifacts会干扰模型的注意力分配,导致分类不准确。亚组分析显示,在病理学家判定为弥漫型的病例中,模型与病理分类一致的患者生存显著差于不一致的患者,联合病理与模型分类可在两个队列中均实现更优的生存分层,KCCH队列总生存的log-rank检验p<0.005,风险比为1.43(95%置信区间1.05-1.66,n=151,p=0.03),KIEL队列总生存的log-rank检验p<0.005,风险比为1.56(95%置信区间1.16-1.76,n=87,p<0.005),提示联合分类可提升弥漫型胃癌的预后预测准确性。产品关联:文献未提及具体实验产品,领域常规使用可解释性深度学习工具(如Grad-CAM、注意力可视化库)等。


4. Biomarker研究及发现成果
本研究的核心Biomarker为基于全切片图像的深度学习Laurén分型标签(肠型/弥漫型),通过“TCGA队列训练→内部交叉验证→多中心外部队列验证→预后价值评估”的完整逻辑链进行筛选与验证,最终证明其为具有临床价值的胃癌预后Biomarker。
Biomarker定位:类型为基于病理图像的人工智能衍生预后Biomarker,筛选与验证逻辑为:以TCGA队列中病理学家共识的Laurén分类为金标准训练深度学习模型,通过五折交叉验证验证模型的分型准确性,随后在欧洲、日本两个独立多中心队列中验证模型的泛化能力,最终通过生存分析验证其预后价值。研究过程详述:该Biomarker的来源为胃癌切除标本的苏木精-伊红染色全切片图像,验证方法包括采用ROC曲线下面积评估分型准确性,采用Cox比例风险模型和Kaplan-Meier曲线评估预后分层能力;内部验证的ROC曲线下面积为0.93±0.07,外部验证中虽与病理分类存在分歧,但模型的预后分层能力显著优于病理学家的Laurén分类,单因素分析中,深度学习弥漫型 vs 肠型的总生存风险比在KCCH队列为1.46(n=243,p<0.005),在KIEL队列为1.41(n=322,p<0.005),多因素分析显示其在KIEL队列中为独立预后因素。核心成果提炼:该深度学习分型标签是一种新型的胃癌预后Biomarker,其创新性在于首次证明基于Laurén分类训练的深度学习模型无需生存数据即可预测患者生存,且能识别病理学家未关注的预后相关组织学特征,其预后分层能力显著优于传统的病理学家Laurén分类;此外,将该Biomarker与病理学家分类结合可进一步提升弥漫型胃癌的预后分层准确性,为胃癌的精准预后评估提供了新工具;局限性在于该Biomarker基于切除标本,尚未在活检标本中验证,且模型对某些 artifacts和黏液的识别存在偏差,需进一步优化。