1. 领域背景与文献
文献英文标题:Diagnosing and grading gastric atrophy and intestinal metaplasia using semi-supervised deep learning on pathological images: development and validation study;
发表期刊:Gastric Cancer;影响因子:未公开;研究领域:消化系统肿瘤病理诊断与人工智能辅助诊断
胃癌是全球范围内重大的公共卫生问题,位列第五大常见恶性肿瘤及第四大癌症相关死亡原因,其中超过95%为腺癌,肠型腺癌是最常见的亚型。Correa级联反应是肠型腺癌从正常黏膜发展为恶性肿瘤的关键路径,慢性萎缩性胃炎的核心病理改变(萎缩、肠上皮化生、异型增生)是癌前病变的重要标志,患者的胃癌风险随病变进展逐渐升高,其中萎缩、肠上皮化生的年胃癌发生率分别为0.1%、0.12%-0.25%。为实现胃癌前病变的风险分层,国际指南推荐采用胃炎评估操作链接(OLGA)和肠上皮化生评估操作链接(OLGIM)系统,整合病变严重程度与分布部位进行个体化风险评估。然而,病理医生对胃萎缩和肠上皮化生的诊断及分级存在较强主观性,腺体丢失程度的定量评估难度大,导致诊断一致性和准确性有限,即使通过统一术语、读片培训等干预措施,仍难以有效提升诊断质量。
深度学习技术在医学图像分析领域展现出巨大潜力,全监督深度学习模型在乳腺、肺、结直肠等肿瘤的病理图像诊断中已取得与人类专家相当的性能,但这类模型依赖大量像素级的人工标注,在胃癌前病变病理诊断场景中,由于病变形态复杂、标注成本极高,全监督模型的应用受到限制。半监督学习中的多实例学习(MIL)仅需粗粒度的类别标注,无需像素级标注,适合解决主观因素影响大、标注困难的病理诊断问题。针对现有研究的空白,本研究旨在构建基于半监督深度学习的GasMIL模型,实现胃萎缩、肠上皮化生的精准诊断及OLGA/OLGIM分级,并验证模型辅助病理医生提升诊断性能的作用,为胃癌前病变的精准风险分层提供新工具。
2. 文献综述解析
核心信息段:作者对领域内现有研究按技术方向分为传统病理诊断方法、现有深度学习辅助诊断研究两类,通过对比两类方法的优势与局限性,凸显本研究的创新价值。
传统病理诊断方法方面,1994年更新的悉尼系统为胃黏膜病变诊断提供了统一框架,但病理医生在实际应用中仍面临诸多挑战,尤其是胃萎缩的诊断需评估腺体丢失程度,主观性强,导致诊断一致性差。为提升诊断质量,病理学界尝试了多种干预措施,包括召开会议统一术语概念、开展多轮读片培训、提出定量测量方法等,但这些措施未能有效提升诊断的一致性与准确性,目前慢性萎缩性胃炎病理诊断的一致性仍处于较低水平。
现有深度学习辅助诊断研究在多种肿瘤病理诊断领域取得了显著成果,自动识别技术在乳腺癌、肺癌、结直肠癌等的病理图像诊断中表现优异,部分模型的诊断性能不逊于人类专家。但这类研究多采用全监督学习范式,需要病理医生提供大量像素级的病变标注,标注成本极高,且在胃癌前病变领域,现有研究主要聚焦于腺体分割、胃炎亚型分类等方向,缺乏针对OLGA/OLGIM分级的半监督模型,也未开展观察者研究验证模型对病理医生诊断能力的提升作用。
与现有研究相比,本研究的创新点在于首次构建了基于半监督多实例学习的GasMIL模型,无需像素级标注即可实现胃萎缩、肠上皮化生的诊断及OLGA/OLGIM分级,同时通过多中心前瞻性研究及观察者研究,全面验证了模型的诊断性能及辅助病理医生提升诊断质量的作用,解决了传统病理诊断一致性差、现有深度学习模型依赖标注的核心问题,为胃癌前病变的精准诊断与风险分层提供了新的技术范式。
3. 研究思路总结与详细解析
核心信息段:本研究的整体框架为多中心前瞻性收集标准化胃活检病理图像数据集→构建基于半监督多实例学习的GasMIL诊断模型→多维度验证模型性能(与病理医生对比、观察者研究)→得出模型可提升病理诊断准确性与一致性的结论,形成“数据收集-模型构建-性能验证-临床应用潜力”的完整研究闭环。
3.1 多中心样本收集与分组
实验目的:获取标准化、多中心的胃活检全切片图像数据集,为模型构建与验证提供可靠的金标准对照数据,保证研究结果的外推性。
方法细节:本研究为多中心前瞻性试验,纳入2017年12月至2020年9月13家三甲医院的545例内镜下疑似慢性萎缩性胃炎患者,纳入标准为40-65岁患者,排除自身免疫性胃炎、消化性溃疡、上消化道出血、高级别上皮内瘤变等病例。每例患者取胃内5个部位的活检组织,包括胃窦小弯、大弯(距幽门2-3cm)、胃体小弯(距角切迹4cm)、胃体大弯中段(距贲门8cm)、角切迹,组织经苏木精-伊红(H&E)染色后,使用MoticEasyScan Pro扫描为全切片图像(WSIs)。由3名资深病理医生按更新的悉尼系统独立分级,不一致结果经讨论达成共识作为金标准。将患者按4:1分为模型构建集与测试集,模型构建集再按4:1分为训练集与验证集。
结果解读:最终纳入545例患者的2725张全切片图像,训练集包含349例患者的1745张图像,验证集包含87例患者的435张图像,测试集包含109例患者的545张图像。三组患者的基线特征(年龄、性别等)及OLGA/OLGIM分期分布无显著差异(p>0.05),保证了数据集的均衡性,避免了模型训练与验证的偏倚。
产品关联:实验所用关键产品:MoticEasyScan Pro全切片扫描仪;文献未提及具体染色试剂,领域常规使用苏木精-伊红(H&E)染色试剂。

3.2 GasMIL模型构建
实验目的:开发基于半监督多实例学习的病理图像诊断模型,解决胃萎缩、肠上皮化生诊断标注难、一致性差的问题,实现病变的精准分级及OLGA/OLGIM风险分层。
方法细节:模型采用多实例学习(MIL)框架,首先将每张全切片图像裁剪为224×224的非重叠斑块,分辨率为0.5μm/像素和2.0μm/像素,通过SimCLR自监督学习框架对斑块进行预训练,提取鲁棒的图像特征,无需人工标注。随后构建多尺度斑块嵌入,将不同分辨率的斑块特征拼接,整合浅层边缘纹理特征与深层病变形态特征。通过多层感知器(MLP)分类器筛选每张全切片图像中排名前20的关键斑块(最可能为病变区域的斑块),再利用Transformer模型整合关键斑块的特征,得到全切片图像级的病变分级结果。最后结合同一患者5个部位的全切片图像结果,按照OLGA/OLGIM系统计算患者级的风险分层结果。
结果解读:在测试集中,GasMIL模型在全切片图像级的肠上皮化生诊断AUC为0.884(95%CI 0.862-0.902),萎缩诊断AUC为0.877(95%CI 0.855-0.897);患者级的OLGA分级AUC为0.729(95%CI 0.625-0.833),OLGIM分级AUC为0.792(95%CI 0.688-0.896)。模型的注意力热图显示,模型可精准聚焦于病变区域,误诊病例主要源于严重炎症导致的结构扭曲、切片过薄或血管干扰等因素。
产品关联:文献未提及具体深度学习工具品牌,领域常规使用Python、PyTorch框架,SimCLR自监督学习算法。


3.3 模型性能与病理医生对比验证
实验目的:验证GasMIL模型的诊断性能是否优于病理医生,评估模型在临床应用中的潜在价值。
方法细节:选取测试集中30例患者的150张全切片图像,将GasMIL模型的诊断结果与10名病理医生的诊断结果进行对比,以3名资深病理医生的共识作为金标准,评估模型的AUC、敏感性、特异性、加权kappa值。
结果解读:在全切片图像级,GasMIL模型在萎缩诊断上的AUC为0.953(95%CI 0.927-0.976),敏感性为80%(n=150,P<0.05),特异性为85%(n=150,P<0.05),加权kappa值为0.61(n=150,P<0.05),性能优于所有10名病理医生;在肠上皮化生诊断上,模型的AUC为0.949(95%CI 0.918-0.972),同样优于多数病理医生。在患者级分级中,GasMIL模型的OLGA分级AUC在10名病理医生中排名第二,OLGIM分级AUC排名第五,展现出良好的风险分层能力。
产品关联:文献未提及具体评估工具,领域常规使用scikit-learn工具包进行ROC曲线及统计学分析。

3.4 模型辅助病理医生诊断的观察者研究
实验目的:验证GasMIL模型是否能提升病理医生的诊断性能,评估模型作为辅助工具的临床应用价值。
方法细节:选取测试集中60例患者,随机分为两组,每组30例,一组由10名病理医生独立诊断,另一组由病理医生在GasMIL模型的辅助下诊断,对比两组的AUC、敏感性、特异性、加权kappa值,采用Wilcoxon符号秩检验进行统计学分析。
结果解读:在肠上皮化生诊断中,模型辅助组病理医生的AUC(p=0.013)、敏感性(p=0.014)、加权kappa值(p=0.016)均显著高于独立诊断组;在萎缩诊断中,模型辅助组的特异性(p=0.007)显著提升。在患者级OLGA/OLGIM分级中,辅助组的诊断指标虽无统计学差异,但呈现出提升趋势,推测可能因样本量较小导致未检测到统计学差异,需更大样本量的研究进一步验证。
产品关联:文献未提及具体实验产品,领域常规使用病理数字阅片系统开展观察者研究。

4. Biomarker研究及发现成果解析
核心信息段:本研究的Biomarker为胃活检病理图像中的多尺度形态学特征,通过半监督深度学习模型自动提取与整合,用于胃萎缩、肠上皮化生的诊断及OLGA/OLGIM分级,为胃癌前病变的风险分层提供了基于图像的客观指标。
Biomarker定位:本研究的Biomarker是从H&E染色的全切片图像中自动提取的多尺度形态学特征,包括腺体结构、细胞形态、炎症浸润等视觉特征,筛选逻辑为通过自监督学习从大量未标注图像中学习通用特征,再通过多实例学习筛选与病变相关的关键斑块特征,最后通过Transformer模型整合为可用于诊断和分级的高维特征,实现从图像像素到临床分级的转化。
研究过程详述:特征来源为545例患者的2725张H&E染色全切片图像,涵盖了不同严重程度的萎缩、肠上皮化生及正常黏膜组织。验证方法为将模型的诊断结果与3名资深病理医生的共识金标准进行对比,通过AUC、敏感性、特异性、加权kappa值等指标评估特征的诊断效能。结果显示,基于多尺度形态学特征的GasMIL模型在萎缩诊断中的敏感性为80%(n=150,P<0.05),特异性为85%(n=150,P<0.05),肠上皮化生诊断的AUC为0.884(n=545,95%CI 0.862-0.902),展现出良好的诊断性能。
核心成果:本研究通过深度学习模型挖掘的病理图像多尺度形态学特征,可有效区分胃萎缩、肠上皮化生与正常黏膜,实现OLGA/OLGIM的精准分级,创新性在于首次将半监督多实例学习应用于胃癌前病变的病理图像分级,无需像素级标注即可实现高精度诊断,且验证了特征模型辅助病理医生提升诊断性能的作用。该成果为胃癌前病变的客观诊断与风险分层提供了新的技术手段,有助于提升病理诊断的一致性与准确性,为胃癌的早诊早治提供支持。