1. 领域背景与文献
文献英文标题:An artificial intelligence system for comprehensive pathologic outcome prediction in early gastric cancer through endoscopic image analysis (with video);
发表期刊:Gastric Cancer;影响因子:未公开;研究领域:肿瘤学-早期胃癌诊疗-人工智能辅助内镜诊断
胃癌是全球第五大常见恶性肿瘤和第四大癌症相关死亡原因,传统根治手术曾是胃癌的唯一治愈性治疗方式,近年来内镜黏膜下剥离术(ESD)成为早期胃癌的有效治疗选择,可保留胃组织并提高患者生活质量。内镜黏膜下剥离术的治愈性取决于早期胃癌是否存在淋巴结转移,而当前缺乏可靠的影像学方法精准检测早期胃癌的淋巴结转移,因此指南基于术后病理特征(分化状态、浸润深度、脉管侵犯)确定内镜黏膜下剥离术的治愈性标准。术前准确预测这些病理特征对选择内镜或手术切除的最优治疗方案至关重要,但现有方法存在局限性:内镜下钳取活检与术后标本存在显著组织学差异,可能导致非治愈性内镜黏膜下剥离术或错过内镜黏膜下剥离术机会;内镜超声(EUS)判断早期胃癌浸润深度的准确率约70%,并不优于常规内镜。
随着深度学习技术发展,已有人工智能(AI)模型用于检测早期胃癌和预测浸润深度,但尚未有研究探索AI基于内镜图像或视频预测脉管侵犯(LVI)和淋巴结转移(LNM),且现有模型在视频分析方面的性能仍需提升。本研究旨在开发并评估基于白光内镜图像和视频的AI模型,综合预测早期胃癌的术后病理结局,填补领域空白,为早期胃癌的治疗决策提供更精准的辅助工具。
2. 文献综述解析
作者对领域内现有研究按AI模型的应用方向进行分类,分为早期胃癌检测类模型和浸润深度预测类模型,同时结合传统内镜诊断方法的局限性展开评述。
现有研究中,AI模型主要用于早期胃癌的检测和浸润深度的预测,这些模型的优势在于能够辅助内镜医生更高效地评估内镜特征,提升早期胃癌的检出率或浸润深度的预测准确性,例如部分模型在早期胃癌检测任务中展现出良好的性能。但现有研究存在明显局限性:针对早期胃癌多维度病理结局的综合预测研究较为匮乏,尚未有AI模型同时实现分化状态、浸润深度、脉管侵犯和淋巴结转移四个核心病理特征的预测,且缺乏基于内镜视频的多病理特征预测研究;传统诊断方法如活检和内镜超声存在准确性不足的问题,导致治疗决策可能偏离最优方案,而现有AI模型未能全面覆盖病理结局的关键维度,无法为临床提供更全面的辅助支持。
与现有研究相比,本研究的创新价值显著:首次构建基于白光内镜图像和视频的AI模型,实现对早期胃癌分化状态、浸润深度、脉管侵犯和淋巴结转移四个病理特征的同时预测,填补了AI在脉管侵犯和淋巴结转移预测领域的空白;优化了视频分析的技术流程,结合病变检测、分类与病理预测的全链条AI分析,提升了视频数据的利用价值;通过与不同经验水平内镜医生的诊断性能对比,直接验证了AI模型在辅助临床决策方面的实际价值,为AI在早期胃癌内镜诊疗中的应用提供了更充分的证据。
3. 研究思路总结与详细解析
本研究的整体框架为“数据集构建→AI模型开发与训练→内部验证→与内镜医生性能对比→外部验证”的闭环,研究目标是开发并验证能综合预测早期胃癌术后病理结局的AI模型,核心科学问题是AI能否基于白光内镜图像和视频精准预测多维度病理特征且性能优于内镜医生,技术路线围绕深度学习模型的构建与多中心验证展开。
3.1 数据集构建与患者入组
实验目的是构建具有代表性的内镜图像与视频数据集,为AI模型的训练、验证和测试提供可靠数据基础。方法细节:内部数据集分为图像和视频两部分,图像部分回顾性收集首尔国立大学医院(SNUH)2018-2022年间接受内镜黏膜下剥离术或根治手术的早期胃癌患者的术前白光内镜图像,由5名内镜医生筛选出能最佳表征病变的图像(每病变2-3张),排除低分辨率或模糊图像,最终纳入2453张内镜黏膜下剥离术患者图像和2143张手术患者图像;视频部分前瞻性收集2022-2023年间来自社区诊所转诊的早期胃癌患者的白光内镜视频,纳入经术后病理确诊为早期胃癌的患者,排除有前期内镜治疗史、病理结果不确定等情况,最终153例视频用于训练。外部数据集来自首尔国立大学盆唐医院(SNUBH),回顾性收集2020年436张早期胃癌患者内镜图像,前瞻性收集2022年89例早期胃癌患者内镜视频。研究符合赫尔辛基宣言,获得两家医院伦理委员会批准,前瞻性入组患者签署知情同意书,回顾性入组患者豁免知情同意。结果解读:各数据集患者的基线特征具有可比性,包括平均年龄(64.5岁vs63.6岁vs63.5岁)、男性占比(68.7%vs59.1%vs69.0%)、平均肿瘤大小(21.0mmvs24.3mmvs22.7mm);内部训练集的病理特征分布覆盖不同类型,未分化型占图像的19.6%和视频的31.3%,黏膜下浸润占图像的23.7%和视频的27.5%,确保模型训练能学习到不同病理特征对应的内镜表现。

实验所用关键产品:标准视频内镜(GIF-Q260、GIF-H260、GIF-H290;Olympus Medical Systems, Tokyo, Japan);文献未提及其他实验产品,领域常规使用内镜图像管理系统、医学影像标注工具等。
3.2 AI模型构建与训练
实验目的是开发基于深度学习的AI模型,实现对早期胃癌多维度病理特征的精准预测,并优化视频数据的分析流程。方法细节:模型基于卷积神经网络(CNN)的Efficientnetb0架构,整合Stylegan2生成模型以提升预测性能和敏感性;对于内镜图像,直接输入模型进行分类预测,涵盖分化状态(分化型/未分化型)、浸润深度(黏膜层/黏膜下层)、脉管侵犯(阳性/阴性)、淋巴结转移(阳性/阴性)四个维度,采用软投票法确定最终分类结果;对于内镜视频,首先使用YOLOv5模型检测并裁剪病变区域,再通过EfficientNETB0模型将裁剪后的病变分类为癌、腺瘤或非肿瘤性病变,针对癌性病变计算各病理特征的预测置信度,最后采用软投票法确定病理分类,将预测正确的截断值设置为50%。采用五折交叉验证法对模型进行内部训练与验证,确保模型的泛化能力。结果解读:内部验证结果显示,图像模型对未分化型的预测准确率为91.9%(敏感性85.3%,特异性94.1%,n=4336,P<0.05),对黏膜下浸润的准确率为88.4%(敏感性82.4%,特异性90.2%,n=4336,P<0.05);视频模型对未分化型的准确率为89.7%(敏感性83.4%,特异性92.1%,n=153,P<0.05),对黏膜下浸润的准确率为88.0%(敏感性80.4%,特异性91.1%,n=153,P<0.05);除淋巴结转移预测外,图像与视频模型的性能无显著差异,视频模型对淋巴结转移的预测准确率显著高于图像模型(P=0.008)。


文献未提及具体深度学习工具包,领域常规使用PyTorch、TensorFlow等深度学习框架,以及YOLO、EfficientNet等预训练模型进行开发。
3.3 模型性能测试与内镜医生对比
实验目的是验证AI模型的临床应用价值,通过与不同经验水平内镜医生的诊断性能对比,评估AI模型的辅助作用。方法细节:测试集包含260张内镜图像和10个内镜视频,邀请16名内镜医生参与测试,其中9名专家(拥有10年以上内镜黏膜下剥离术经验,副教授及以上职称)、7名新手(拥有1年上消化道内镜经验,独立完成至少500例操作)。医生需对测试集中的病变预测分化状态、浸润深度、脉管侵犯和淋巴结转移四个病理特征,采用Mann–Whitney U检验对比不同组别的准确率,采用McNemar’s test对比AI模型与专家的准确率,绘制受试者工作特征(ROC)曲线并计算曲线下面积(AUC)以评估模型的预测性能。结果解读:AI模型的ROC曲线AUC值分别为未分化型0.992、黏膜下浸润0.902、脉管侵犯0.706、淋巴结转移0.680,所有内镜医生的诊断性能均位于AI模型的ROC曲线下方;AI模型在未分化型(92.7% vs 71.6%,n=270,P≤0.001)、黏膜下浸润(87.3% vs 72.6%,n=270,P≤0.012)、淋巴结转移(87.7% vs 72.3%,n=209,P≤0.001)的预测准确率显著高于专家;专家在未分化型和黏膜下浸润的预测准确率显著高于新手(P=0.001、P=0.019),但在脉管侵犯和淋巴结转移的预测上,专家与新手的准确率无显著差异(P=0.525、P=0.790)。

文献未提及具体统计分析工具,领域常规使用R软件、SPSS等进行医学统计分析。
3.4 模型外部验证
实验目的是评估AI模型在不同医疗机构的泛化能力,验证模型在外部数据集上的性能稳定性。方法细节:采用首尔国立大学盆唐医院(SNUBH)的外部数据集进行验证,包含436张内镜图像和89个内镜视频,评估模型对四个病理特征的预测准确率、敏感性和特异性,以术后病理结果为金标准。结果解读:外部验证结果显示,AI模型对未分化型的预测准确率为75.6%(敏感性81.7%,特异性72.5%,n=436,P<0.05),对黏膜下浸润的准确率为71.9%(敏感性53.3%,特异性80.6%,n=436,P<0.05),对脉管侵犯的准确率为88.8%(敏感性31.8%,特异性94.5%,n=436,P<0.05),对淋巴结转移的准确率为87.0%(敏感性10.0%,特异性98.5%,n=436,P<0.05);尽管外部验证的性能低于内部验证,但模型对浸润深度的预测准确率仍高于内镜超声的传统方法,提示模型具有跨中心应用的潜力。
文献未提及具体实验产品,领域常规使用多中心临床数据集进行AI模型的外部验证。
4. Biomarker研究及发现成果
本研究的Biomarker为早期胃癌在白光内镜图像和视频中的视觉特征,AI模型通过学习这些特征与术后病理特征的关联,实现对病理结局的预测,其筛选与验证逻辑为“多中心数据集训练→内部交叉验证→与临床医生对比→外部验证”的完整链条。
该Biomarker的来源为SNUH和SNUBH两家三级医院的早期胃癌患者术前白光内镜图像和视频,涵盖不同病理类型、浸润深度的病变。验证方法包括AI模型的内部验证、与内镜医生的性能对比测试及外部验证,通过准确率、敏感性、特异性、AUC值等指标评估Biomarker的预测价值。特异性与敏感性数据方面,内部验证中视频模型对未分化型的敏感性为83.4%、特异性为92.1%(n=153,P<0.05),对黏膜下浸润的敏感性为80.4%、特异性为91.1%(n=153,P<0.05);外部验证中对未分化型的敏感性为81.7%、特异性为72.5%(n=436,P<0.05),对黏膜下浸润的敏感性为53.3%、特异性为80.6%(n=436,P<0.05)。
核心成果方面,这些内镜视觉特征经AI模型学习后,可作为早期胃癌病理结局的有效预测标志物,其中分化状态和浸润深度的预测性能优异,AI模型的准确率显著高于内镜专家,为早期胃癌的治疗决策提供了更精准的辅助依据;创新性在于首次将白光内镜视觉特征用于同时预测四个核心病理特征,尤其是实现了脉管侵犯和淋巴结转移的AI预测,填补了领域空白。但需注意,模型对脉管侵犯和淋巴结转移的敏感性较低(内部验证中脉管侵犯敏感性20.0%、淋巴结转移敏感性16.7%),提示这些视觉特征在预测脉管侵犯和淋巴结转移方面的特异性仍需提升,推测可能与早期胃癌中脉管侵犯和淋巴结转移的发生率较低导致数据不平衡有关,未来可结合临床特征(如年龄、性别、肿瘤大小)进一步优化模型性能。