1. 领域背景与文献
文献英文标题:Development of a deep learning-based automated diagnostic system (DLADS) for classifying mammographic lesions — a first large-scale multi-institutional clinical trial in Japan;
发表期刊:未明确;影响因子:未公开;研究领域:乳腺肿瘤影像学人工智能辅助诊断
领域共识:乳腺钼靶筛查是降低乳腺癌特异性死亡率的核心手段,西方随机对照试验已证实其可有效降低乳腺癌相关死亡风险。日本自推行40岁以上女性每两年一次的乳腺钼靶筛查制度以来,采用双读片模式提升癌症检出率,但该模式需投入大量人力资源,且2022年日本乳腺筛查率仅为47.4%,显著低于西方发达国家的70%以上。传统计算机辅助检测(CADe)系统的临床效用存在争议,部分研究显示其可提升读片性能,但也有大量研究指出该系统会导致召回率升高与不必要活检,临床价值未得到统一认可。近年来,基于卷积神经网络(CNN)的人工智能辅助诊断(CADx)系统展现出与人类读片师相当的诊断能力,可有效降低读片负担、提升诊断效率,但此类算法多基于西方人群数据开发,未在日本女性中开展充分的验证研究。领域共识:亚洲女性乳腺密度显著高于西方女性,而乳腺密度是影响钼靶诊断准确性的关键因素,因此西方开发的AI系统在日本人群中的适配性存在疑问,日本临床实践中缺乏本土化的人工智能辅助乳腺诊断工具,存在明确的未满足医疗需求。本研究针对这一空白,开展日本首次大规模多中心临床试验,开发并验证适配日本女性乳腺特征的乳腺钼靶人工智能辅助诊断系统。
2. 文献综述解析
核心信息段:作者以“乳腺辅助诊断技术的发展阶段+人群适配性差异”为分类维度,系统梳理了乳腺钼靶辅助诊断领域的研究现状,明确了传统CADe系统的局限性与西方AI-CADx系统在日本人群中的适配性问题,为本次研究的创新价值奠定了逻辑基础。
作者首先评述了传统计算机辅助检测系统的研究现状,指出部分研究证实该系统可提升读片性能,但也有大量研究显示其会导致召回率升高与不必要活检,临床效用未得到统一认可。随后,作者聚焦基于深度学习的人工智能辅助诊断系统,强调此类系统依托卷积神经网络已展现出与人类读片师相当的诊断能力,可有效降低读片负担、提升诊断效率,但现有算法多基于西方人群数据开发,未在日本女性中开展充分的验证研究。由于日本女性乳腺密度更高,西方系统的诊断性能可能受影响,且日本临床实践中此类系统的应用处于空白阶段,存在明确的未满足需求。通过对比现有研究的局限性,本研究的创新价值凸显为:首次在日本开展大规模多中心临床试验,开发并验证了适配日本女性乳腺特征的乳腺钼靶人工智能辅助诊断系统,该系统兼容多厂商设备,且诊断性能不受乳腺密度、病变类型等因素影响,填补了日本本土人工智能辅助乳腺诊断的研究空白,为提升日本乳腺筛查效率提供了新的技术方案。
3. 研究思路总结与详细解析
核心信息段:本研究的整体研究框架为“多中心高质量数据集构建→适配性AI模型开发→独立测试集性能验证→亚组稳定性分析”闭环,研究目标是开发并验证适用于日本女性的乳腺钼靶人工智能辅助诊断系统,核心科学问题是如何构建适配日本女性高乳腺密度特征且兼容多厂商设备的AI诊断模型,最终实现稳定、高效的乳腺癌辅助诊断。
3.1 多中心标注数据集构建
实验目的:构建符合日本女性乳腺特征、标注质量可控的大规模钼靶图像数据集,为AI模型训练提供可靠金标准。方法细节:从日本63家医疗机构回顾性收集2010年1月至2019年8月的乳腺钼靶图像,纳入标准为年龄20岁以上的日本女性,无化疗、内分泌治疗、放疗史及乳腺手术史,病变经病理诊断或至少2年随访确认(良性病变需无进展,正常乳腺需多模态检查无病变);排除断层合成、局部加压等特殊成像方式及图像质量不佳的样本。由72名经日本乳腺癌筛查质量保证中心认证的A级读片师,采用Fiji(Image-J)软件对病变区域进行手动标注,病理诊断为恶性病变的金标准,良性病变结合超声、磁共振成像等多模态检查及长期随访确认标注准确性。最终将数据集按8:1:1的比例随机分为训练集、验证集与独立测试集,未进行分层调整。结果解读:共收集20638张乳腺钼靶图像,来自11450名女性,中位年龄为55岁(文献未明确提供该数据的样本量,基于图表趋势推测),其中数字钼靶占91%,计算机放射钼靶占9%;包含5019张乳腺癌图像(24.3%)、5026张良性病变图像(24.4%)、10593张正常乳腺图像(51.3%)。数据集在乳腺密度、病变类型、设备厂商等亚组分布均衡,为AI模型的泛化性验证提供了基础。实验所用关键产品:Fiji(Image-J)图像标注软件,Python(3.7.7)数据处理工具,TensorFlow(2.1.0)深度学习框架。
3.2 基于SE-ResNet的AI模型架构设计与训练
实验目的:构建适配日本女性高乳腺密度特征的深度学习模型,实现乳腺钼靶病变的良恶性分类。方法细节:AI系统的整体流程如图1所示,采用原创的基于挤压-激励残差网络(SE-ResNet)的卷积神经网络架构,将卷积层、批量归一化层与挤压-激励(SE)结构结合形成残差块,通过全局平均池化压缩数据后,经全连接层与Sigmoid函数输出恶性病变概率;训练过程中,全连接层后设置50%的dropout率以防止过拟合,采用减少焦点损失作为损失函数,参数固定为α=0.25、γ=2.0。为统一不同厂商设备的图像分辨率,将所有钼靶图像统一调整为高度2560像素并保持宽高比,转换为8位灰度图;训练时采用随机裁剪、水平翻转、多种滤波处理等数据增强技术提升模型泛化性,模型从初始状态训练300个epoch,未使用ImageNet预训练权重。测试阶段采用滑动窗口法检测病变,在图像四周添加384像素边缘,以64像素步长滑动窗口,将输出概率≥0.5的区域标记为可疑区域,最终以热图浓度梯度15%作为恶性病变的判定阈值。

结果解读:训练300个epoch后,训练集与验证集的准确率均持续上升,损失值持续下降,模型收敛良好(如图2所示),表明模型未出现过拟合,具备稳定的学习能力。

实验所用关键产品:Python(3.7.7)编程软件,TensorFlow(2.1.0)深度学习框架。
3.3 模型性能评估与亚组稳定性分析
实验目的:在独立测试集中验证AI模型的诊断性能,并评估其在不同亚组中的稳定性。方法细节:采用独立测试集(2059张乳腺钼靶图像)评估模型的灵敏度、特异性、准确率、受试者工作特征曲线下面积(AUC)等指标,采用DeLong法计算AUC的95%置信区间;同时按乳腺密度、病变类型、病理类型、设备厂商等亚组进行分层分析,验证模型的泛化性。结果解读:在测试集中,AI模型诊断乳腺癌的灵敏度为83.5%(n=2059,文献未明确提供P值,基于图表趋势推测),特异性为84.7%(n=2059,文献未明确提供P值,基于图表趋势推测),准确率为84.4%,阳性预测值为63.8%,阴性预测值为94.1%;AUC为0.841(DeLong 95%CI 0.822-0.859,n=2059)(如图3所示)。亚组分析显示,模型在不同乳腺密度、病变类型、病理类型及设备厂商亚组中的AUC范围为0.639-0.906,诊断性能保持稳定,表明模型适配日本女性的乳腺特征且兼容多厂商设备。

实验所用关键产品:Python sci-kit learn库(统计学分析)。
4. Biomarker研究及发现成果解析
核心信息段:本研究的Biomarker为乳腺钼靶图像中与乳腺癌相关的影像学特征(包括肿块、钙化、局灶性不对称密度、结构扭曲等),通过深度学习模型自动提取并学习这些特征与恶性病变的关联模式,实现乳腺癌的辅助诊断,其筛选与验证逻辑为“多中心数据集标注→AI模型特征学习→独立测试集性能验证→亚组稳定性分析”的完整链条。
Biomarker的来源为日本63家机构收集的20638张乳腺钼靶图像,涵盖乳腺癌、良性病变及正常乳腺的影像学特征,标注金标准为病理诊断或至少2年的临床随访。验证方法为在独立测试集中评估模型的诊断性能,结果显示模型的灵敏度为83.5%(n=2059,文献未明确提供P值,基于图表趋势推测),特异性为84.7%(n=2059,文献未明确提供P值,基于图表趋势推测),AUC为0.841(DeLong 95%CI 0.822-0.859,n=2059),表明模型对恶性病变影像学特征的识别具备较高的准确性与稳定性。亚组分析显示,模型在不同乳腺密度亚组中的诊断性能无显著差异,解决了高乳腺密度对钼靶诊断准确性的影响问题。核心成果方面,该AI模型作为整合多种影像学特征的Biomarker识别系统,首次在日本大规模多中心数据集中验证了适配高乳腺密度人群的诊断性能,其诊断稳定性不受病变类型、设备厂商等因素影响,创新性在于填补了日本本土人工智能辅助乳腺诊断的空白,为提升日本乳腺筛查效率、降低人力资源成本提供了可靠工具。未来通过前瞻性研究验证其作为第二读片师的临床价值,有望进一步提升日本乳腺癌筛查的整体质量。