1. 领域背景与文献
文献英文标题:Artificial Intelligence-Generated Electronic Medical Record Summarization in Breast Surgical Oncology;
发表期刊:Annals of Surgical Oncology;影响因子:未公开;研究领域:乳腺外科肿瘤学、医学人工智能
乳腺外科肿瘤学的临床诊疗高度依赖多源医学信息的精准整合,包括乳腺钼靶、超声、磁共振成像(Magnetic Resonance Imaging, MRI)等影像资料,以及病理组织学、受体状态等病理结果,术前病历整理(pre-charting)是门诊肿瘤诊疗的核心环节,需要梳理不同来源的病历资料。然而,外部机构提供的病历常以PDF、传真等非标准化格式存在,给临床团队带来显著的行政和认知负担。领域共识:医学人工智能(AI)中的大语言模型(Large Language Model, LLM)为解决临床信息过载问题提供了潜力,可将非结构化数据转换为结构化摘要,但现有LLM应用存在幻觉、事实一致性差、时间抽象错误等局限性,需严格验证和人类监督。当前研究空白在于,针对乳腺外科肿瘤学的特定需求,尤其是处理外部PDF格式病历的AI摘要工具仍缺乏系统评估,且现有研究较少关注AI工具与临床工作流程的整合及用户体验。本研究旨在开发并验证基于检索增强生成(Retrieval-Augmented Generation, RAG)技术的GPT-4o模型,用于乳腺外科肿瘤的术前病历摘要,评估其准确性、可行性和用户接受度,为该领域的AI工具应用提供循证依据。
2. 文献综述解析
作者对领域内现有研究的分类维度涵盖AI临床摘要的应用场景(初级保健、住院病程总结、急诊患者交接、专科门诊等)和技术类型(纯LLM摘要、环境AIscribe等),系统梳理了不同场景下AI工具的性能表现与局限性。
现有研究的关键结论显示,AI生成临床摘要可有效减少信息过载,将非结构化数据转化为结构化内容,但普遍面临时间抽象错误、信息冗余、事实不一致及幻觉等挑战。不同临床场景中AI摘要的表现存在差异:在初级保健领域,AI生成的摘要准确性低于临床医生撰写的版本,但内容变异性更小,遗漏关键信息的概率更低;在急诊患者交接场景中,AI生成的摘要在质量上优于医生撰写的版本,但实用性稍逊一筹;环境AIscribe技术可显著减少文档负担和医生职业倦怠,但依赖语音采集技术,无法满足肿瘤学中整合多源静态病历资料的需求。现有研究的局限性在于,缺乏针对乳腺外科肿瘤学的特定AI摘要工具,尤其是针对外部机构提供的PDF格式病历的研究,且对AI工具与临床工作流程的整合效果、用户体验的评估较为匮乏,难以指导该领域AI工具的实际落地。本研究的创新价值在于,首次将检索增强生成技术增强的GPT-4o模型应用于乳腺外科肿瘤的术前PDF病历摘要,系统评估了AI工具的性能、认知负担影响及用户接受度,填补了该领域的研究空白,为AI工具在高风险临床场景的应用提供了关键证据。
3. 研究思路总结与详细解析
本研究的整体框架为“模型开发→初始验证→试点测试→用户反馈→统计分析”的闭环,研究目标是评估检索增强生成技术增强的GPT-4o生成的乳腺外科肿瘤病历摘要的准确性、可行性和用户接受度,核心科学问题为AI摘要能否有效降低临床团队的文档负担并保持临床可靠性,技术路线围绕AI模型的构建、多阶段验证及用户体验评估展开。
3.1 AI模型开发
本环节的核心目标是构建适用于乳腺外科肿瘤的检索增强生成技术增强GPT-4o病历摘要模型。方法细节上,临床记录专员将新患者的外部影像、病理及会诊报告整理为PDF文件,涵盖不同机构的多种原始格式;采用检索增强生成技术处理这些PDF文件,通过向量化和嵌入技术将文本转换为数值表示,实现关键信息的高效检索,再利用GPT-4o模型在机构安全平台上生成现病史(History of Present Illness, HPI)摘要,并标注信息来源的文件名和页码,研究遵循TRIPOD-LLM报告指南。结果解读显示,该模型能够处理多格式的PDF病历,提取关键临床信息并生成结构化摘要,支持来源追溯,为后续验证奠定基础。

文献未提及具体实验产品,领域常规使用大语言模型平台、向量数据库工具及PDF文本处理软件。
3.2 初始AI模型评估
本环节的核心目标是验证AI模型生成摘要的临床准确性与完整性。方法细节上,4名乳腺外科医师助理为50份病历生成人工现病史摘要,与AI生成的摘要进行对比;2名乳腺肿瘤专科医师采用结构化框架,从患者年龄、影像结果(钼靶、超声、磁共振成像)、病理结果(组织学、受体状态、肿瘤分级)、病史、待检查项目等维度评估AI摘要的准确性与完整性,同时通过5点Likert量表评估摘要的清晰度与相关性。结果解读显示,AI摘要在患者年龄维度的准确率为94%(n=50),乳腺钼靶信息的准确率为94%、完整性为92%(n=50),超声信息的准确率为86%、完整性为90.7%(n=43),病理组织学、受体状态、肿瘤分级的准确率分别为97.6%、89.8%、95%(n=50);但磁共振成像信息的准确率仅为83.3%、完整性为44.4%(n=18),39.8%的病例中AI摘要未明确活检方式,41.7%的病例正确识别了待检查项目;摘要的清晰度平均分为4.01,相关性平均分为3.87(n=50)。基于这些结果,研究团队对模型进行优化,确保AI摘要中始终包含活检方式与活检夹类型。
文献未提及具体实验产品,领域常规使用临床评估量表与文档对比工具。
3.3 试点测试与用户调查
本环节的核心目标是评估AI工具在实际临床工作流程中的表现及用户体验。方法细节上,2025年9月开展试点研究,纳入62名初始诊疗在外部机构、病历以PDF格式提供的乳腺肿瘤患者;临床团队(医师助理与乳腺外科医生)使用AI工具生成摘要,采用改良版提供者文档摘要质量量表(Provider Documentation Summarization Quality Instrument, PDSQI-9)评估摘要质量(省略3个与初始评估重叠的维度),通过任务负荷指数(NASA Task Load Index, NASA TLX)的心理需求与时间需求子量表评估认知负担,同时收集用户的自由文本反馈。结果解读显示,AI摘要在准确性(84%获高分)、实用性(81%获高分)、简洁性(79%获高分)、来源引用(85%获高分)维度表现良好,但在无遗漏的全面性维度,45%的摘要获低分(n=62);25份(40%)反馈报告提及错误,其中13份(52%)为关键错误(影响治疗决策),最常见的错误类型为影像相关错误,占68%(17/25);任务负荷指数评分显示,使用AI工具前后的心理需求(9.3 vs 11)与时间需求(8.5 vs 10.5)评分无统计学差异(p>0.05);用户自由文本反馈显示,AI工具减少了从PDF转录信息的打字负担,但需要修正错误、调整格式,整体时间节省不明显,对简单病例的帮助更大,复杂病例仍需改进。

文献未提及具体实验产品,领域常规使用临床调查量表与电子数据收集工具。
3.4 统计分析
本环节的核心目标是对评估数据进行量化分析,验证研究结果的统计学可靠性。方法细节上,采用描述性统计分析量表评分的分布,使用Welch t检验对比AI工具使用前后的任务负荷指数评分,将Likert量表二分类(1-3为低,4-5为高)后进行二项式检验(p<0.05),对用户自由文本反馈中的错误进行编码分类(关键/非关键、错误类型)。结果解读显示,二项式检验证实AI摘要在多个质量维度的高分占比具有统计学意义(p<0.05),t检验证实认知负担无显著变化,错误编码明确了最常见的错误类型与关键错误的比例,为模型优化提供了具体方向。
文献未提及具体实验产品,领域常规使用统计分析软件(如R、SPSS)。
4. Biomarker研究及发现成果
本研究未涉及传统分子生物标志物,聚焦于医学人工智能领域的“性能Biomarker”——即AI临床摘要工具的关键质量评估指标,包括准确性、全面性、错误率、认知负担等,这些指标直接关联临床决策的可靠性与工作流程效率。
Biomarker的筛选与验证逻辑为,基于已验证的临床评估量表(提供者文档摘要质量量表、任务负荷指数),通过初始模型评估与试点测试的双阶段验证,确认这些指标能够有效反映AI工具的临床性能。研究过程详述:数据来源为临床团队的结构化量表评估结果与用户自由文本反馈,验证方法包括结构化量表评分与错误编码分析;特异性与敏感性数据显示,AI摘要的准确性为84%(n=62),全面性低分率为45%(n=62),关键错误发生率为21%(13/62),影像相关错误发生率为27%(17/62);任务负荷指数认知负担评分在使用AI工具前后无统计学差异(p>0.05)。核心成果提炼:AI摘要在多个质量维度表现良好,但全面性不足与关键错误是主要限制因素;用户体验显示AI工具可减少打字负担,但错误修正与格式调整抵消了部分时间收益,对简单病例更具实用性;本研究的创新性在于首次验证了检索增强生成技术增强的GPT-4o模型在乳腺外科肿瘤PDF病历摘要中的应用,明确了AI工具的性能瓶颈与优化方向,为该领域的AI工具落地提供了关键循证依据。推测:进一步优化模型的检索策略以提升全面性,定制化输出格式匹配临床医生习惯,可有效降低认知负担,提升AI工具的时间节省效果与用户接受度。