1. 领域背景与文献
文献英文标题:Artificial intelligence-guided discovery of gastric cancer continuum;
发表期刊:Gastric Cancer;影响因子:未公开;研究领域:肿瘤学-胃癌分子机制与生物标志物研究
胃癌是全球范围内高发的恶性肿瘤,其癌变过程遵循Correa提出的经典级联反应:从正常胃黏膜逐步进展为慢性活动性胃炎、萎缩性胃炎、肠化生、异型增生,最终发展为腺癌。领域共识:幽门螺杆菌感染是75%胃癌的首要致癌因素,年龄、吸烟、家族史等为重要风险因素;其中不完全肠化生(IIM)进展为胃癌的相对风险(RR)可达4.48(95% CI 2.50–8.03),显著高于完全肠化生(CIM)。当前胃癌研究热点集中在基因组学突变分析、治疗靶点筛选及预后标志物开发,但核心未解决问题在于:现有研究多聚焦于正常与胃癌的二元区分,缺乏能精准刻画从健康到胃癌全疾病连续体的生物标志物,无法有效识别癌前病变进展为胃癌的高风险人群,且难以客观评估动物模型与人类胃癌的相似度。针对这一研究空白,本研究采用人工智能结合布尔蕴涵网络的方法,构建覆盖全疾病连续体的基因签名,为胃癌早期诊断、预后预测及模型评估提供新的技术范式。
2. 文献综述解析
本文综述部分围绕胃癌疾病连续体的研究现状展开,作者按研究维度将现有研究分为三类:胃癌癌变机制研究、转录组学与生物标志物研究、动物模型在胃癌研究中的应用。
现有癌变机制研究已明确幽门螺杆菌的致癌作用及Correa级联反应的病理过程,证实了不同阶段癌前病变的进展风险差异;转录组学研究通过差异表达分析、蛋白互作网络等方法筛选出多个胃癌相关基因签名,技术优势在于能大规模挖掘基因表达差异,但局限性在于仅依赖基因表达的对称相关关系,忽略了不对称的布尔蕴涵关系,导致其在区分疾病连续体中间状态(如胃炎到肠化生、异型增生到早期胃癌)时性能不足,且多数未经过多中心、多阶段的验证,难以转化为临床可应用的工具;动物模型研究虽构建了感染诱导和基因编辑模型,但缺乏客观指标评估其与人类胃癌的分子相似度。本研究的创新价值在于,首次利用布尔蕴涵网络的不对称关系构建基因签名,不仅能准确区分正常与胃癌样本,还能覆盖从健康到胃癌的全疾病连续体,在癌前病变进展预测和动物模型评估中的性能均优于现有研究的基因签名,填补了现有研究在疾病连续体刻画上的空白。
3. 研究思路总结与详细解析
本研究的整体研究框架为:以构建能精准刻画胃癌疾病连续体的人工智能模型为目标,聚焦“如何利用基因表达的不对称布尔蕴涵关系揭示胃癌进展的连续状态”这一核心科学问题,采用“布尔网络构建→最优路径筛选→多维度验证→机制与应用拓展”的闭环技术路线,通过多组学数据分析与机器学习方法,完成了从模型构建到临床预后、动物模型评估的全链条验证。
3.1 布尔蕴涵网络的构建与建模
实验目的:构建能反映从正常胃黏膜到胃癌的基因表达连续变化的布尔网络,刻画疾病进展的分子特征。
方法细节:采用公开转录组数据集GSE66229(n=400,含300例胃癌组织与100例配对正常组织),使用布尔网络探索工具(BoNE)进行分析:首先通过StepMiner算法将所有基因的表达水平转换为布尔值(高表达或低表达);随后识别基因间的6种布尔蕴涵关系(2种对称关系:等价、相反;4种不对称关系),利用布尔网络统计学方法评估关系的显著性;最后以基因簇为节点、布尔蕴涵关系为有向边构建布尔网络,基因簇由至少与簇内半数基因等价的基因组成。
结果解读:成功构建胃癌布尔蕴涵网络,得到多个具有功能关联的基因簇,后续通过机器学习筛选出与胃癌进展相关的核心簇。
产品关联:文献未提及具体实验产品,领域常规使用转录组分析软件(如Python statsmodels、scipy包)、布尔网络分析工具BoNE等。

3.2 最优布尔路径筛选与GC-BoNE签名构建
实验目的:筛选能有效区分正常与胃癌样本的最优布尔路径,构建胃癌基因签名GC-BoNE。
方法细节:采用两个训练数据集GSE37023(n=65,36例非恶性组织、29例胃癌组织)与GSE122401(n=160,80例配对正常组织、80例胃癌组织),通过普通最小二乘(OLS)回归进行多变量分析,评估不同布尔路径区分正常与胃癌样本的性能,以ROC曲线下面积(AUC)为核心指标筛选最优路径。
结果解读:筛选得到两条最优布尔路径:C#11-2-4-14在GSE37023中AUC为0.96,C#7-13-14在GSE122401中AUC为0.98;将两条路径组合为GC-BoNE签名,其中每个样本的复合评分通过基因簇表达的加权线性组合计算得到,权重根据簇在健康或疾病状态下的表达水平设置。

3.3 GC-BoNE签名在正常vs胃癌样本中的验证
实验目的:验证GC-BoNE签名区分正常与胃癌样本的性能,并与现有基因签名进行对比。
方法细节:采用21个独立的公开转录组数据集,通过ROC-AUC分析评估GC-BoNE及现有基因签名(如DEA (Li 2015)、DEA + PPIN等)的分类性能,通过韦恩图分析基因重叠情况。
结果解读:GC-BoNE签名在21个数据集中的ROC-AUC范围为0.57-1.00(C#11-2-4-14)与0.66-1.00(C#7-13-14),平均AUC为0.933,显著优于现有签名(平均AUC范围0.690-0.921);GC-BoNE与现有签名的基因重叠度极低,仅Cluster14与DEA (Junnila 2010)有8个重叠基因,表明其为全新的胃癌基因签名。

3.4 GC-BoNE签名在胃癌疾病连续体中的验证
实验目的:验证GC-BoNE签名能否区分胃癌进展的不同阶段(从胃炎到肠化生、异型增生到早期胃癌)。
方法细节:采用两个疾病进展数据集:E-MTAB-8889(覆盖非萎缩性胃炎→慢性活动性胃炎→萎缩性胃炎→肠化生)与GSE55696(覆盖慢性胃炎→低级别异型增生→高级别异型增生→早期胃癌),通过ROC-AUC分析评估GC-BoNE与现有签名在区分各阶段样本的性能。
结果解读:GC-BoNE签名在疾病连续体验证中的平均AUC为0.828,优于现有签名(平均AUC范围0.633-0.806);其中C#11-2-4-14与C#7-13-14均能有效区分疾病进展的相邻阶段,表明GC-BoNE能刻画从健康到胃癌的连续分子变化。

3.5 GC-BoNE签名在胃癌小鼠模型评估中的应用
实验目的:利用GC-BoNE签名客观评估小鼠模型与人类胃癌的相似度,筛选最适合研究人类胃癌的模型。
方法细节:分析20个GEO数据集的38个胃癌小鼠模型(包括感染诱导模型与基因编辑模型),通过Welch两样本t检验比较模型中正常与病变组织的GC-BoNE评分差异,以-log10(p值)为指标排名模型。
结果解读:排名前10的模型中,排名第一的是GSE13873的幽门螺杆菌相关感染模型(H. felis感染C57Bl6小鼠),排名2-6的是基因编辑模型(如CDH1、SMAD4、CLDN18基因缺失),这些模型的GC-BoNE评分差异显著(p<0.001),表明其能较好地复现人类胃癌的基因表达模式。

3.6 GC-BoNE签名在肠化生进展预后中的验证
实验目的:验证GC-BoNE签名能否预测肠化生患者进展为胃癌的风险。
方法细节:采用GSE78523数据集(含健康对照、不完全肠化生IIM与完全肠化生CIM患者,平均随访12±3.4年,分为进展组与非进展组),通过ROC-AUC分析评估GC-BoNE签名区分不同组别的性能。
结果解读:C#11-2-4-14能有效区分健康对照与IIM非进展组(AUC=0.86)、健康对照与IIM进展组(AUC=0.94)、IIM非进展组与进展组(AUC=0.95);而C#7-13-14与现有签名无法有效区分IIM进展组与非进展组,表明C#11-2-4-14可作为IIM患者进展为胃癌的预后标志物。

4. Biomarker研究及发现成果
本研究发现的Biomarker为GC-BoNE基因签名,包含两条布尔路径对应的基因簇(C#11-2-4-14与C#7-13-14),其筛选与验证逻辑为:基于布尔蕴涵网络构建→训练数据集筛选最优路径→正常vs胃癌样本验证→疾病连续体验证→动物模型评估→预后验证,形成了完整的“构建-验证-应用”链条。
Biomarker的来源为人类胃黏膜的转录组数据集,涵盖健康、癌前病变与胃癌样本;验证方法包括ROC-AUC分析、Welch两样本t检验等,特异性与敏感性数据显示:在正常vs胃癌样本中平均AUC为0.933,在疾病连续体验证中平均AUC为0.828,在IIM进展预测中AUC达0.95。核心成果方面,GC-BoNE签名的功能关联在于:C#11-2-4-14涉及肌肉收缩、细胞周期、免疫细胞脱颗粒及细胞外基质(ECM)通路,对应从健康到IIM再到胃癌的进展路径;C#7-13-14涉及离子通道转运通路,对应从健康到CIM再到胃癌的进展路径。其创新性在于首次利用基因表达的不对称布尔蕴涵关系构建覆盖胃癌全疾病连续体的基因签名,不仅能准确区分正常与胃癌样本,还能预测癌前病变的进展风险,同时可客观评估小鼠模型与人类胃癌的相似度;统计学结果显示,各验证环节的AUC值均显著高于现有签名,且组间差异具有统计学意义(p<0.05至p<0.001)。此外,研究还发现C#11-2-4-14中的ECM通路基因在IIM进展为胃癌的过程中发挥关键作用,为胃癌的早期干预提供了潜在靶点。
