【文献解析】stGCL:用于空间转录组学分析的多模态图对比学习框架

1. 领域背景与文献

文献英文标题:stGCL: a multi-modal graph contrastive learning framework for spatial transcriptomics analysis;发表期刊:Genome Biology;影响因子:17.906(2023年);研究领域:空间转录组学多模态数据分析。

空间转录组学作为生命科学领域的前沿技术,自2016年10× Genomics推出Visium平台以来,实现了组织切片中基因表达的空间定位,突破了单细胞RNA测序丢失空间信息的局限。当前领域的关键技术节点包括高分辨空间转录组技术(如MERFISH、STARmap)的问世,以及多模态数据分析方法的发展;研究热点聚焦于多模态数据(基因表达、空间位置、组织学图像)的整合、多切片组织的3D结构重建,以及空间域识别与细胞间通讯分析等方向。然而,现有研究仍存在未解决的核心问题:一是多数空间聚类方法未能充分挖掘组织学图像中的高分辨率纹理特征,多模态融合策略的有效性不足;二是多切片整合方法要么仅支持垂直连续切片,要么在水平切片对齐与3D结构重建上精度有限,难以全面解析组织的空间异质性。

为解决上述问题,本研究开发了名为stGCL的多模态图对比学习框架,旨在通过高效整合基因表达、空间坐标与组织学图像信息,提升空间域识别的准确性,并实现水平与垂直多切片的精准整合,为空间转录组学的多模态分析提供新的技术范式。

2. 文献综述解析

作者对空间转录组学现有分析方法的分类维度为“是否整合空间信息”与“是否利用组织学图像特征”,将现有方法分为四类:传统非空间聚类方法、整合空间信息的聚类方法、基于深度自编码器的空间聚类方法、整合组织学特征的多模态方法。

传统非空间聚类方法如k-means、Louvain算法,仅利用基因表达信息进行spot聚类,优势是计算效率高,能快速实现基因表达相似性的分组,但局限在于完全忽略空间位置信息,导致同一类别的spot在空间分布上不连续,无法反映组织的空间结构。整合空间信息的聚类方法如Giotto、BayesSpace,通过马尔可夫随机场建模相邻spot的空间关系,优势是提升了空间域的连续性与一致性,能更准确地识别组织的解剖学结构,但局限在于未充分利用组织学图像中的形态学信息,对依赖组织学特征的空间域识别效果有限。基于深度自编码器的方法如SEDR、STAGATE、GraphST等,结合基因表达与空间位置信息构建深度模型,优势是能学习到低维的空间嵌入,提升聚类的准确性,但局限在于多数方法未整合组织学特征,无法利用组织形态学的互补信息。整合组织学特征的多模态方法如stLearn、DeepST、SpaGCN,开始引入组织学图像特征,优势是能结合分子与形态学信息,但局限在于对组织学图像的高分辨率纹理特征提取能力不足,多模态融合策略未能充分挖掘各模态的判别信息,且在多切片整合上,现有方法要么仅支持垂直连续切片,要么对齐精度不足,无法同时实现水平与垂直切片的精准整合。

通过对比现有研究的未解决问题,本研究的创新价值凸显:一是首次提出基于组织学图像的Vision Transformer(H-ViT)模型,能高效提取spot对应的组织学形态与细胞分布特征;二是采用多模态图注意力自编码器结合对比学习的策略,实现基因表达、空间位置与组织学特征的深度融合;三是开发了基于切片边缘结构的多切片对齐算法,支持水平与垂直切片的精准整合与3D结构重建,突破了现有方法的应用局限。

3. 研究思路总结与详细解析

本研究的整体目标是开发一款高效的多模态空间转录组学分析框架,解决现有方法在多模态融合与多切片整合上的不足;核心科学问题是如何实现基因表达、空间位置与组织学图像的深度融合,以及如何精准整合水平与垂直多切片的空间转录组数据;技术路线遵循“模型构建→多数据集验证→泛化性测试→临床样本应用”的闭环逻辑,通过多模态图对比学习生成spot嵌入,用于空间域识别、多切片整合等下游分析。

3.1 数据集预处理与模型输入构建

实验目的:为stGCL模型提供标准化、高质量的输入数据,确保各模态数据的兼容性与有效性。
方法细节:对基因表达数据,使用SCANPY工具包进行对数转换、文库大小归一化与缩放处理,筛选前3000个高变基因作为输入;对组织学图像,按spot的位置与大小分割为单个spot图像,采用H-ViT模型将每个spot图像划分为多个patch,通过Transformer编码器提取特征,再经主成分分析(PCA)降维至3000维,得到组织学特征矩阵;基于spot的空间坐标,计算欧氏距离构建无向空间邻接图,设置邻接半径为相邻spot间距的1-2倍,并为每个spot添加自环。
结果解读:得到标准化的基因表达矩阵、组织学特征矩阵与空间邻接图,确保各模态数据维度一致,为后续多模态融合提供基础;产品关联:文献未提及具体实验产品,领域常规使用SCANPY、OpenCV、PyTorch等生物信息学与深度学习工具包。

3.2 多模态图对比学习模型训练

实验目的:学习融合基因表达、空间位置与组织学特征的低维spot嵌入,提升空间域识别与多模态数据整合的能力。
方法细节:首先进行数据增强,通过随机打乱基因表达与组织学特征矩阵的行生成负样本;然后构建多模态图注意力自编码器(GATE),以基因表达矩阵、组织学特征矩阵与空间邻接图为输入,通过图注意力网络(GAT)编码器迭代聚合相邻spot的特征,生成spot的联合结构化嵌入,再通过对称的解码器重建原始特征,最小化重建损失;同时引入对比学习,通过读出函数生成全局图摘要,最大化spot嵌入与全局摘要的互信息,采用二元交叉熵损失优化,总损失为重建损失与对比损失的加权和(β=0.04)。
结果解读:生成的低维spot嵌入能同时反映基因表达相似性、组织学形态相似性与空间邻近性,为下游分析提供高判别性的特征表示;产品关联:文献未提及具体实验产品,领域常规使用PyTorch等深度学习框架实现模型训练。

3.3 空间域识别与性能验证

实验目的:验证stGCL在空间域识别任务上的准确性与优越性,与现有主流方法进行对比。
方法细节:采用mclust或Louvain算法对stGCL生成的嵌入进行聚类,在有预定义标签的数据集上使用mclust,无预定义标签时使用Louvain并调整分辨率参数;使用调整兰德指数(ARI)与归一化互信息(NMI)评估聚类性能,与SCANPY、BayesSpace、SpaGCN、SEDR、STAGATE、DeepST、GraphST等7种方法在12个人类背外侧前额叶皮层(DLPFC)Visium数据集上进行对比;同时通过UMAP可视化与PAGA轨迹推断分析嵌入的生物学意义。
结果解读:stGCL在12个DLPFC切片上的平均ARI为0.56,平均NMI为0.65,显著优于其他对比方法;在切片151,674的分析中,stGCL能准确识别Layer 2等精细皮层分层,且PAGA轨迹推断显示从Layer 1到Layer 6的线性发育轨迹,相邻皮层层的相似性更高; ablation实验表明,去除H-ViT模块后性能下降6.7%,说明组织学特征的整合对提升性能至关重要;产品关联:文献未提及具体实验产品,领域常规使用mclust、Louvain等聚类算法工具。

3.4 多切片整合与3D结构重建

实验目的:验证stGCL在水平与垂直多切片整合上的能力,实现组织3D空间结构的精准重建。
方法细节:针对垂直多切片,选取4个DLPFC连续切片,采用基于切片边缘结构的对齐算法,先通过边缘spot的中心坐标计算偏移量实现2D对齐,再设置z轴坐标构建3D空间邻接图;针对水平多切片,选取小鼠脑的矢状前、后切片,通过x、y轴的平移对齐实现水平整合;使用ARI、NMI评估整合后的聚类性能,通过UMAP可视化验证批次效应的校正效果与组织异质性的保留。
结果解读:在4个DLPFC垂直切片的整合中,stGCL的ARI为0.61,NMI为0.71,UMAP可视化显示各皮层层清晰分离,有效校正了批次效应并保留了组织异质性;在小鼠脑水平切片的整合中,stGCL能准确识别海马体的CA与DG结构,以及大脑皮层、小脑等区域,空间域的识别结果与Allen脑图谱的注释高度一致;产品关联:文献未提及具体实验产品,领域常规使用OpenCV等图像处理工具包进行切片对齐。

3.5 跨平台泛化性验证

实验目的:验证stGCL在不同空间转录组平台与分辨率数据上的通用性与鲁棒性。
方法细节:选取11个来自不同平台的数据集,包括10× Visium、STARmap、MERFISH、Slide-seqV2、NanoString CosMx SMI、Stereo-seq、10× Xenium等,涵盖spot级、单细胞级、亚细胞级等不同分辨率;在每个数据集上进行空间域识别或多切片整合分析,与现有方法对比性能。
结果解读:在NanoString CosMx SMI的非小细胞肺癌(NSCLC)数据集上,stGCL能准确区分肿瘤细胞与成纤维细胞富集区域,聚类性能优于其他方法;在MERFISH的小鼠下丘脑数据集上,stGCL能垂直整合5个连续切片并识别与手动注释高度一致的空间域;在Stereo-seq的小鼠嗅球与胚胎数据集上,stGCL能准确识别组织的层状结构与器官分布;在10× Xenium的乳腺癌数据集上,stGCL能处理超过16万个细胞的大规模数据,仅需约14分钟完成分析,显示出高效的计算性能;产品关联:文献未提及具体实验产品,领域常规使用各平台对应的数据分析工具包。

3.6 支气管腺瘤临床样本应用

实验目的:验证stGCL在临床肿瘤样本中的应用价值,解析肿瘤的空间异质性并挖掘潜在生物标志物。
方法细节:收集原发性支气管腺瘤患者的新鲜肿瘤组织,采用10× Visium平台进行空间转录组测序,由病理学家手动注释肿瘤、正常、支气管、血管四个区域;使用stGCL进行空间域识别,通过Wilcoxon检验筛选差异表达基因(DEGs,FDR<1%),并进行通路富集分析(KEGG)。
结果解读:stGCL的空间域识别结果与手动注释的ARI为0.62,NMI为0.53,能准确区分四个组织区域,且空间域的连续性更好、噪声更低;差异表达基因分析显示,肿瘤区域高表达MUC1、KRT7、COL1A1、WFDC2等基因,其中COL1A1与WFDC2为首次在支气管腺瘤中发现的潜在生物标志物;通路富集分析显示,肿瘤与正常区域的DEGs显著富集在PI3K-Akt信号通路、ECM-受体相互作用、癌症中的蛋白聚糖等癌症相关通路,符合支气管腺瘤可能携带肺癌驱动基因突变的生物学特征;产品关联:实验所用关键产品:10× Genomics的Visium空间基因表达试剂盒。

4. Biomarker研究及发现成果解析

本研究在支气管腺瘤临床样本中识别的Biomarker按组织区域分为四类:肿瘤区域标志物、正常肺组织标志物、支气管区域标志物、血管区域标志物;筛选与验证逻辑为“stGCL空间域识别→差异表达基因分析→多维度验证(热图、UMAP、散点图)”,确保Biomarker的特异性与可靠性。

Biomarker的来源为支气管腺瘤患者的新鲜肿瘤组织10× Visium空间转录组样本,验证方法包括差异表达分析(Wilcoxon检验,FDR<1%)、UMAP可视化、基因表达热图、火山图与岭图展示;特异性与敏感性数据显示,肿瘤区域标志物COL1A1的表达水平显著高于正常区域(文献未明确提供具体统计值,基于图表趋势推测P<0.01),WFDC2在肿瘤区域的表达也呈现显著上调;正常区域标志物AGER、SFTPA2在正常肺组织中特异性高表达,支气管区域标志物GPNMB、APOC1与血管区域标志物GSTA1也分别在对应区域呈现特异性表达。

核心成果提炼:这些Biomarker的功能关联明确:MUC1、KRT7为已知的支气管腺瘤标志物,COL1A1参与肿瘤细胞的迁移、侵袭与增殖,WFDC2为肺癌早期诊断的潜在标志物;创新性在于首次在支气管腺瘤样本中发现COL1A1与WFDC2的差异表达,揭示其在支气管腺瘤发生发展中的潜在调控作用;统计学结果显示,差异表达基因的FDR<1%(n=4002),通路富集分析的关键通路均具有统计学显著性(文献未明确提供具体P值,基于分析标准推测P<0.05)。这些Biomarker的发现为支气管腺瘤的早期诊断、治疗靶点筛选提供了新的候选分子,也为解析支气管腺瘤与肺癌的关联机制提供了分子依据。

特别声明

1、本页面内容包含部分的内容是基于公开信息的合理引用;引用内容仅为补充信息,不代表本站立场。

2、若认为本页面引用内容涉及侵权,请及时与本站联系,我们将第一时间处理。

3、其他媒体/个人如需使用本页面原创内容,需注明“来源:[生知库]”并获得授权;使用引用内容的,需自行联系原作者获得许可。

4、投稿及合作请联系:info@biocloudy.com。