1. 领域背景与文献
文献英文标题:HiChew and snHiChew: efficient chromatin conformation capture methods with post-PCR methylation-based enrichment;
发表期刊:文献未明确提供;影响因子:未公开;研究领域:三维基因组学、染色质构象捕获技术
染色质构象捕获技术是解析三维基因组结构与基因表达调控关系的核心工具,2009年传统Hi-C技术的建立实现了全基因组染色质相互作用图谱的绘制,推动了三维基因组学的快速发展。2015年单细胞Hi-C技术问世,解决了细胞异质性问题,但初代方法存在平末端连接效率低、生物素富集导致DNA大量损失的缺陷。随后领域内发展出两类单细胞Hi-C方法:富集型方法(如snHi-C)通过生物素富集连接产物,有效对比例高但灵敏度不足;非富集型方法(如Dip-C)省略富集步骤,避免了DNA损失但有效对比例仅8-15%,约90%测序数据为无效数据,成本极高;DLO Hi-C通过接头序列富集连接产物,减少了DNA损失,但需要两次接头连接,连接成功率降低。当前领域的核心问题是缺乏一种既能保持高灵敏度、减少DNA损失,又能提高有效数据比例、降低测序成本的染色质构象捕获方法。本研究针对这一问题,开发了HiChew和snHiChew方法,采用PCR后甲基化标记连接疤痕并富集的策略,结合高效粘性末端连接,实现了效率与灵敏度的平衡。
2. 文献综述解析
作者将现有单细胞染色质构象捕获方法分为富集型和非富集型两类,系统评述了各类方法的优势与局限性,明确了领域内未解决的核心矛盾——富集效率与数据灵敏度的平衡问题。
富集型方法以snHi-C为代表,通过生物素标记连接末端,经链霉亲和素富集连接产物,有效对比例可达70-90%,但生物素富集过程会导致大量DNA损失,尤其在单细胞样本中,DNA起始量极低,损失后有效数据量进一步减少,灵敏度不足。非富集型方法以Dip-C为代表,省略富集步骤,直接对全基因组连接产物进行测序,避免了富集导致的DNA损失,能捕获更多低丰度染色质相互作用,但由于大部分测序reads来自未连接的基因组DNA,有效对比例仅8-15%,测序资源浪费严重,成本高昂。DLO Hi-C方法通过在连接片段间插入含酶切位点的接头,经MDA扩增后酶切富集连接产物,减少了DNA损失,但需要两次接头连接步骤,连接成功率降低,且接头序列设计复杂。
通过对比现有研究的未解决问题,本研究的创新价值凸显:首次提出PCR后甲基化标记连接疤痕的富集策略,在PCR扩增后用dam甲基转移酶标记DpnII酶切产生的GATC连接疤痕,再通过m6A抗体免疫沉淀富集连接产物,既避免了预富集导致的DNA损失,又大幅提高了有效数据比例;同时采用DpnII酶切产生粘性末端进行近端连接,连接效率远高于平末端连接,进一步提升了方法的整体效率。与现有方法相比,HiChew的有效对比例约50%,是Dip-C的4-6倍,同时保持了与Dip-C相当的文库复杂度和灵敏度,解决了领域内长期存在的效率与灵敏度难以兼顾的问题。
3. 研究思路总结与详细解析
本研究的整体目标是开发高效、灵敏的染色质构象捕获方法,涵盖bulk和单细胞两个版本;核心科学问题是如何在不损失DNA的前提下,提高测序数据中的有效染色质相互作用比例;技术路线遵循“方法建立→性能验证→生物学应用”的闭环逻辑:首先建立HiChew方法,验证其在bulk样本中的效率和准确性;然后开发单细胞版本snHiChew,验证其在单细胞水平的性能;最后将snHiChew应用于生物学问题研究,揭示B区室染色质构象与基因表达的关联,以及在组织样本中的适用性。
3.1 HiChew方法原理与建立
实验目的是建立一种高效的染色质构象捕获方法,解决现有方法效率与灵敏度的矛盾。方法细节为:样本经甲醛和EGS双重固定以稳定染色质结构,采用DpnII酶切基因组DNA产生GATC粘性末端,进行近端连接形成GATC连接疤痕;随后根据DNA量选择接头连接或Tn5转座的方式构建文库,PCR扩增后用dam甲基转移酶标记连接疤痕的GATC序列为m6A,再用m6A抗体进行免疫沉淀富集连接产物,最后进行测序分析。实验所用关键产品:ABclonal的T4 DNA连接酶(货号RK21500)、Merck的抗N6-甲基腺苷(m6A)抗体(货号ABE572-I-100UG)、NEB的DpnII酶(货号R0543L)。结果解读显示,HiChew的工作流程包含7个关键步骤,通过PCR后甲基化富集,有效避免了预富集导致的DNA损失,同时粘性末端连接提高了连接效率,为后续性能验证奠定了基础。
3.2 bulk HiChew性能验证
实验目的是验证HiChew在bulk样本中的效率、灵敏度和准确性。方法细节为:以HEK293T细胞为样本,设置50、500、5000三个细胞输入量,与Dip-C方法平行比较;通过HiC-Pro分析有效对比例、文库复杂度、染色质相互作用图谱与传统Hi-C的一致性。结果解读显示,HiChew的有效对比例约50%(n=2,P<0.001),是Dip-C的4-6倍;饱和分析显示,HiChew在50细胞样本中可产生约35M独特有效相互作用,与Dip-C的32M相当,说明其文库复杂度与Dip-C一致,灵敏度未受影响;染色质相互作用图谱分析显示,HiChew与传统Hi-C在A/B区室(特征值相关系数0.87)、拓扑关联结构域(绝缘分数相关系数0.86)、染色质环(富集分数4.84 vs 5.02)等水平均高度一致,证明HiChew能准确捕获染色质构象。
3.3 snHiChew方法建立与性能验证
实验目的是开发适用于单细胞的snHiChew方法,验证其在单细胞水平的效率、准确性和分辨率。方法细节为:在HiChew基础上,增加HpyCH4V酶切连接产物、dA加尾、96孔板一级条码连接、分池后二级条码PCR标记的步骤,实现单细胞条码标记;采用HEK293T与NIH/3T3细胞混合物验证细胞鉴定准确性,与Dip-C、snHi-C方法比较有效对比例、文库复杂度、分辨率等指标。结果解读显示,snHiChew的双重条码标记策略可实现最多147456个细胞的标记,细胞碰撞率约6%;有效对比例达45-50%,显著高于Dip-C的12-20%,且文库复杂度与Dip-C相当,饱和点远高于snHi-C;在500000有效对/细胞的情况下,snHiChew可实现约70%的5kb bin覆盖率和80%的10kb bin覆盖率,分辨率显著高于其他方法;伪bulk分析显示,snHiChew与传统Hi-C在A/B区室(相关系数0.86-0.91)、拓扑关联结构域(相关系数约0.80)等水平高度一致,证明其能准确捕获单细胞染色质构象。
3.4 基于snHiChew的B区室染色质构象与基因表达关联研究
实验目的是利用snHiChew的高分辨率优势,揭示B区室(异染色质区)中染色质构象与基因表达的关联。方法细节为:对1200个HEK293T细胞进行snHiChew测序,计算单细胞拓扑关联结构域绝缘分数,通过层次聚类区分融化状态(绝缘分数低,TAD结构松散)和凝固状态(绝缘分数高,TAD结构紧密)细胞;结合RNA-seq数据,分析两种状态下基因表达的差异。结果解读显示,在B区室的长基因CNTNAP2所在区域,融化状态细胞的绝缘分数显著低于凝固状态细胞(KS检验D=0.294,P<0.001),且CNTNAP2的表达水平与融化程度正相关(Pearson相关系数0.773);三维建模显示,融化状态细胞中该区域染色质距离核膜的距离约为凝固状态的2倍,提示染色质向核内活跃区域迁移;RNA聚合酶II ChIA-PET数据显示,活跃转录的基因区域TAD边界消失,进一步证明转录过程中TAD结构松散。
3.5 CTCF敲低与转录抑制对染色质构象的影响
实验目的是验证CTCF和转录过程对B区室染色质构象的调控作用。方法细节为:构建CTCF敲低的HEK293T细胞系,对野生型和CTCF敲低细胞进行snHiChew测序,分析融化状态细胞比例的变化;用雷公藤内酯醇(triptolide)处理HEK293T细胞抑制转录,分析处理后融化状态细胞比例的变化;结合RNA-seq数据验证基因表达的变化。结果解读显示,CTCF敲低后,B区室中融化状态细胞比例从27%增加到45%,KS检验显示绝缘分数分布差异显著增大(D=0.434,P<0.001),且CNTNAP2等长基因的表达水平显著上调;转录抑制后,融化状态细胞比例从39%降低到23%,绝缘分数显著升高,证明CTCF维持B区室TAD结构的稳定性,转录过程促进TAD结构松散(融化)。
3.6 snHiChew在睾丸组织精子发生中的应用
实验目的是验证snHiChew在复杂组织样本中的适用性,揭示精子发生过程中染色质构象的变化。方法细节为:分离小鼠睾丸组织中的精子发生细胞,进行snHiChew测序,通过UMAP聚类区分精母细胞/精原细胞(二倍体)和圆形精子细胞(单倍体),分析两类细胞的染色质构象差异。结果解读显示,snHiChew在睾丸组织样本中的有效对比例约40%,是Dip-C的3倍;UMAP聚类可清晰区分二倍体和单倍体细胞,圆形精子细胞的trans/cis比例显著高于精母细胞/精原细胞,染色质相互作用以短距离为主,符合精子发生过程中核浓缩的特征;伪bulk分析显示,snHiChew与传统bulk Hi-C的A/B区室特征值相关系数达0.93,证明其能准确捕获组织样本中细胞的染色质构象。
4. Biomarker研究及发现成果
本研究中涉及的Biomarker为单细胞染色质绝缘分数(反映拓扑关联结构域的稳定性),通过snHiChew数据筛选并验证其与B区室基因表达的关联,揭示了染色质构象动态变化在基因调控中的作用。
Biomarker定位:Biomarker类型为染色质结构特征Biomarker(单细胞绝缘分数),筛选/验证逻辑为:基于snHiChew数据计算每个单细胞的基因组50kb bin绝缘分数→通过层次聚类将细胞分为融化状态(绝缘分数低)和凝固状态(绝缘分数高)两类→采用Kolmogorov-Smirnov检验验证两类细胞绝缘分数分布的差异→结合RNA-seq数据分析绝缘分数与基因表达的相关性。
研究过程详述:Biomarker来源为HEK293T细胞、GM12878细胞、小鼠睾丸组织细胞的snHiChew测序数据;验证方法包括层次聚类、Kolmogorov-Smirnov检验、Pearson相关分析;特异性与敏感性:在HEK293T细胞的B区室长基因区域,融化状态细胞与凝固状态细胞的绝缘分数分布差异显著(KS检验D=0.294,P<0.001),绝缘分数与基因表达水平呈负相关(Pearson相关系数-0.773,即融化程度与基因表达正相关);在CTCF敲低细胞中,该差异进一步增大(D=0.434,P<0.001),证明Biomarker能有效反映染色质构象的变化。
核心成果提炼:首次在单细胞水平揭示B区室中拓扑关联结构域的融化状态(绝缘分数降低)与长基因激活的正相关关系,CNTNAP2在CTCF敲低细胞中表达上调1.5倍(P<0.05);创新性在于利用snHiChew的高分辨率和高灵敏度,在单细胞水平捕捉到染色质构象的动态变化与基因表达的关联,为异染色质区基因表达调控机制提供了新的证据;统计学结果显示,绝缘分数与基因表达的Pearson相关系数为-0.773(n=751,P<0.001),CTCF敲低后融化状态细胞比例从27%升至45%(n=415,P<0.001)。