导语
长期以来,临床上一个生物标志物往往对应一次免疫检测;一次抽血测上三五个蛋白,已经算得上"套餐"。而过去三年,一类以"千"为单位的高通量血浆蛋白质组学平台,把同一份血浆里的近三千个蛋白一次性读出。真正让这件事从"技术演示"变成"研究基础设施"的,是英国生物样本库药企蛋白质组学计划(UK Biobank Pharma Proteomics Project,UKB-PPP)。2026 年,基于这套数据的疾病风险评分与药靶发现开始成批出现——它正在改变生物标志物从发现到验证的整条路径。
一、UKB-PPP 究竟做了什么
- 由 13 家跨国药企与 UK Biobank 合作,使用 Olink Explore 平台测量了 54,219 名参与者的血浆蛋白质组,覆盖约 2,923 个蛋白、横跨主要生物学通路。
- 2023 年 10 月,两篇论文同期发表于《自然》(Nature):
- Sun 等(Nature 622:329–338)构建血浆蛋白的遗传图谱,鉴定 14,287 个蛋白数量性状位点(pQTL),其中约 81% 为首次发现;约 83% 的被测蛋白至少有一个 pQTL,约 67% 存在 cis 关联(遗传变异位于该蛋白编码基因附近)。
- Dhindsa 等(Nature, 2023)在 49,736 人上分析罕见编码变异,发现 5,433 个罕见基因型—蛋白关联,其中约 81% 未被同队列的全基因组关联研究(GWAS)检出;STAB1、STAB2 成为多效性位点,分别关联 77 个和 41 个蛋白。
- 数据开放:汇总统计(summary statistics)通过 Synapse(syn51364943)与 AWS Open Data 向全球研究者开放。
在 UKB-PPP 之前,血浆蛋白组学更多是"单中心、小样本、一次测几十到几百个蛋白"的模式。样本量小意味着统计效能不足,平台不统一意味着研究之间难以互相比较,而最关键的一点是:找到的蛋白与疾病之间往往只是相关,无法判断谁先谁后。UKB-PPP 把规模、标准化与遗传学工具同时补上,才让"大规模蛋白因果推断"真正成为可能。
通俗解释:cis-pQTL 可以理解为"这个蛋白的天然旋钮"——因为变异就落在它自己的基因上,用它做孟德尔随机化(Mendelian randomization,MR),就能在不做临床试验的前提下,近似推断"把药物靶点调低或调高会产生什么后果"。
二、为什么 pQTL 对药企重要
- 因果方向的检验:孟德尔随机化把遗传变异当作"天然的随机分组",以 cis-pQTL 为工具变量,检验"蛋白水平→疾病"的因果方向,可在立项阶段筛掉伪靶点,为靶点验证补上一份人类遗传学证据。
- 检测特异性的佐证:cis-pQTL 的存在,反过来也支持"确实测对了这个蛋白",对抗体类检测的特异性验证很有价值。
- 通路扰动与互作:trans-pQTL(变异远离该蛋白编码基因)能揭示蛋白—蛋白互作与通路扰动,例如 ABO 血型对消化道组织富集蛋白的远端影响。
- 外推到更多终点:Sun 等以 PCSK9 等靶点为例,说明遗传代理的蛋白效应可以外推到更多临床终点,模拟药物靶点在试验中的表现。
- 一条可复用的发现流水线:同一位点既有 cis-pQTL、又能在前瞻队列中重复出与疾病的关联,这样的蛋白才是最有希望进入检测开发或药物立项的候选。UKB-PPP 提供的是这条流水线的起点样本量与公开工具。
三、2026 年:从"关联"到"能用的评分"
这套资源的价值,正体现在把它当作基础设施的具体研究上。
- 心脏性猝死:在 52,705 人、1,459 个血浆蛋白上,用 lasso 惩罚的 Cox 回归构建了由 64 个蛋白组成的风险评分(含 LTBP2、PTPRS、SPON1)。评分每升高 1 个标准差,猝死风险 HR 为 2.60(95% CI 2.12–3.18);在临床风险因素基础上加入该评分,C-index 提升 0.063(95% CI 0.037–0.105),10 年 5% 风险阈值下风险重分类达 16.9%。(Heart Rhythm, 2026-03-02)
- 青光眼:以 2,923 个蛋白做孟德尔随机化与贝叶斯共定位,识别 26 个与青光眼存在潜在因果关联的血浆蛋白,其中 6 个为新发现(COL24A1、KAZALD1、EBAG9、CSNK1D、AZI2、AXIN1);EFEMP1 在前瞻队列中与发病显著相关(HR 1.61,95% CI 1.29–2.00)。(IOVS, 2026-02-02)
- 肺癌早筛:用机器学习对蛋白基因组数据建模,诊断前 0–4 年的 AUC 中位数为 0.85–0.88、5–9 年为 0.81–0.84;识别 22 个疾病相关蛋白,其中 14 个已有文献支持(含 CEACAM5、CXCL17、GDF15、WFDC2)。(Communications Medicine, 2026-03-13)
- 性别差异:在脂质代谢性状上做性别特异的孟德尔随机化,发现 83 个仅女性显著、82 个仅男性显著的因果关联,其中 46% 在混合性别分析中无法检出。(Biology of Sex Differences, 2026)
把这几项研究放在一起看,会发现一个共同的方法学骨架:先用大规模蛋白组数据找出候选,再用孟德尔随机化或共定位判断因果方向,最后在前瞻队列中验证预测能力。蛋白组数据在这里扮演的角色是双重的——既是"发现工具",也是"因果证据"。
四、三条技术路线怎么选
- Olink PEA(邻近延伸分析):抗体对结合寡核苷酸读出,特异性好,且有大量 cis-pQTL 佐证,适合大队列与靶向面板。
- SomaScan(适配体):通量高、动态范围宽,适合发现阶段,但需留意适配体特异性与平台间可比性。
- 质谱(如 DIA 数据非依赖采集):无偏,可发现新蛋白与翻译后修饰,深度与通量的权衡仍是主要矛盾,但近年通量提升明显。
- 实操建议:① 用同一平台、同批次参考样本做跨批归一化;② 发现阶段用高通量平台,验证阶段换到靶向免疫分析(如单分子免疫分析);③ 报告结果时同时给出效应量与置信区间,避免只讲 P 值;④ 关注样本采集与保存时间对蛋白稳定性的影响。
需要提醒的是,不同平台测到的蛋白集合并不完全重合。同一份血浆用 PEA 与适配体平台测量,结果往往存在系统性差异,这既来自抗体/适配体的亲和特性,也来自各自的归一化策略。做跨平台整合时,最好保留平台标识,不要默认数值可以直接比较。
五、结论
- 对生物标志物与 IVD 团队:值得把 UKB-PPP 的公开汇总统计当作立项前的"因果预筛"资源——先用孟德尔随机化判断靶点方向,再决定是否投入检测开发,可以少走弯路。
- 对药企研发:蛋白质组学正在从"组学描述"变成"人类遗传学证据的一部分",与孟德尔随机化联用,有望提高靶点成功率。
- 对 CRO/CDMO 与检测服务方:市场对大队列蛋白质组学的需求,正从单纯的"测序/检测服务"走向"检测+分析+遗传学解释"的打包交付。能把 pQTL 分析与孟德尔随机化解释写进交付物的团队,议价能力更强。
- 仍存的边界:孟德尔随机化的因果假设、不同平台间的可比性,以及从风险评分到临床效用之间,那道必须靠前瞻试验跨过的门槛。
参考资料
- Sun BB, Chiou J, Traylor M, et al. Plasma proteomic associations with genetics and health in the UK Biobank. Nature 622, 329–338 (2023). https://doi.org/10.1038/s41586-023-06592-6
- Dhindsa RS, Burren OS, Sun BB, et al. Rare variant associations with plasma protein levels in the UK Biobank. Nature (2023). https://doi.org/10.1038/s41586-023-06547-x
- Park H, Kim D, Jang E, et al. Proteomic signatures for sudden cardiac death and related intermediate phenotypes. Heart Rhythm (2026). https://doi.org/10.1016/j.hrthm.2026.02.039
- Xu J, Gao Y, Yu J, et al. Large-Scaled Proteomics Analysis for Glaucoma: Integrated Genetics, Multi-Omics, UK Biobank and Therapeutic Analysis. Investigative Ophthalmology & Visual Science 67(2):4 (2026). https://doi.org/10.1167/iovs.67.2.4
- Machine learning-based proteogenomic data modeling identifies circulating plasma biomarkers for early detection of lung cancer. Communications Medicine (2026). https://doi.org/10.1038/s43856-026-01500-1
- Zanetti D, et al. Exploring sex-specific causal links between thousands of proteins and lipid metabolism using the UK Biobank Pharma Proteomics Project data. Biology of Sex Differences (2026). https://doi.org/10.1186/s13293-026-00934-5
- UK Biobank Pharma Proteomics Project 开放数据资源. https://registry.opendata.aws/ukbppp/
本文引用的论文数据均来自公开摘要与期刊信息,具体数值以原文为准;不构成投资建议。