基因组研究长期面临一个难题:样本量、检测范围和成本,很难同时满足。基因分型芯片价格较低,适合开展大规模全基因组关联研究(genome-wide association study,GWAS),却可能遗漏芯片设计时未被纳入的变异;全外显子组测序(whole-exome sequencing,WES)擅长识别罕见编码变异,却看不到基因组的大部分区域;高深度全基因组测序(whole-genome sequencing,WGS)覆盖全面,但成本仍限制着超大规模应用。
7月8日,《Nature Genetics》的研究报道“A blended genome and exome sequencing method captures genetic variation in an unbiased and cost-effective manner”,研究人员提出混合基因组-外显子组测序(blended genome exome,BGE):在同一次测序中,同时获得低深度全基因组数据和高深度外显子组数据。它试图回答的,不只是“能不能少花钱”,而是一个更关键的问题:能否在成本下降的同时,尽可能保留不同类型遗传发现的能力?

基因分型芯片很便宜,但它看见的世界并不均匀
过去十多年,大量GWAS依赖基因分型芯片完成。芯片并不是逐个读取基因组中的全部碱基,而是检测预先选定的一组遗传位点,再利用基因型填充(genotype imputation)推断周围未直接检测的变异。
问题在于,芯片上放哪些位点,本身就带有历史积累形成的偏向。许多常用芯片优先收录了在欧洲祖源人群中较常见、研究较充分的遗传变异。对于非洲、拉丁美洲或复杂混合祖源人群,同一张芯片能够直接捕获的信息可能更少,后续填充准确性也更依赖参考人群是否具有代表性。
这意味着,一个技术平台即使在某些人群中表现良好,也未必能原样迁移到所有人群。所谓“遗传研究代表性不足”,并不只是样本来自哪些国家的问题,还可能发生在检测位点选择、参考单倍型构成和算法训练数据之中。
低深度全基因组测序(low-pass WGS)提供了另一种思路:不再预先决定检测哪些位点,而是用较低深度随机读取整个基因组,再通过参考Panel补全基因型。它对常见变异更少受到芯片位点设计的限制,但低深度数据难以可靠识别罕见变异,尤其是可能直接影响蛋白质功能的罕见编码变异。
于是,研究人员面临两类不同的需求:研究复杂性状,需要数量庞大的常见变异;寻找高影响风险基因,又需要高质量的罕见编码变异。BGE的设计,正是把这两类需求放入同一套实验流程。
一份DNA文库,拆成两条路线,再重新汇合
BGE并不是简单地分别做一次WES和一次WGS。
研究人员首先制备无PCR扩增的基因组文库(PCR-free library),随后取其中一部分进行PCR扩增和外显子捕获,形成富集外显子区域的文库;另一部分保留为全基因组文库。两部分完成定量和标准化后,以一定比例混合,再放入同一次测序运行。
研究团队经历了六轮方案调整。最初采用67%外显子文库加33%全基因组文库,平均获得29×外显子组和1.5×全基因组覆盖。外显子区域表现较好,但部分全基因组位点的填充一致性未达到预设目标。
最终确定的比例与最初相反:33%外显子文库加67%全基因组文库。在每条NovaSeq S4测序通道安排约64个样本时,每个样本可获得约30-40×的外显子组深度和1-4×的全基因组深度。
规模化阶段的平均结果为37×外显子组和2.5×全基因组覆盖,约96.37%的外显子靶区域达到至少10×深度,84.08%的靶区域达到至少20×深度。研究人员据此提出三项主要质控目标:每个样本获得超过9.5 Gb的有效数据;超过90%的外显子区域达到10×;落在外显子捕获区域及其附近的测序读段占10%-65%。
这里的关键并不是把两种数据机械地“拼在一起”,而是重新分配有限的测序资源:对需要直接检出的编码区域投入较高深度,对适合借助参考Panel推断的全基因组区域保留较低但连续的覆盖。
53,446个样本,检验的不是概念,而是规模化能力
一项测序方法在几十或几百个高质量样本中表现良好,并不等于它能稳定处理数万份来源复杂的样本。
研究团队将BGE应用于PUMAS项目,共测序53,446名参与者。样本来自美国、哥伦比亚、埃塞俄比亚、肯尼亚、南非和乌干达,包含非洲、非裔美国人、拉丁美洲人以及多种混合祖源人群。完成覆盖度、祖源、样本质量和遗传性别一致性等筛选后,保留47,264个样本,约占初始样本的88%。
不同样本来源确实造成了一些差异。以外显子覆盖不达标的比例计算,美国GPC队列的血液样本为0.04%,哥伦比亚Paisa队列为0.13%,主要使用唾液样本的NeuroGAP-Psychosis队列为0.48%。唾液中可能混入微生物DNA,也更难精确定量,因此表现略逊于血液。
但从整体看,各队列未达到外显子覆盖阈值的样本均不足1%,只有6个样本因平均全基因组深度低于1×而被剔除。各队列的编码区域平均检出率超过0.99,平均深度超过30×,平均基因型质量超过39。
这组结果说明,BGE的价值并不只体现在“一个样本能测出来”,而在于它已经经受了多地区、多祖源、多种样本采集方式以及数万例规模的检验。
全基因组只有几倍深度,为什么还能得到数千万个变异?
1-4×的全基因组深度,意味着每个位点平均只被少量读段覆盖,部分位置甚至完全没有读段。仅依靠直接观察,这样的数据显然不足以稳定判断每个人的基因型。
BGE使用GLIMPSE2进行低深度基因型填充,并采用由人类基因组多样性计划和千人基因组计划整合而成的HGDP+1kGP参考Panel。研究人员首先填充了超过6700万个双等位基因单核苷酸多态性(single-nucleotide polymorphism,SNP),经过填充质量INFO值不低于0.8的筛选后,仍有超过3000万个SNP进入一致性分析。
在具有BGE和Illumina Global Screening Array两类数据的参与者中,所有队列在各个次要等位基因频率(minor allele frequency,MAF)区间的聚合相关系数平方均超过90%。对于MAF不低于1%的变异,摘要报告的基因型一致性达到95%以上;对于MAF低于1%的变异,也达到90%以上。
按非参考等位基因一致性衡量,常见变异在所有队列中均不低于0.92;即使在MAF低于0.5%的最低频率区间,也不低于0.88。
更值得注意的是,外显子区域的低频变异通常表现得更好。原因并不神秘:BGE在外显子区域拥有30×以上的直接测序深度,而不是主要依赖填充。在部分非洲队列中,MAF为1%的外显子变异一致性已超过0.95;在Paisa队列中,同一频率水平的外显子变异一致性接近或超过0.99。相比之下,非编码变异往往要达到更高频率,才能获得相近的一致性。
因此,BGE的数据结构并不均匀,却是有意为之:罕见编码变异主要依赖高深度直接检出,常见全基因组变异主要依赖低深度测序与统计填充。
它还能看见拷贝数变异,但能力边界必须说清楚
高深度外显子组数据不仅可用于识别SNP和小片段插入缺失,还可能通过外显子读深变化推断拷贝数变异(copy number variant,CNV)。
研究人员使用400名来自100个四人家庭的样本进行验证,并以既往约30×深度WGS结果作为参照。对于跨越至少5个外显子的CNV,BGE的召回率为87%;如果只分析BGE外显子深度超过60×的样本,跨越5个外显子的CNV召回率达到100%。当CNV跨越至少3个外显子时,阳性预测值约为90%。
家庭结构还允许研究人员重点检查新发CNV(de novo CNV)。金标准WGS确认的11个新发CNV全部被BGE检出,而且没有额外预测出假阳性新发事件。
但这并不意味着BGE已经具备完整的结构变异检测能力。对于50 bp以上的插入,阳性预测值为79.31%,召回率只有23.04%;对于缺失,阳性预测值达到99.14%,召回率仍只有34.78%。
换句话说,BGE检出的部分结构变异可信度可以较高,但它会漏掉大量事件,尤其是罕见、非编码或复杂结构变异。高阳性预测值不等于高检出率。这是理解检测性能时经常被忽略的区别。
99美元与350美元之间,差的不只是价格
在79个同时具有BGE、基因分型芯片和30× WGS数据的样本中,研究人员直接比较了三种策略能够获得的变异数量。
对于MAF低于5%的罕见编码SNP,30× WGS识别出148,090个,BGE识别出140,310个,达到WGS的94.7%;芯片填充只获得40,863个,相当于27.6%。
对于MAF不低于5%的常见编码SNP,BGE获得55,373个,约为WGS所获58,630个的94.4%;芯片填充获得38,756个,约为66.1%。
在非编码区域,BGE与WGS仍存在明显差距,但继续优于芯片。对于罕见非编码SNP,BGE填充得到10,979,302个,相当于WGS的61.2%;芯片获得4,402,153个,相当于24.5%。对于常见非编码SNP,BGE获得7,656,832个,约为WGS的79.8%;芯片获得6,489,217个,约为67.6%。
论文采用的基础实验室成本为:Illumina GSA芯片每个样本65美元,BGE为99美元,30× WGS为350美元。BGE约为深度WGS成本的28%,但需要强调,这些数字不包括DNA提取、数据存储、项目管理和生物信息分析等费用。
因此,BGE并不是“用28%的钱得到100%的WGS”。更准确的理解是:它用接近芯片加外显子组的数据能力,换取远低于深度WGS的测序成本和更统一的实验流程。
BGE不是低价版深度WGS。它的优势在于,以较低成本同时覆盖常见全基因组变异与罕见编码变异;它的边界则在于,罕见非编码变异与复杂结构变异仍无法被充分捕获。
所谓“无偏”,仍然取决于参考Panel里有哪些人
低深度WGS相较芯片的优势之一,是测序位点不是由预设探针决定的。但从读段推断完整基因型时,BGE仍离不开参考单倍型Panel。
在具有近期混合祖源的Paisa和GPC队列中,常见变异在不同局部祖源背景下的填充准确率均超过90%。但在低频变异中,差异仍然存在。Paisa队列中的美洲原住民相关祖源片段,准确性低于欧洲和非洲祖源片段;GPC队列中,非洲祖源片段的部分低频变异表现也略低于欧洲祖源片段。不同祖源之间的聚合准确性差异通常不足10%,但并没有完全消失。
研究人员认为,这与参考Panel中部分祖源单倍型数量不足有关。低深度测序减少了芯片设计带来的位点偏差,却不能自动消除参考数据库不均衡造成的统计偏差。
因此,BGE对人群公平性的意义,不在于宣布偏差已经解决,而在于改变了限制因素:过去的瓶颈主要是“芯片上有没有这个位点”,现在更集中于“参考Panel中有没有足够相似的单倍型”。
BGE会取代深度全基因组测序吗?
从这项研究的数据看,答案是否定的。
当研究目标是完整发现罕见非编码变异、复杂结构变异、重复扩增、移动元件插入或新发结构事件时,1-4×低深度WGS无法替代30×甚至更高深度的WGS。BGE的外显子捕获也意味着,大量非编码区域仍主要依靠填充,而不是直接、稳定地完成基因型判定。
BGE更适合另一类问题:样本量达到数万乃至数十万,需要同时研究常见变异、罕见编码变异和部分外显子CNV,但预算不足以支持所有样本开展深度WGS。精神疾病遗传学、复杂性状研究、药物靶点发现和跨祖源GWAS,都可能从这种设计中受益。
它提供的不是“最全面的数据”,而是一种经过计算的取舍:把高深度留给当前更容易解释、效应可能更大的编码区域,把低深度覆盖扩展至全基因组,再利用群体单倍型结构恢复常见变异。
下一代大队列,或许不再执着于一种测序深度
这项研究最值得关注的,并不是33%与67%这一具体比例。随着测序价格、捕获试剂、参考Panel和填充算法变化,最佳比例很可能继续调整。
更重要的启示是,基因组数据生成未必只能在“芯片、外显子组或深度全基因组”中三选一。测序深度可以根据不同变异类型的信息价值进行分配,实验设计也可以围绕研究目标重新组合。
BGE以约28%的深度WGS基础成本,保留了约94%的常见和罕见编码SNP,并在多祖源人群中获得较高的常见变异填充准确性。与此同时,它对罕见非编码变异和结构变异仍有明确缺口。
这也提出了一个值得持续思考的问题:在大规模遗传研究中,我们追求的究竟是每个样本都达到最完整的测序深度,还是在固定预算下,让整个队列获得最大的有效遗传信息?
未来决定研究产出的,或许不只是“测了多少深度”,而是研究人员是否清楚:哪些变异必须被直接看见,哪些信息可以可靠推断,以及哪些盲区不能被统计方法掩盖。
参考文献
Boltz TA, Chu BB, DeFelice M, Liao C, Sealock JM, Ye R, Goldstein JI, Majara L, Fu JM, Service SK, Zhan L, Medland SE, Chapman SB, Rubinacci S, Grimsby JL, Abebe T, Alemayehu M, Ashaba FK, Atkinson EG, Bigdeli TB, Bradway AB, Brand H, Chibnik LB, DeLuca S, Diaz-Zuluaga AM, Fekadu A, Gatzen M, Gelaye B, Gichuru S, Gildea ML, Hill TC, Huang H, Hubbard KM, Injera WE, James R, Joloba M, Kachulis C, Kalmbach PR, Kamulegeya R, Kigen G, Kim S, Koen N, Kwobah EK, Kyebuzibwa J, Lee S, Lennon NJ, Lind PA, Lopera-Maya EA, Makale J, Mangul S, McMahon J, Mowlem P, Musinguzi H, Mwema RM, Nakasujja N, Newman CP, Nkambule LL, O'Neil CR, Olivares AM, Olsen CM, Ongeri L, Parsa SJ, Pretorius A, Qin S, Ramesar R, Reagan FL, Sabatti C, Schneider JA, Shiferaw W, Stevens C, Stevenson A, Stricker E, Stroud RE 2nd, Tang J, Townsend M, Whiteman D, Yohannes MT, Yu M, Yuan K; NeuroGAP-Psychosis Study; Akena D, Atwoli L, Kariuki SM, Koenen KC, Newton CRJC, Stein DJ, Teferra S, Zingela Z, Pato CN, Pato MT, Lopez-Jaramillo C, Freimer NB, Ophoff RA, Olde Loohuis LM, Talkowski ME, Neale BM, Howrigan DP, Martin AR. A blended genome and exome sequencing method captures genetic variation in an unbiased and cost-effective manner. Nat Genet. 2026 Jul 8. doi: 10.1038/s41588-026-02669-w. Epub ahead of print. PMID: 42420521.
声明:本文仅用于分享,不代表平台立场,如涉及版权等问题,请尽快联系我们,我们第一时间更正,谢谢!










