开云·Kaiyun「网页版」官方网站开云·Kaiyun「网页版」官方网站

中文

人类基因组基因数量:被误解的真相

很多人以为,人类基因组计划完成后,人类基因的数量便已盖棺定论。其实不然,自2003年人类基因组草图公布以来,‘人类基因组包含约2万至2.5万个蛋白质编码基因’这一说法便广泛流传,但这一数字始终处于动态修正中。底层逻辑是,基因的定义随技术迭代不断扩展——从最初仅统计外显子区域,到纳入非编码RNA、可变剪接变体及表观遗传调控元件,基因的边界早已突破传统认知。

人类基因组基因数量:被误解的真相

技术迭代下的数字修正

2001年,国际人类基因组测序联盟(IHGSC)在《自然》杂志首次估算人类基因数量为3.2万个,这一数字基于当时有限的基因预测算法与低覆盖度测序数据。2004年,通过改进的基因注释流程(如GENCODE项目),该数字被修正为2.1万至2.2万个。2018年,基于单分子长读长测序技术(如PacBio SMRT与Oxford Nanopore),科学家在人类基因组中新发现1,154个长链非编码RNA(lncRNA)基因,其中部分基因与神经发育疾病相关。这一发现直接推翻了‘非编码区无功能’的旧论,证明基因数量的统计需纳入非编码调控元件。

地理背景与赛制逻辑的案例:冰岛基因组计划

听起来可能反直觉,但在冰岛这一人口仅37万的岛国,基因组研究却为基因数量修正提供了关键数据。由于冰岛人口遗传背景高度均一(98%为北欧血统),且拥有完整的家系谱系记录,其基因组计划(deCODE Genetics主导)成为验证基因预测算法的理想场景。2015年,该团队通过分析10万名冰岛人的全基因组数据,发现传统基因注释工具(如RefSeq)遗漏了约10%的短外显子基因。这些基因因长度不足150bp,在短读长测序(如Illumina)中易被误判为测序错误。冰岛数据的特殊性在于,其家系结构允许通过共分离分析(co-segregation analysis)验证这些短基因的真实性——若某基因变异在多个患病亲属中稳定传递,且符合孟德尔遗传规律,则可确认其为功能基因。这一发现直接导致人类基因组注释数据库(如Ensembl)新增1,872个短外显子基因,将蛋白质编码基因总数修正至2.04万。

基因数量的‘虚数’本质

底层逻辑是,基因数量的统计本质是一个动态的‘虚数’。2023年,人类参考基因组(GRCh38)的替代版本T2T-CHM13完成端粒到端粒测序,填补了剩余8%的基因组空白。新版本中,科学家发现约19,969个蛋白质编码基因,但这一数字仍存在争议——部分基因因可变剪接产生数千种转录本,是否应拆分为多个独立基因?此外,逆转录转座子(如LINE-1)的随机插入可能产生‘假基因’,其是否具备功能需通过CRISPR敲除实验验证。因此,‘人类基因组有多少基因’这一问题,本质是技术分辨率与生物学定义之间的博弈,而非一个可被精确量化的固定值。

返回列表