鸟类基因组给测序技术带来了独特的挑战。与哺乳动物基因组不同,鸟类基因组包含数十条微小的微型染色体、更小的"点状染色体"以及大量短读长测序仪无法解析的重复DNA序列 。此前,最小的11条染色体根本无法完整拼装;早期的参考基因组布满缺口,掩盖了真实的基因信息 。
为了克服这些障碍,由埃里希·贾维斯(Erich Jarvis)实验室领衔的洛克菲勒团队综合运用了PacBio HiFi和Oxford Nanopore等多种长读长测序平台 。他们发现重复DNA序列会堵塞测序孔,于是开发了在测序运行过程中反复清理测序孔的实验流程。此外,研究人员还逐条染色体进行人工校验,关闭了每一个剩余的缺口 。
最终成果是一个完全定相的双倍体基因组——即能够区分来自父母双方的DNA信息——以及一个端粒到端粒(T2T)的完整拼装版本,每条染色体从头到尾完整无断裂 。
新的拼装版本揭示了2710个此前未知的基因,其中972个编码蛋白质 。一个引人注目的例子是:科学家们一直以为斑胸草雀缺少一个参与神经细胞通讯的基因,而实际上这个基因就"藏"在第31号染色体上——这是一条充满高度重复序列的微小染色体,此前无人能够完整拼装 。
完整基因组还首次解析了雌性特有的W染色体,这条染色体83%由重复DNA构成,此前约有三分之一的序列从未被成功拼装。这一突破意义重大,因为Z和W性染色体上富集了与发声学习性别差异相关的基因(受雌激素调控),如今这些基因终于可以被直接测试研究 。
最出人意料的发现之一涉及着丝粒——细胞分裂时连接姐妹染色单体的结构。团队发现斑胸草雀每条染色体的着丝粒都有一个716碱基对的重复序列,其中包含与人类CENP-B蛋白停靠位点高度相似的基序 。他们还找到了一种候选结合蛋白,其来源与赋予哺乳动物CENP-B的古老移动DNA家族同源,这表明鸟类与哺乳动物共享的着丝粒组织结构比以往认为的更为有序 。
研究人员认为,这些微型染色体的结构可能反映了脊椎动物基因组的祖先结构,为了解数亿年来基因组如何演化提供了新的线索 。
斑胸草雀通过聆听和模仿来学习鸣叫——这一行为使其成为研究语言和发声学习生物学的首选动物模型 。随着完整基因组的问世,斑胸草雀成为继人类之后第二种拥有完整参考基因组的发声学习物种 。
洛克菲勒大学语言神经遗传学实验室主任埃里希·贾维斯指出,如果发声学习物种与非发声学习物种之间确实存在某种关键分子差异,"它一定就在基因组的某处"——而现在完整基因组使直接研究这些基因成为可能 。
除了推动发声学习研究,这项工作还为比较脊椎动物基因组学提供了关键的参考基准。多年来,研究人员一直在争论某些基因是否在鸟类中真正消失了,还是仅仅因为基因组拼装不完整而未被发现。新的基因组解决了这些疑问,帮助区分了真实的演化缺失与拼装技术造成的假象 。
斑胸草雀的T2T基因组是脊椎动物基因组计划(Vertebrate Genomes Project)为数千种脊椎动物物种构建完整基因组这一更宏大目标的一部分 。随着越来越多T2T拼装版本的问世,研究人员将能够对基因组演化、发声学习以及复杂行为的遗传基础提出更精确的问题。
就目前而言,这一新的参考基因组为科学家探索鸣叫学习的遗传基础——并由此探究人类语言的演化——提供了强有力的工具。