中英研究团队合作建立基因组浅层测序精准鉴定维管植物物种新方案

昆明植物研究所 曾春霞,周梦媛 2026-08-17

2003年加拿大科学家Paul Hebert提出DNA条形码概念以来,植物物种鉴定经历了从标准DNA条形码(以下简称“标准条形码”)到细胞器条形码的范式转变。目前,rbcL、matK、trnH-psbA和ITS等标准条形码凭借通用引物适配性强和Sanger测序成本低的优势,有效支撑了植物物种的快速准确鉴定,并广泛应用于生物多样性保护、监测,以及药用植物溯源、司法鉴定和海关执法中。不过,在面对近缘种、杂交频繁和近期辐射演化的复杂类群时,标准条形码序列因变异度不足,往往分辨率不够,难以满足精准鉴定的需求。随着高通量测序技术的发展,基于基因组浅层测序技术(genome skimming)获取质体全基因组(细胞器条形码或“超级条形码”)的策略使得不少“困难类群”的物种鉴别率得到显著提升,但质体基因组常因单亲遗传的固有局限使其在面对杂交渐渗类群或样品时存在盲区。近年来,基因组学的发展推动了大量核基因组数据的获取,其中“被子植物353”(Angiosperms353)探针集与目标富集测序的应用受到关注,但文库构建与靶标富集流程繁琐、测序成本偏高,很大程度上限制了其在物种鉴定和监测中的规模化应用。

近日,中国植物DNA条形码研究团队联合英国爱丁堡皇家植物园在国际植物学期刊New Phytologist发表了题为Plant species identification by genome skimming across the vascular plant tree of life的研究成果。该研究选取石松类、蕨类、裸子植物和被子植物代表性类群共32属(或属下等级)475种1969份样本,系统分析和评估了基因组浅层测序数据特别是基于k-mer分析在维管植物物种鉴定中的潜力,提出了一套可推广的标准流程(图1)。

图1 通过基因组浅层测序数据获取标准DNA条形码、质体全基因组和基于k-mer分析开展物种鉴定的分析流程

研究表明,在目标类群中,标准条形码仅能区分约49.3%的物种,其中6个属鉴别率低于25%;基因组浅层测序数据组装的质体全基因组使鉴别率提升至57.6%。进一步基于浅层测序数据的k-mer分析则可将物种鉴别率提升至66.8%,较标准条形码整体鉴别效率提高17.5%(图2)。研究表明,通过该技术流程充分挖掘和利用基因组浅层测序数据的优势,既能兼容现有标准条形码数据库(如BOLD, GenBank),还可以显著突破近缘种鉴定困难的瓶颈。通过评估基因组大小对k-mer分析的影响表明,在使用约2 Gb的基因组浅层测序数据时,基因组小于和等于5 Gb的类群中(23/32属,测序深度大于等于0.5X),Skmer的物种鉴定率均不低于标准条形码和质体全基因组(除水麻属外);在基因组大于 5 Gb的类群中(测序深度小于0.5X),通过在红豆杉属和四照花属中进一步评估数据量对Skmer分析的影响后,发现个体间数据量的均一性对分析结果的准确性有显著影响,特别是对测序深度较低的类群(图3),推荐对同一分析中所有个体的数据量进行均一化后再开展k-mer分析。综上,该研究明确了利用基因组浅层测序可显著提升物种鉴定能力,为完善植物DNA条形码参考数据库,支撑全球生物多样性研究提供了一套可复制的解决方案。

图2 不同数据集在32个不同基因组大小的属(或属下次级区分等级)中物种鉴别率的比较。(a)各数据集物种鉴别成功率分布。(b)被成功鉴定的物种绝对数量或百分比差异显著性评估。(c)标准条形码、质体基因组+ITS及Skmer的物种鉴别率统计。(d)基于alignment-free与alignment-based方法的鉴别率差异。基线上方柱为Skmer比其它方法鉴别成功率提升的百分比,下方为降低的百分比。

该研究由中国科学院昆明植物研究所、山东农业大学、英国爱丁堡皇家植物园发起,联合中国科学院西双版纳热带植物园、广西师范大学以及英国爱丁堡大学等多个研究团队通力合作完成。昆明植物研究所曾春霞博士和周梦媛博士为论文共同第一作者,李德铢教授、Peter M. Hollingsworth教授、杨俊波正高级工程师和周梦媛博士为共同通讯作者,山东农业大学高连明教授、左政裕博士,广西师范大学张志勇教授,昆明植物研究所李洪涛研究员、纪运恒研究员、马朋飞研究员、伊廷双研究员、莫智琼博士,西双版纳热带植物园郁文彬研究员,英国爱丁堡大学Alex Twyford博士和英国爱丁堡皇家植物园黄雾博士等参与了该研究。该研究得到了科技部科技基础资源调查专项(2021FY100200, 2023YFA0915800)、云南省“兴滇英才支持计划”青年人才专项(XDYC-QNRC-2023-0564)、中国科学院国际人才计划(PIFI-2025PD0021)以及苏格兰政府农村、环境科学与分析服务司(Scottish Government's Rural and Environment Science and Analytical Services Division, RESAS)等项目的资助。

图3测序数据量均一性对红豆杉属物种鉴别率的影响。(a)基于全部数据的Skmer系统发育树(测序深度0.06–0.87x,中位数0.15x)。单系物种以三角形标示。(b)均一化数据的Skmer系统发育树(均一化至测序深度0.05x)。(c)原始数据中各物种数据量差异概况。每个点代表一个样本。橙色条表示各物种测序数据量的变异范围。初始分析(a图)中未形成单系的物种以紫色星号标出。非单系物种中聚在一起的个体以红点标示。

据悉,中国植物DNA条形码研究团队2009年通过对种子植物75科141属1757种6286个样本的比较分析表明,‌核糖体ITS/ITS2 序列‌具有最高的物种鉴别率,优于原先推荐的rbcL+matK组合,得到了国际生命条形码联盟植物工作组的高度评价。在此基础上,核心研究团队与爱丁堡皇家植物园Hollingsworth教授团队通过多年合作,先后开发了痕量DNA样品遗传信息获取技术,推动了细胞器条形码的研发,并在红豆杉属、杜鹃花属、兰属、马先蒿属和箭竹属等代表类群的近缘物种鉴定中得到有效应用。中英研究团队合作提出的维管植物物种鉴定的新方案,可广泛应用于科学研究、物种保护和生态监测,以及有毒植物、中草药混伪品、司法、海关等涉及的近缘物种精准鉴定和溯源。

文章链接