苎麻端粒到端粒基因组组装揭示绿原酸生物合成通路的起源与进化

来源:Hortic Res | 编译:DNA Lab Space

📎 相关工具:质粒载体构建校验

导读

绿原酸是植物中重要的次生代谢物,具有抗氧化、抗菌等多种生物活性。本研究报道了苎麻(Boehmeria nivea)的高质量端粒到端粒(T2T)无缺口基因组,组装长度约344 Mb,包含全部28个端粒和14个着丝粒,共鉴定25,853个基因。通过比较基因组学、系统发育分析、转录组和代谢组学手段,研究者揭示了绿原酸生物合成通路的起源与进化过程,并通过蛋白酶活性测定验证了苎麻中绿原酸合成的关键代谢通路。

研究背景

绿原酸是由咖啡酸和奎宁酸缩合而成的酚酸类化合物,属于苯丙烷类化合物,是植物中重要的次生代谢产物和抗氧化物质。绿原酸具有多种生物活性,包括抗氧化、抗菌、心血管保护、基因突变抑制、抗肿瘤、抗人类免疫缺陷病毒、降压、抗病毒、抗炎等功效,还可用于胃溃疡和糖尿病等疾病的治疗,同时能清除自由基、保护细胞免受氧化损伤,在医药、保健、食品和动物饲料等领域有广泛应用。

苎麻(Boehmeria nivea L.)是荨麻科苎麻属多年生草本植物,起源于中国,考古证据表明其栽培历史超过4700年。苎麻因其茎皮纤维而被广泛种植,是纺织工业中受欢迎的自然纤维来源,同时也是速生多年生作物,可作为优质绿色饲料。苎麻根和叶富含绿原酸,使其被用作传统中草药和牲畜饲料。

研究方法

植物材料与测序

在国家苎麻种质资源圃中,选取苎麻品种(编号1380-2)作为基因组测序材料。取苎麻幼叶,液氮冷冻后采用CTAB法提取高质量DNA,使用超微量紫外分光光度计检测OD值,OD260/OD280 = 1.8~2.0表明DNA纯度较高;采用1.25%琼脂糖凝胶电泳检测,显示单一条带且无明显拖尾降解,表明DNA完整性较好。

HiFi测序:使用Covaris超声波破碎仪将DNA随机片段化(15–18 kb);大片段经磁珠富集纯化;片段化DNA进行损伤修复和末端修复;DNA片段两端连接茎环测序接头,使用外切酶消除无法连接的片段。构建的文库经PacBio Sequel II/PacBio Sequel IIe平台测序。

ONT超长测序:使用SQK-ULK001试剂盒(Oxford Nanopore Technologies, UK)按照制造商方案制备文库,在PromethION平台测序。

Hi-C测序:使用NEBNext Ultra II DNA Library Prep Kit(NEB, USA)从新鲜幼叶构建Hi-C文库,经DpnII酶切,在Illumina NovaSeq 6000平台测序。

短读长测序(DNBGENESEQ-T7):制备全基因组文库并在DNBGENESEQ-T7平台(BGI)测序。叶片和根组织液氮速冻,用于后续转录组和代谢组分析。

基因组组装与假染色体构建

基因组调查中,使用Jellyfish(2.2.10)和Genomescope 2.0评估基因组大小和杂合度,参数为kmer = 21,Kmer覆盖度阈值为10,000,000。HiFi读段使用Hifiasm软件默认参数组装。过滤ONT超长测序获得的读段后,使用NextDenovo进行ONT超长读段的初始基因组组装,并利用NextPolish进行序列优化以提高单碱基准确性。随后使用Hifiasm软件默认参数组合组装HiFi读段和ONT读段,使用blast软件比对线粒体和叶绿体数据以去除>50%碱基对的序列,通过BLAST RefSeq文库去除细菌污染,然后去除低读段支持的contigs。

使用ALLHiC软件,利用三维空间中的染色质相互作用信息将序列聚类到不同染色体组。使用Juicebox软件进行人工排序和定位,获得含14条染色体的基因组。最后使用TGS-GapCloser软件修补基因组中的缺口,获得最终版本基因组。

端粒鉴定与着丝粒区域预测

端粒在结构上保守,植物基因组中常用七碱基端粒重复序列(5′端CCCTAAAA或3′端TTTAGGG)与基因组比对来鉴定端粒区域。基于此,使用quartTeT工具包进行端粒预测,获得28个完整端粒。着丝粒由高度重复序列和少量基因组成,使用quartTeT工具包鉴定出14个着丝粒。

采用多种方法评估组装基因组质量:首先使用N50序列长度展示基因组连续性和评估基因组准确性;随后使用BUSCO软件以viridiplantae_odb10数据库评估基因组完整性;此外,使用BWA-MEM比对Illumina读段;使用minimap2将HiFi和ONT测序数据比对到参考基因组;最后计算LAI指数评估基因组组装质量。

基因组注释

首先使用RepeatModeler和EDTA注释基因组重复序列,使用RepeatMasker对基因组重复区域进行soft-masking,随后使用LTR_retriever进行整合。然后通过从头预测和同源预测相结合的方式预测基因编码区,综合使用Augustus、GlimmerHMM、Geneid、SNAP和GeMoMa。从头预测数据集通过Augustus获得。基于同源性的基因预测中,使用GeMoMa选择拟南芥(Arabidopsis thaliana)和两个先前报道的苎麻品种。通过EVidenceModeler对多种预测方法进行加权整合,构建高置信度基因结构。最后使用PASA软件整合组装基因组序列。

基因组注释完整性使用BUSCO软件评估。获取基因的最长蛋白序列作为基因代表序列进行功能注释,使用eggNOG提供的emapper流程进行注释,并与UniProt、Pfam和InterPro蛋白数据库比对以确定基因的生物学功能。基因组中的tRNA基于其结构特征鉴定,rRNA通过rRNA数据库预测。

基因组比较与变异鉴定

使用Nucmer(v4.0.0rc1)对Bni_1380与另外两个品种('Bniv_ZSZ1'和'Bniv_QY')进行基因组比对。比对结果提供给SyRI流程,用于鉴定共线性区块、结构变异(插入、缺失、重复、易位和倒位)和序列差异。

基因家族聚类分析

将苎麻1380与拟南芥(Arabidopsis thaliana)、水稻(Oryza sativa)、番茄(Solanum lycopersicum)、葡萄(Vitis vinifera)、可可(Theobroma cacao)、亚麻荠(Camelina sativa)、野草莓(Fragaria vesca)、枣(Ziziphus jujuba)、向日葵(Helianthus annuus)、桑树(Morus notabilis)、苎麻ZSZ、苎麻QY和咖啡(Coffea arabica)共14种植物进行基因组进化分析。所有物种的氨基酸序列通过OrthoFinder软件聚类为基因家族。

系统发育树构建

使用单拷贝基因,采用RAxML模型构建种间系统发育树,随后使用timetree添加化石时间点,最后通过PAML软件包中的mcmctree程序估算物种分歧时间。

基因家族收缩与扩张

根据不同物种的基因家族数量,使用cafe5软件通过在系统发育树上模拟基因家族的进化速率来推断祖先物种中基因家族的大小,使用出生-死亡过程模拟用户指定系统发育树中基因的获得和丢失。P < 0.05定义为显著扩增或显著收缩,对显著扩增或显著收缩的基因家族进行功能富集分析。

共线性分析

使用Blast比对三个不同苎麻品种的所有基因序列,随后使用MCScanX分析这些结果的共线性以确定相似基因对。通过JCVI软件确定同源基因的染色体位置,实现共变区块鉴定。

RNA测序

以三个个体作为三个生物学重复,对叶片和根进行RNA测序。RNA提取后,使用NEBNext UltraTM试剂生成Illumina兼容文库(300 bp片段大小)。文库测序在Illumina平台上使用HiSeq PE Cluster Kit v4 cBot进行,遵循制造商方案。

Genome assembly and genomic characterization of Bniv_ 1380. (A) Picture of Bniv_ 1380. (B) The HIC interaction matrix based on the assembly. (C) Bniv_ 1380 genome gene density and telomere and centromeres distribution. (D) The genomic features of Bniv_ 1380, in order from inside to outside, are geno
▲ Genome assembly and genomic characterization of Bniv_ 1380. (A) Picture of Bniv_ 1380. (B) The HIC interaction matrix based on the assembly. (C) Bniv_ 1380 genome gene density and telomere and centromeres distribution. (D) The genomic features of Bniv_ 1380, in order from inside to outside, are geno

研究结果

基因组组装

使用苎麻种质'1380'进行基因组组装(图1A)。首先进行Illumina测序,利用产生的86.08百万条读段进行K-mer调查分析(k = 21)。该分析表明'1380'种质的基因组大小约为350 Mb,杂合率为2.05%,重复序列长度约180.72 Mb(表S1,图S1)。随后进行PacBio和ONT测序,获得55万条HiFi读段和5,323万条ONT读段。HiFi和ONT读段的总长度分别为8.96 Gb和55.09 Gb,基因组覆盖率分别超过25.6×和157×(表S2)。使用Hifiasm软件组装HiFi读段,获得包含512个contigs的初始组装,累计大小为407 Mb。contigs最大长度和N50长度分别为22.02 Mb和7.12 Mb(表1)。

表1 Bniv_1380基因组组装统计

| 统计指标 | Bniv_1380 (HIFI-contig) | Bniv_1380 (Gap-free) | Bniv_QY | Bniv_ZSZ1 |

|---------|------------------------|---------------------|---------|-----------|

| Contig数量 | 512 | 14 | 450 | 657 |

| 最大contig (Mb) | 22.02 | 34.24 | — | — |

| 总长度 (Mb) | 407.23 | 344.21 | 270.21 | 266.6 |

| N50 (Mb) | 7.12 | 24.40 | 10.5 | 12.33 |

| L50 | 16 | 7 | — | — |

| N90 (Mb) | — | 9.38 | 17.54 | — |

| L90 | 77 | 14 | — | — |

| Gap数量 | — | 0 | — | — |

注:Bniv_QY和Bniv_ZSZ1分别是已报道的野生青叶苎麻和栽培中饲苎1号组装版本。

随后使用Hi-C测序读段(总长30.77 Gb,88×覆盖度)将contigs分配到染色体上。Hi-C挂载率为92.6%,产生14条假染色体(图1B)。然后使用ONT读段通过tgsgapcloser软件填补每条染色体中的缺口,获得名为Bniv_1380的无缺口参考基因组。无缺口Bniv_1380的总长度为344 Mb,N50和N90长度分别为24.40 Mb和17.54 Mb(表1,图1B)。最后,使用保守端粒重复序列(5'-CCCCTAAA/TTTAGGG-3')搜索Bniv_1380,在14条染色体中鉴定出全部28个端粒(图1C)。该结果表明新组装为T2T版本。此外,使用quartTeT工具鉴定着丝粒重复,识别出全部14个着丝粒(图1C)。有趣的是,着丝粒位置表明除1、8和14号染色体外,所有染色体均为近端着丝粒(图1C)。总体而言,新Bniv_1380组装为无缺口T2T版本。

基因组质量评估

使用三种方法评估Bniv_1380的质量。首先,将'1380'种质测序获得的Illumina和HiFi读段比对到组装基因组。结果显示,98.73%的Illumina读段和99.81%的HiFi读段可比对到Bniv_1380。这些读段分别覆盖了基因组区域的99.95%和99.96%,表明基因组序列一致性很高。其次,估算基因组长末端重复序列(LTR)组装指数(LAI),新组装的LAI为21.74,将Bniv_1380归类为金级。最后,进行BUSCO评估(viridiplantae_odb10)以证明新组装的完整性。结果显示,Bniv_1380中检测到99.8%的BUSCO保守基因,包括419个完整的单拷贝BUSCO和5个完整的重复BUSCO(表2,图S2)。总体而言,Bniv_1380是高质量组装,可作为未来苎麻遗传学、基因组学和育种研究的参考基因组。

表2 Bniv_1380基因组组装质量评估

| 质量指标 | Bniv_1380 (Gap-free) | Bniv_QY | Bniv_ZSZ1 | Liu等先前版本 | Luan等先前版本 |

|---------|---------------------|---------|-----------|-------------|-------------|

| 比对率 (%) | 99.96 | 98.2 | 98.6 | 95.4 | — |

| LTR组装指数 | 21.74 | 23.38 | 19.28 | — | — |

| 完整BUSCO (%) | 99.8 | 96.9 | 96.9 | 90.5 | — |

| 完整单拷贝BUSCO | 98.6 | 93.9 | 94.2 | 84.2 | — |

| 完整重复BUSCO | 1.2% | 3 | 2.7 | 6.3 | — |

注:Bniv_QY和Bniv_ZSZ1分别为野生和栽培品种。

基因组注释

对重复序列、基因结构、功能和非编码RNA进行了注释。结果显示,在Bniv_1380中鉴定出227.93 Mb重复序列,占苎麻基因组的61.19%。其中,微型反向重复转座元件(MITE)和LTR是最丰富的重复序列,分别占基因组的4.68%和16.81%(表S3)。结合同源预测、从头预测、基于转录组的预测和证据整合,在Bniv_1380中鉴定出25,853个推定基因。平均编码序列大小为3098.7 bp,基因平均外显子数和平均外显子长度分别为4.89和280.7 bp(表S4)。与已报道的野生青叶苎麻(Bniv_QY)和栽培中饲苎1号(Bniv_ZSZ1)基因组相比,本组装中鉴定出超过五千个新基因,导致编码序列和外显子的长度分布呈现轻微差异(图S3)。此外,约90.52%的推定基因通过搜索六个蛋白质数据库获得功能注释。另外,在Bniv_1380中预测到3325个非编码RNA(表S5)。

苎麻基因组进化

为展示苎麻基因组的进化比较,使用OrthoFinder鉴定了14个物种的同源基因。共鉴定出36,767个基因家族,包含456,602个基因。其中,14,133个直系同源家族为物种特异性,8,236个为核心家族(表S6,图S4)。先前研究表明,野生和栽培苎麻基因组中收缩基因家族多于扩张基因家族。与已报道的苎麻基因组不同,本研究在Bniv_1380中鉴定出774个扩张基因家族,多于收缩基因家族(图2A)。这一差异发现应归因于Bniv_1380中检测到的更多新基因。有趣的是,大量纤维生长基因在苎麻基因组中表现出扩张,如COMT1(2个基因)、纤维素合酶CSLD(6个基因)、IRX12(4个基因)、IRX15(2个基因)和MYB52(3个基因)(表S7)。此外,至少113个扩张基因可能参与生长素信号通路(表S8)。这些扩张基因的功能富集分析表明,它们显著富集于"植物激素信号转导"通路(P = 3.10 × 10⁻²⁰;图S5)。这些生长素相关基因的扩张可能为满足苎麻快速生长的进化需求。

Phylogenetic and collinearity analysis of the ramie genome ( Bniv_ 1380 T2T) with relatives’ plant species. (A) Structural variations between Bniv _ZSZ1 ( Bniv _QY) and vT2T genomes. (B) Phylogenetic tree of 12 plant species. Time of divergence (MYA) is shown on the nodes. (C) Distribution of genes
▲ Phylogenetic and collinearity analysis of the ramie genome ( Bniv_ 1380 T2T) with relatives’ plant species. (A) Structural variations between Bniv _ZSZ1 ( Bniv _QY) and vT2T genomes. (B) Phylogenetic tree of 12 plant species. Time of divergence (MYA) is shown on the nodes. (C) Distribution of genes

将先前Bniv_ZSZ1和Bniv_QY基因组与Bniv_1380基因组比较,共线性分析图显示三个品种苎麻基因组中染色体存在一些结构变异(图2A)。使用单拷贝基因家族构建系统发育树,揭示苎麻与野草莓(Fragaria vesca)、枣(Ziziphus jujuba)和桑树(Morus notabilis)亲缘关系最近,与它们的分歧时间分别约为881万、757万和525万年前(图2B)。

The discovery and evolution of a conserved chlorogenic acid synthase gene in plants. ( A) A diagram showing the regulation of chlorogenic acid biosynthesis genes in the biosynthetic pathway. (B) A phylogenetic tree of 21 representative species from the four major branches of Rhodophyta, Chlorophyta,
▲ The discovery and evolution of a conserved chlorogenic acid synthase gene in plants. ( A) A diagram showing the regulation of chlorogenic acid biosynthesis genes in the biosynthetic pathway. (B) A phylogenetic tree of 21 representative species from the four major branches of Rhodophyta, Chlorophyta,

绿原酸生物合成通路的发现与进化

通过比较基因组分析,研究了绿原酸生物合成通路的进化过程。在绿藻门(Chlorophyta)、红藻门(Rhodophyta)、陆生植物(Embryophyta)、无油樟目(Amborellales)、百合纲(Liliopsida)和真双子叶植物(eudicotyledons)四大分支的21个代表性物种中,综合比较分析基因组区域揭示了植物中绿原酸形成的进化过程,提出了植物绿原酸生物合成通路的形成进化模型(图3)。

苎麻绿原酸代谢通路的关键代谢物。(A–B) 叶片和根部代谢组的OPLS-DA得分图(A,正离子模式;B,负离子模式)。(C–D) 苎麻叶片和根部代谢物的火山图(C,正离子模式;D,负离子模式)。E. 苎麻叶片和根部。(F) 绿原酸及其上游代谢物在不同组织中的积累。
▲ 苎麻绿原酸代谢通路的关键代谢物。(A–B) 叶片和根部代谢组的OPLS-DA得分图(A,正离子模式;B,负离子模式)。(C–D) 苎麻叶片和根部代谢物的火山图(C,正离子模式;D,负离子模式)。E. 苎麻叶片和根部。(F) 绿原酸及其上游代谢物在不同组织中的积累。

苎麻绿原酸代谢通路关键代谢物

对苎麻叶片和根进行代谢组学分析。OPLS-DA得分图显示叶片和根代谢组在正离子模式(POS)和负离子模式(NEG)下均明显分离(图4A-B)。火山图展示了叶片和根中差异代谢物的分布(图4C-D)。苎麻叶片和根的形态如图4E所示。不同组织中绿原酸及其上游代谢物的积累模式如图4F所示。

苎麻绿原酸代谢途径及差异基因鉴定。(A)苎麻叶片和根中差异基因的火山图。(B)差异基因的KEGG富集分析。(C)苎麻叶片和根中绿原酸代谢途径差异基因的鉴定。(D)C3H蛋白酶活性催化。(E)苎麻中绿原酸合成途径,不同颜色的阴影椭圆代表苎麻代谢组中鉴定到的关键代谢物。
▲ 苎麻绿原酸代谢途径及差异基因鉴定。(A)苎麻叶片和根中差异基因的火山图。(B)差异基因的KEGG富集分析。(C)苎麻叶片和根中绿原酸代谢途径差异基因的鉴定。(D)C3H蛋白酶活性催化。(E)苎麻中绿原酸合成途径,不同颜色的阴影椭圆代表苎麻代谢组中鉴定到的关键代谢物。

绿原酸代谢通路及差异基因鉴定

对苎麻叶片和根进行转录组分析。差异基因火山图(图5A)和KEGG富集分析(图5B)揭示了叶片和根之间的差异表达基因。通过差异基因鉴定,确定了苎麻叶片和根中绿原酸代谢通路的差异基因(图5C)。C3H蛋白酶活性催化实验验证了关键酶活性(图5D)。提出了苎麻中绿原酸合成通路模型,不同颜色的阴影椭圆代表代谢组中鉴定的关键代谢物(图5E)。

讨论与解读

近年来,更多作物完成了基因组测序,特别是T2T基因组,极大地促进了关键农艺性状基因的鉴定。然而,苎麻的完整基因组此前未见报道。本研究通过多种策略优化,构建了含14条染色体、大小344.21 Mb的苎麻完整基因组,超过了先前报道的'Bniv_ZSZ1'和'Bniv_QY'基因组,鉴定基因数从20,693个提升至25,853个。本版本基因组N50长度达24.4 Mb,较此前版本大幅提升。比较分析结果表明,三个苎麻品种的基因组存在倒位和易位等结构变异。值得注意的是,苎麻中9条染色体的着丝粒位于染色体末端,与先前研究结果一致。此外,基因组扩张基因中包含大量生长素相关基因,其同源基因存在于大多数植物中,表明生长素相关基因的功能在植物进化中高度保守。

编译者解读

本研究通过T2T基因组组装技术,首次为苎麻提供了完整的参考基因组,填补了该物种基因组学的空白。研究者将基因组学与代谢组学、转录组学手段相结合,系统解析了绿原酸生物合成通路——这种多组学联合策略是合成生物学研究中解析天然产物通路的有效范式。值得关注的是,通过比较21个代表性物种的基因组,研究揭示了绿原酸通路在植物进化中的形成过程,为异源重构该通路提供了进化视角的参考依据。未来,基于这些关键基因(如C3H等)的克隆与功能验证,将推动高绿原酸含量苎麻品种的分子育种进程。

参考来源

Gao S, Lin Q, Tao Y, Guo J, Guo Y. The telomere-to-telomere genome and comparative analysis from algae to higher plants reveal origin and evolution of biosynthesis of chlorogenic acid pathway and production in ramie (Boehmeria nivea L.). Hortic Res. PMID: 42577591.

PMID: 42577591

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12