来源:Nat Commun | 编译:DNA Lab Space
黄檗(Phellodendron amurense)是传统中药黄柏的基原植物,其树皮中的小檗碱具有显著药理活性。然而,受限于基因组中的高重复区域,小檗碱完整生物合成途径的分子基础长期不明。本研究利用多平台测序技术组装了黄檗近端粒到端粒(T2T)级别基因组,系统解析了小檗碱合成相关基因家族扩张与表达调控,为天然产物的异源合成和分子育种提供了关键资源。
研究背景
黄檗隶属芸香科,是我国东北地区重要的药用乔木,其干燥树皮为常用中药“黄柏”,具有清热燥湿、泻火除蒸、解毒疗疮之功效。小檗碱是黄柏中最具代表性的异喹啉类生物碱,现代药理学研究表明其具有广谱抗菌、抗炎、降血脂及抗肿瘤等作用。尽管小檗碱的化学结构早已明确,但在植物细胞中,从苯丙氨酸到小檗碱的完整生物合成需要经历多步酶促反应,涉及PAL、C4H、4CL、NCS、BBE、CYP719、OMT等多种酶家族。由于黄檗基因组庞大、杂合度高且重复序列丰富,此前仅有基于二代或短读数组装的草图基因组,大量端粒、着丝粒及基因簇区域存在缺口,导致合成途径中关键酶基因的定位、拷贝数和进化关系难以精确解析。因此,构建一个连续、完整、近T2T级别的参考基因组,对揭示小檗碱生物合成的遗传基础至关重要。
研究方法
该研究采用PacBio HiFi、Oxford Nanopore Ultra-long和Hi-C三种测序技术相结合的策略,对黄檗基因组进行从头组装。首先从新鲜幼叶中提取高分子量基因组DNA,分别构建SMRTbell文库和超长Nanopore文库,同时利用Hi-C技术捕捉染色质空间构象信息。在组装流程中,PacBio HiFi reads经自纠错后用于构建初步的contig骨架,Nanopore Ultra-long reads被用来跨越复杂重复区域和填补gap,Hi-C数据则用于染色体级别的挂载与方向确定。组装完成后,研究者通过评估contig N50、脚手架N50及BUSCO数据库中单拷贝直系同源基因的完整性来验证组装质量。对于重复序列注释,综合使用LTR预测、从头重复模型库和同源比对方法;基因结构注释则整合了从头预测、蛋白质同源映射和转录组转录本支持。在基因组和转录组数据基础上,研究者构建了黄檗及近缘物种的系统发育树,鉴定基因家族的扩张与收缩事件。针对小檗碱合成途径,他们以已知物种中参与异喹啉生物碱合成的CYP719、BBE、6-OMT、4'-OMT等酶蛋白序列为探针,在基因组中进行同源搜索和保守结构域筛选,并进一步分析候选基因在染色体上的分布、串联重复关系及组织表达模式。最后,结合代谢组学数据与共表达网络,锁定与特定中间代谢物积累显著相关的候选基因和转录因子。

研究结果
该研究成功组装了黄檗近端粒到端粒级别的高质量参考基因组,其连续性较以往版本显著提升,几乎完整覆盖了所有染色体的端粒和着丝粒重复区域,BUSCO评估显示完整度极高。基因组序列中重复序列占比超过六成,其中以长末端重复逆转录转座子为主,这与黄檗基因组庞大且在进化过程中经历多次转座子爆发一致。基因注释共获得约3万个蛋白编码基因,重复基因家族分析显示,参与异喹啉生物碱骨架修饰的若干基因家族在黄檗中出现了显著扩张。尤其值得关注的是