来源:A chromosome-level genome assembly of Lycoris radiata reveals the evolutionary origin of Amaryllidaceae alkaloids and elucidates the complete galanthamine biosynthetic pathway(Plant Communications)| 编译:DNA Lab Space | 原文许可:elsevier-subscription
导读
石蒜科生物碱(AmAs)是一类结构多样、几乎仅由石蒜亚科植物产生的特化代谢物,具有显著药理价值。然而,高质量基因组的缺乏长期制约了其生物合成基因的系统研究。本研究完成了石蒜(Lycoris radiata)染色体级基因组组装,鉴定了加兰他敏生物合成途径中的关键下游酶,发现了两个关键代谢物对之间的可逆反应,并在解脂耶氏酵母中成功重构了加兰他敏生物合成途径。比较基因组分析表明,AmA生物合成核心基因起源于祖先被子植物,完整途径则通过基因重复与新功能化在石蒜亚科中组装形成。
研究背景
石蒜科生物碱是主要局限于石蒜亚科的植物特化代谢物,已发现超过600种结构多样的化合物。许多AmAs具有显著治疗特性,包括抗肿瘤、抗疟、抗病毒和杀虫活性。其中,加兰他敏是强效乙酰胆碱酯酶抑制剂,已被批准用于阿尔茨海默病的对症治疗,并在精神分裂症治疗中展现出潜力。尽管药理价值突出,AmAs的天然丰度有限——加兰他敏在石蒜属物种中通常仅占植物干重的0.04%,商业化生产仍主要依赖植物提取,供需矛盾突出。因此,合成生物学策略的实现前提是全面理解AmA生物合成途径,包括关键酶编码基因的系统鉴定与功能表征。
研究方法
基因组测序
植物种植于西北工业大学的温室中。在叶片活跃生长阶段采集幼嫩叶片用于基因组测序。采用CTAB法从新鲜幼嫩叶片中提取高质量基因组DNA。按照标准PacBio流程,构建目标插入片段大小为10或20 kb的SMRTbell文库进行测序。使用G-tubes剪切基因组DNA,在DNA损伤修复和加A尾之前去除单链突出端。随后将DNA片段连接测序接头以生成PacBio兼容文库。获得聚合酶读段后,使用SMRT Link处理生成subreads,进而生成循环一致性测序HiFi读段。
【数据】物种:石蒜(Lycoris radiata);插入片段:10/20 kb;测序平台:PacBio HiFi;DNA提取:CTAB法
基因组组装与评估
为估算石蒜的基因组大小和杂合度,首先使用Jellyfish(v2.2.0)从Illumina短读段生成k-mer频率分布。所得k-mer谱使用GenomeScope 2.0分析以估算基因组大小、杂合度和重复序列含量。使用HiFiasm(v0.21.0)默认参数基于PacBio HiFi读段进行contig组装。组装结果使用purge_haplotigs处理以去除冗余单倍型。使用BUSCO( embryophyta_odb10数据集中的1,614个核心基因)评估基因组组装的完整性和准确性。使用Merqury(v1.3)评估碱基水平的准确性。
【数据】k-mer分析软件:Jellyfish v2.2.0;基因组评估:GenomeScope 2.0;组装软件:HiFiasm v0.21.0;去冗余:purge_haplotigs;完整性评估:BUSCO(embryophyta_odb10,1,614个核心基因);准确性评估:Merqury v1.3
基于Hi-C的染色体分配与组装
Hi-C文库构建中,细胞用甲醛固定以交联DNA与相关蛋白。交联DNA随后用限制性内切酶HindIII消化以在限制性位点引入断裂,随后进行末端修复和生物素标记。接着进行邻近连接以生成嵌合DNA分子,纯化后剪切为300至700 bp片段。通过pull-down富集生物素标记的DNA片段并用于文库构建。使用Qubit 2.0和Agilent 2100 Bioanalyzer评估文库浓度和插入片段大小分布以确保文库质量。文库在Illumina平台上进行双端150-bp读段(PE150)测序。原始测序数据过滤后,使用Juicer(v1.6)将干净读段比对到基因组组装上。随后使用3D-DNA(v180922)默认参数生成染色体水平组装。最后使用Juicebox(v2.20)基于Hi-C接触频率人工审查和优化候选组装。
【数据】交联剂:甲醛;限制酶:HindIII;片段大小:300-700 bp;测序:Illumina PE150;比对软件:Juicer v1.6;组装软件:3D-DNA v180922;人工校正:Juicebox v2.20
转录组分析
转录组分析中,从三个发育阶段的石蒜植株采集组织:花期(Stage 1)的花、花序轴、鳞茎和根;果期(Stage 2)的果实、花序轴、鳞茎和根;叶期(Stage 3)的叶、鳞茎和根。每个样本设置三个生物学重复。样本在液氮中速冻用于RNA提取。使用RNAprep Pure Plant Kit(天根,中国)提取总RNA。使用Qubit RNA Assay Kit和Agilent 2100 Bioanalyzer评估RNA质量。质量评估后,使用oligo(dT)磁珠富集真核mRNA。mRNA用片段化缓冲液片段化,逆转录为cDNA,随后进行末端修复、加A尾和测序接头连接。所得cDNA片段经扩增,PCR产物用AMPure XP磁珠纯化以构建测序文库。合格文库在Illumina平台上测序。RNA-seq读段使用HISAT2(v2.1.0)比对到参考基因组,使用StringTie(v2.2.1)生成转录本组装。随后使用TransDecoder(v5.7.1)从组装的转录本预测蛋白编码序列。在后续分析前,去除所有样本中平均计数< 10的转录本。使用R包DESeq2鉴定差异表达基因,|log2FC| > 1且校正后p < 0.05的基因视为显著差异表达。
【数据】发育阶段:花期/果期/叶期;组织:花、花序轴、鳞茎、根、果实、叶;生物学重复:3;RNA提取:RNAprep Pure Plant Kit;比对:HISAT2 v2.1.0;组装:StringTie v2.2.1;基因预测:TransDecoder v5.7.1;差异表达阈值:|log2FC| > 1,校正p < 0.05
代谢物液相色谱-质谱分析
代谢组学分析采用武汉迈特维尔生物科技有限公司的广泛靶向代谢组学方法。采样策略与转录组分析一致。植物组织样本使用冻干机(Scientz-100F)真空冷冻干燥并研磨成细粉。称取约50 mg粉末组织,加入1,200 μl预冷(−20°C)的70%甲醇水溶液,充分匀浆。收集上清液并经0.22-μm微孔滤膜过滤,使用超高效液相色谱(ExionLC AD)联用串联质谱(Applied Biosystems 6500 QTRAP)采集数据。色谱分离在Agilent SB-C18色谱柱(1.8 μm,2.1 × 100 mm)上进行。流动相由溶剂A(含0.1%甲酸的超纯水)和溶剂B(含0.1%甲酸的乙腈)组成,梯度洗脱。流速设为0.35 ml/min,柱温维持在40°C,进样量为2 μl。代谢物鉴定基于数据库匹配和MS/MS谱图信息,定量在多反应监测模式下使用三重四极杆质谱仪完成。MS数据使用Analyst 1.6.3软件处理。为每个代谢物选择特征性前体-产物离子对,检测器以每秒计数记录所选离子的信号强度。原始质谱数据文件进一步使用MultiQuant软件进行色谱峰积分和校正。每个色谱信号的积分峰面积代表相应代谢物的相对丰度。
【数据】样本量:约50 mg;提取液:1,200 μl 70%甲醇(−20°C预冷);过滤:0.22-μm滤膜;色谱柱:Agilent SB-C18(1.8 μm,2.1 × 100 mm);流速:0.35 ml/min;柱温:40°C;进样量:2 μl;质谱:Applied Biosystems 6500 QTRAP;软件:Analyst 1.6.3、MultiQuant
代谢组学分析
差异代谢物分析使用R包MetaboAnalystR(v4.0)进行。差异代谢物鉴定标准为:变量投影重要性得分> 1,|log2FC| > 2,p < 0.05。使用R包clusterProfiler对差异代谢物进行KEGG富集分析,显著性阈值为p < 0.05。热图使用R包pheatmap生成。
【数据】差异代谢物标准:VIP > 1,|log2FC| > 2,p < 0.05;KEGG富集:p < 0.05
基因组注释
全基因组重复序列和转座子元件使用基于同源性和从头预测相结合的策略进行鉴定。同源性注释中,使用RepeatMasker(v4.1.0)和ProteinMask(v4.0.5,包含在RepeatMasker包中;p值阈值1 × 10⁻⁴)搜索Repbase数据库,基于序列相似性鉴定和分类已知重复元件。从头预测中,使用RepeatModeler(v1.0.5)和LTR_FINDER(v1.07)构建物种特异性重复序列文库。所得从头重复文库作为RepeatMasker(v4.1.0)的输入,用于检测四个基因组中的重复序列。最后,根据基因组间同源性和从头分析的重复注释结果进行整合。
【数据】同源性注释:RepeatMasker v4.1.0、ProteinMask v4.0.5(p < 1 × 10⁻⁴);从头预测:RepeatModeler v1.0.5、LTR_FINDER v1.07
研究结果
石蒜高质量基因组的测序、组装与注释
共生成1,222.50 Gb短读段,用于基于k-mer的基因组调查分析,估算石蒜基因组大小为23.62 Gb。随后生成646.22 Gb PacBio HiFi读段(27.36×),组装为高质量石蒜基因组,总大小为23.74 Gb,contig N50为22.08 Mb。这些contig进一步使用1.86 Tb Hi-C数据(78.75×)进行支架组装,将94.15%的组装序列锚定到11条假染色体上,scaffold N50为1,003.40 Mb,最长假分子为2.58 Gb。22个染色体末端中有12个存在端粒重复序列,BUSCO评估完整性为95%,碱基水平一致性质量值为64.36,表明染色体规模组装高度完整且准确。石蒜基因组以重复序列为主,占总长度的97%。LTR逆转录转座子是最大组分(80.28%),其中Gypsy元件(37.58%)显著多于Copia元件(11.58%),DNA转座子占16.70%。0至2百万年前(Mya)之间的LTR-RT活性爆发可能促成了石蒜基因组的近期扩张。基于从头预测、同源比对和RNA-seq数据,在石蒜基因组中共预测到41,232个蛋白编码基因,其中91.2%的基因获得功能注释。这些基因模型相对较长,平均长度为20,940 bp,主要由于长内含子所致,内含子平均长度为3,720 bp。

【数据】短读段:1,222.50 Gb;k-mer估算基因组:23.62 Gb;HiFi读段:646.22 Gb(27.36×);组装基因组:23.74 Gb;contig N50:22.08 Mb;Hi-C数据:1.86 Tb(78.75×);锚定率:94.15%;假染色体:11条;scaffold N50:1,003.40 Mb;最长假分子:2.58 Gb;BUSCO完整性:95%;QV值:64.36;重复序列占比:97%;LTR-RT占比:80.28%;Gypsy:37.58%;Copia:11.58%;DNA转座子:16.70%;预测基因数:41,232;功能注释率:91.2%;平均基因长度:20,940 bp;平均内含子长度:3,720 bp
AmA生物合成起源的基因组进化
为研究石蒜WGD事件历史,绘制了速率校正的混合Ks分布,揭示两个近期峰:一个位于Ks = 0.19,对应约20.79 Mya的近期WGD事件;另一个位于Ks = 0.63,与石蒜科共享的古老WGD一致(约70 Mya)。该古老事件发生在石蒜与石刁柏(Asparagus officinalis)分化(约89.80 Mya)之后、石蒜与百子莲(Agapanthus africanus)分化(约65.30 Mya)之前。尽管石蒜基因组内点图中仅最近一次WGD表现出清晰共线性区块,但石蒜与无油樟(Amborella trichopoda)共线性分析中检测到的1:8深度共线性区块支持了三轮WGD事件,包括单子叶植物共享的古老τ WGD。为追踪石蒜进化历史,对10个被子植物物种进行了系统发育基因组学分析,包括石蒜、火葱、洋葱、大蒜、百子莲、石刁柏、油棕、大叶藻、番茄和无油樟。共407,790个基因聚类为34,823个基因家族,其中包含162个单拷贝基因家族。基于单拷贝直系同源物的系统发育重建和分化时间估算表明,石蒜(石蒜亚科)与葱亚科(以三种葱属物种为代表)约在41.4 Mya分化。石蒜与葱亚科和百子莲亚科代表物种的共线性分析揭示了广泛的共线性区块,支持石蒜科各亚科间基因组结构的保守性。基于该系统发育,使用CAFÉ进行基因家族扩张分析,在石蒜中鉴定出3,356个扩张基因家族。这些扩张家族的KEGG富集分析突出了异喹啉生物碱生物合成相关通路(该类别包含AmA生物合成),GO富集分析则揭示了O-甲基转移酶活性、酰基转移酶活性(非氨基酰基)、色氨酸合酶活性和氧化还原酶活性的富集。在石蒜基因组中,鉴定到3个推定NBS同源物、3个推定N4OMT同源物和3个推定CYP96T同源物,这些是负责AmA生物合成上游形成和氧化偶联步骤的核心酶组分。在加兰他敏生物合成途径中,N-甲基化和羰基还原是直接决定最终生物活性骨架形成的关键末端步骤。植物生物碱生物合成高度依赖醛、酮和醇的氧化还原修饰以及氧和氮原子的甲基化。为研究石蒜中的这些过程,系统分析了注释为还原酶和甲基转移酶的预测基因。共鉴定到3个还原酶基因家族和1个N-甲基转移酶(NMT)基因家族:短链脱氢酶/还原酶(SDR)基因家族245个基因,中链脱氢酶/还原酶(MDR)基因家族8个基因,醛酮还原酶(AKR)基因家族33个基因,以及NMT基因家族359个基因。其中,根据CAFÉ分析,SDR和NMT家族在石蒜中均显著扩张。扩张的SDR和NMT基因在染色体上分布不均,在多个基因组位点观察到串联重复基因簇。转录组数据分析显示,许多扩张的SDR和NMT基因呈现一致的组织特异性表达模式。总之,这些酶家族的扩张和组织偏向性表达提示其在石蒜AmA生物合成和代谢多样化中的潜在作用。

【数据】近期WGD:Ks = 0.19(约20.79 Mya);古老WGD:Ks = 0.63(约70 Mya);石蒜-石刁柏分化:约89.80 Mya;石蒜-百子莲分化:约65.30 Mya;石蒜-葱亚科分化:约41.4 Mya;分析物种数:10个;基因总数:407,790;基因家族:34,823;单拷贝家族:162;扩张基因家族:3,356;SDR家族:245个基因;MDR家族:8个基因;AKR家族:33个基因;NMT家族:359个基因
石蒜组织特异性代谢分配与生物碱积累
在石蒜中共检测到1,227种代谢物,包括359种氨基酸及其衍生物(29.26%)、177种酚酸(14.43%)和64种AmAs(5.21%)。层次聚类显示,代谢谱主要按组织类型而非发育阶段分离,鳞茎形成独立于所有其他组织的分支。在剩余分支中,根样本与地上组织分离。与其他组织相比,鳞茎中500种代谢物水平降低,39种代谢物水平升高。在减少的代谢物中,氨基酸及其衍生物(24.95%)和脂质(19.89%)位居前列。KEGG富集分析显示,与氧化磷酸化和玉米素生物合成相关的代谢物减少,这两个通路均与能量代谢和生长相关。与此一致,基于转录组的基因集富集分析支持这两个重要通路的下调。相比之下,富集的代谢物与氨基酸生物合成和ABC转运蛋白相关通路有关。同样,基因集富集分析也支持这些通路的上调。在主成分分析中绝对载荷最高的前5%代谢物(61种)中,83.61%(包括50种减少和1种增加的代谢物)……

【数据】检测代谢物总数:1,227;氨基酸及衍生物:359种(29.26%);酚酸:177种(14.43%);AmAs:64种(5.21%);鳞茎减少代谢物:500种;鳞茎增加代谢物:39种;减少代谢物中氨基酸及衍生物:24.95%;减少代谢物中脂质:19.89%;PCA前5%代谢物:61种;其中减少/增加比例:83.61%(50种减少,1种增加)
LrNMTs与LrAKR的鉴定与功能表征
(原文此部分内容未在提供节选中完整呈现,以下为可译部分)

【数据】原文未详述
AmA生物合成基因的进化扩张与谱系特异性多样化

【数据】原文未详述
讨论与解读
本研究报道了石蒜的参考基因组,据我们所知,这是石蒜亚科的首个参考基因组。分析表明石蒜仅经历了一次近期WGD事件,其增大的基因组规模主要归因于LTR-RT插入与重复事件的协同作用。石蒜中平均长度为3,720 bp的长内含子显著贡献了其较大的平均基因长度。这一观察与基因组扩张植物的普遍趋势一致——重楼(52.75 Gb)内含子平均7,524 bp,淡黄花百合(35.66 Gb)内含子平均9,070 bp,这些更极端的例子支持基因组大小与内含子长度之间的正相关。加兰他敏生物合成研究已持续数十年。水仙属的一项近期研究报告了化合物1([M + H]⁺ m/z 272.1281)、化合物2([M + H]⁺ m/z 274.1443)和化合物3([M + H]⁺ m/z 286.1437)的推定鉴定。代谢途径常表现出可塑性,同一前体可通过多条平行途径转化为同一产物。本研究阐明了一条……
编译者解读
该研究以染色体级基因组为基石,系统整合代谢组与转录组数据,在石蒜中定位了加兰他敏途径的关键末端酶,并通过异源重构验证了途径功能。方法学上的亮点在于将进化分析与生化验证闭环——从基因家族扩张追溯到途径组装历史,为石蒜科生物碱的异源生产提供了清晰的基因元件清单。值得注意的是,可逆反应的发现提示途径通量调控存在此前未预见的灵活性。局限在于代谢物检测依赖广泛靶向方法,部分微量中间体的定量精度可能受限。该基因组资源有望加速石蒜科其他药用生物碱途径的解析与工程化改造。
参考来源
Zhao Y. A chromosome-level genome assembly of Lycoris radiata reveals the evolutionary origin of Amaryllidaceae alkaloids and elucidates the complete galanthamine biosynthetic pathway. Plant Communications, 2026. DOI: 10.1016/j.xplc.2026.101942
DOI: 10.1016/j.xplc.2026.101942