来源:Pangenome analysis of Nocardia brasiliensis reveals phylogenetic divergence, high genomic diversity and widespread distribution of biosynthetic gene clusters involved in secondary metabolite biosynthesis(Molecular Phylogenetics and Evolution)| 编译:DNA Lab Space | 原文许可:elsevier-subscription
导读
巴西诺卡菌(Nocardia brasiliensis)是放线菌门中一种兼性病原菌,既能引起人类放线菌肿,又蕴含丰富的次级代谢产物生物合成潜力。本研究整合了4株墨西哥临床分离株与22个公共基因组序列,通过泛基因组学、系统发育基因组学与基因组挖掘手段,揭示了该物种"开放型"泛基因组特征、地理来源驱动的系统发育分歧,以及大量与抗菌、抗肿瘤、抗氧化活性相关的生物合成基因簇。研究为病原放线菌的天然产物开发提供了新视角。
研究背景
放线菌是自然界中多样性最高、分类最复杂的细菌类群之一,也是医学上最重要天然产物的主要来源——链霉素、氯霉素、制霉菌素等抗菌药物及放线菌素D、博来霉素等抗肿瘤药物均源于此类微生物。链霉菌属(Streptomyces)是其中最具代表性的属,美国FDA批准的多数抗菌药物均源自该属。
近年的基因组分析揭示了一个重要事实:病原性诺卡菌属(Nocardia)基因组携带的生物合成基因簇(BGCs)数量与链霉菌相当甚至更多——诺卡菌基因组平均含有36个BGCs(范围29.9–48.5),而链霉菌平均为29个(范围11–56)。巴西诺卡菌作为放线菌肿的主要病原体,自1909年被认识以来,其产生抗菌、抗肿瘤及免疫调节活性次级代谢产物的能力自1990年代起逐渐受到关注。然而,整合系统发育基因组学、泛基因组结构与BGC分布的物种水平综合分析仍十分有限。本研究正是针对这一空白,对巴西诺卡菌进行全面的泛基因组学解析。
研究方法
2.1 巴西诺卡菌菌株
研究纳入4株分离自人类放线菌肿病灶的临床菌株(4004、4207、4254和N-100),由墨西哥流行病学诊断与参考研究所(InDRE)于1947年至1974年间分离保藏。菌株初步鉴定为诺卡菌属,随后通过hsp65-16S rRNA谱型完成分子鉴定,确认为巴西诺卡菌。样本对应先前文章(Cruz-Medrano et al., 2023)中描述的临床放线菌菌株保藏。此外,研究纳入22条来自美国国家生物技术信息中心(NCBI)数据库的巴西诺卡菌基因组序列。本研究所用基因组序列数据详见表1。
【数据】菌株数:4株临床(墨西哥)+ 22个公共基因组;分离时间:1947–1974;鉴定方法:hsp65-16S rRNA谱型
2.2 菌株复苏与基因组DNA提取
4株临床菌株接种于Bennett琼脂培养基(配方参照Rodríguez-Nava et al., 2006),37°C培养三周。对菌株进行宏观与微观形态检查,验证菌落生长的纯度和质量;将生物量重悬于0.85%生理盐水中,调节各菌株至0.5 McFarland浊度标准。高分子量基因组DNA按照MasterPure™ Complete DNA & RNA Purification Kit(LGC Biosearch Technologies,MV89010)说明书提取。DNA样品的完整性、浓度和纯度通过1%琼脂糖凝胶电泳和紫外分光光度法(EPOCH,Biotech)验证。
【数据】培养基:Bennett琼脂;温度:37°C;时间:3周;浊度:0.5 McFarland;生理盐水:0.85%;电泳:1%琼脂糖凝胶;试剂盒:MasterPure™(MV89010)
2.3 基因组测序、组装与注释
细菌全基因组测序采用长读长与短读长混合策略,由Plasmidsaurus(美国俄勒冈州尤金)商业服务完成。长读长测序在Oxford Nanopore Technologies(ONT)PromethION平台进行,使用R10.4.1流动池;互补的短读长测序在Illumina NovaSeq 6000高通量平台进行,采用2 × 150 bp双端模式。长读长测序文库使用连接测序试剂盒v14(SQK-LSK114,ONT)通过序列非依赖性标签化构建。短读长采用标准Illumina短插入文库制备。用于质量控制和测序的样本投入为20–30 ng/µL双链DNA(dsDNA),终体积20–30 µL低Tris缓冲液。ONT原始信号处理和碱基识别使用Super Accurate(SUP)模型。组装前,长读长使用Filtlong v0.2.1进行质量过滤,去除短于300 bp或排名低于5%的读段。使用Flye v2.9.1从Nanopore长读长初步生成从头组装,随后使用Polypolish v0.6.0进行混合纠错/抛光。组装后,使用QUAST v5.2(Gurevich et al., 2013)和RaPDTool v2.1.0(Estrada and Ayixon, 2023)评估序列质量和污染相关指标。所有软件均使用默认参数运行,除非另有说明。基因组注释使用Bakta v1.6.1(Schwengers et al., 2021)完成。随后将注释输出作为MCScanX 1.0版的输入,使用其基因重复分类模块进行基因重复分类;MCScanX将重复基因分为全基因组/片段重复、串联重复、近端重复和分散重复四类,并输出至HTML文件。新测序巴西诺卡菌基因组的测序与组装指标见补充表1。组装基因组已提交至NCBI GenBank数据库,BioProject登录号为PRJNA1468767。
【数据】测序平台:ONT PromethION(R10.4.1)+ Illumina NovaSeq 6000(2×150 bp);建库试剂盒:SQK-LSK114;DNA投入:20–30 ng/µL,20–30 µL;过滤参数:<300 bp或排名<5%去除;组装软件:Flye v2.9.1 + Polypolish v0.6.0;注释软件:Bakta v1.6.1;重复分类:MCScanX v1.0;BioProject:PRJNA1468767
2.4 基因组鉴定
平均核苷酸一致性(ANI)、基因组距离和Mash距离使用RaPDTool v2.2.0(Estrada and Ayixon, 2023)默认参数计算。ANI矩阵使用pyani v0.2.13.1(Pritchard et al., 2015)通过ANIm方法计算并绘图。基因组完整性和冗余度使用RaPDTool(基于miComplete)和CheckM v1.0.18评估。基因组鉴定使用RaPDTool v2.2.0完成,该工具依赖Mash、FOCUS、Metabat2和Binning_refiner,并与NCBI类型材料基因组数据库和基因组分类数据库(GTDB)进行稳健比较,最终给出高置信度taxID。Proksee(Grant et al., 2023)使用BLAST序列比对工具绘制基因组环形图谱。
【数据】ANI计算:pyani v0.2.13.1(ANIm法);距离计算:RaPDTool v2.2.0;完整性/冗余度:CheckM v1.0.18 + miComplete;数据库:NCBI + GTDB
2.5 泛基因组分析
直系同源基因和直系同源群使用OrthoFinder v2.5.5(Emms et al., 2025)从蛋白质组中计算,默认参数。泛基因组和核心基因组组成使用GET_HOMOLOGUES(Contreras-Moreira and Vinuesa, 2013)基于BDBH、COGtriangles和OrthoMCL算法估算。默认参数定义:硬核心基因组为存在于100%基因组中的基因,软核心基因组为存在于>95%基因组中的基因,壳基因组为存在于10–90%基因组中的基因,云基因组为存在于<10%基因组中的基因。核心基因组通过BDBH、COGtriangles和OrthoMCL结果的共识获得。泛基因组来自COGtriangles和OrthoMCL结果的共识。核心基因组和泛基因组的基因累积曲线使用GET_HOMOLOGUES的Tettelin和Willenbrock调整生成。云基因组和核心基因组序列使用EnrichM v0.6.6(https://github.com/geronimp/enrichM)进行功能注释,启用KO分配。KO丰度比较表使用内部富集脚本分析,该脚本对KEGG分子功能矩阵实施Mid-P Fisher精确检验(Lancaster, 1961)。
【数据】直系同源计算:OrthoFinder v2.5.5;泛基因组:GET_HOMOLOGUES(BDBH/COGtriangles/OrthoMCL);核心基因组阈值:100%(硬)/ >95%(软);壳基因组:10–90%;云基因组:<10%;富集分析:EnrichM v0.6.6 + Mid-P Fisher精确检验
2.6 系统发育基因组学分析
系统发育基因组学直系同源推断使用OrthoFinder v2.5.5(Emms et al., 2025)完成。为每个直系同源群推断系统发育基因树。物种树推断使用包含所有物种所有基因的STAG算法(Emms and Kelly, 2018)和FastME算法(Lefort et al., 2015)。随后使用STRIDE算法(Emms and Kelly, 2017)鉴定最可靠根。分支支持值由STAG算法计算,代表支持该二分支的直系同源群基因树比例,未包含自举分析。得到的系统发育树在在线平台Interactive Tree Of Life(iTOL)v.6(Letunic and Bork, 2024)上可视化。使用General Mixed Yule Coalescent(GMYC)模型和Bayesian Poisson Tree Processes(bPTP)进行贝叶斯物种界定分析,以评估基于系统发育数据的替代物种划分假说(Fujisawa and Barraclough, 2013; Zhang et al., 2013)。
【数据】物种树推断:STAG + FastME;根推断:STRIDE;支持值:STAG比例(无自举);可视化:iTOL v.6;物种界定:GMYC + bPTP
2.7 巴西诺卡菌基因组中次级代谢产物生物合成基因簇的鉴定
生物合成基因簇(BGCs)使用antiSMASH平台(Blin et al., 2021)鉴定。为进行比较分析,初始antiSMASH输出经筛选,仅保留与已知生物合成基因簇相似度≥50%的预测BGCs。该阈值作为操作标准,优先保留与已表征基因簇具有至少中等相似度的BGCs,并排除低置信度匹配、高度碎片化区域或支持度较差的预测。研究检索了所有可用的BGCs,包括参与聚酮化合物(PKS)、非核糖体肽(NRPS)、β-内酯、铁载体、萜烯、肽、杂合及其他化合物生物合成的基因簇。
【数据】BGC鉴定:antiSMASH;筛选阈值:≥50%相似度;BGC类型:PKS、NRPS、β-内酯、铁载体、萜烯、肽、杂合等
研究结果
3.1 临床菌株复苏、基因组DNA提取与基因组分析
获得4株菌株,表现出充分的生长和典型的放线菌形态特征。但它们在形态特征上存在差异,如色素沉着和气生菌丝的有无(图1)。

三份高分子量DNA样品的浓度范围为103.57 ng/μL至114.60 ng/μL,一份样品(4254)浓度为188.35 ng/μL。纯度通过A260/280比值确定,范围为1.936至2.0。基因组测序后,组装了4个基因组。4个新测序基因组均显示100%完整性和低污染值。菌株4004、4207和N-100以单重叠群组装恢复,而菌株4254组装为6个重叠群,因此被视为高质量草稿基因组。这些基因组的大小范围为7.5 Mb至9.4 Mb,G+C百分比范围为68.03%至68.27%。这些参数与放线菌一致。3个基因组(4004、4207和N-100)的编码区(CDSs)范围为8,108至8,432个,而1个基因组(4254)包含6,726个CDSs。基因组遗传密度范围为88.9%至89.2%。4个基因组的组装和基因组注释统计如下(表2)。
CheckM v.1.0.18污染检测值范围为1.44%至4.43%,均低于5%。miComplete冗余度检测值范围为9.52%至12.14%。鉴于这些看似较高的冗余值可能提示潜在污染,研究同时检测了参考基因组(FDAARGOS_352菌株,GCA_002209125.2),发现其估计冗余度与本研究菌株相当。这提示这些基因组可能表现出高于预期的基因重复率——这一现象在Nocardia farcinica中已有记载,表明基因重复是基因组进化的重要驱动力(Ishikawa et al., 2006)。对遗传内容的进一步探索揭示,所有基因组(包括参考基因组)均携带一个重复的编码RNA聚合酶亚基B(rpoB,K03043)的基因。该重复与利福平耐药相关——通过产生修饰的RpoB2蛋白,同时保留敏感的RpoB(Ishikawa et al., 2006)。有趣的是,研究还在所有分析的基因组中鉴定了至少6个关键核糖体蛋白编码基因的重复:L28、L31、L32、L33、S14和S18(见补充材料S1:注释蛋白序列)。值得注意的是,仅在本研究测序的4个基因组中,MCScanX基因重复分类就鉴定出每个基因组超过150个串联重复,以及多个近端和分散重复(见补充材料S1:MCScanX重复分析)。
【数据】DNA浓度:103.57–114.60 ng/μL(3份),188.35 ng/μL(4254);A260/280:1.936–2.0;基因组大小:7.5–9.4 Mb;G+C含量:68.03%–68.27%;CDS数:6,726–8,432;遗传密度:88.9%–89.2%;完整性:100%;污染率(CheckM):1.44%–4.43%;冗余度(miComplete):9.52%–12.14%;串联重复:>150/基因组
3.2 基因组鉴定
对26条巴西诺卡菌基因组序列计算了ANI、基因组距离和Mash距离值。比对以参考基因组序列FDAARGOS 352为参照。全对全ANI矩阵以热图形式绘制(图2)。

RaPDTool v.2.2.0(Estrada and Ayixon, 2023)估计的分类谱显示,21株菌株对应巴西诺卡菌,3株对应Nocardia vulneris,1株对应Nocardia nova,1株对应Nocardia sp.。分类学划分见表3。具有更新分类ID的菌株已标注。基因组相似性环形图谱突出了菌株间的分歧,以FDAARGOS 352参考序列为起点(图3)。

【数据】菌株数:26;巴西诺卡菌:21株;N. vulneris:3株;N. nova:1株;Nocardia sp.:1株
3.3 泛基因组分析
OrthoFinder分析在所有基因组中鉴定出213,067个基因,其中210,182个(98.6%)被分配到直系同源群。共检测到10,906个直系同源群,平均每个直系同源群19个基因。在所有基因组中鉴定出3,304个(30.30%)直系同源群,207个(1.90%)单基因直系同源群,以及2,562个(23.49%)单拷贝直系同源群。核心基因组共识值估计硬核心基因组为2,682个簇,软核心基因组为5,150个簇。泛基因组共识值显示壳基因组为4,032个簇,云基因组为8,533个簇,以及88个重复簇。核心基因组和泛基因组的组成见表4。
通过实施Tettelin、Willenbrock调整和Tettelin指数调整,在基因累积曲线中识别了核心基因组和泛基因组的趋势。核心基因组中观察到基因数量的下降趋势。泛基因组曲线则表现出累积基因数的持续增加(图4)。

基因累积曲线的趋势表明该物种具有开放型泛基因组——随着新基因组的加入,基因簇持续增加,提示物种内存在高水平的基因组多样性和持续的基因获取,反映了其环境适应能力和进化可塑性。云基因组内的功能富集揭示了代谢可塑性和特化生物合成方面的显著投入,萜类骨架生物合成、次级代谢产物产生和类固醇代谢相关通路的过度表达凸显了一种旨在介导复杂生物和非生物互作的适应策略(表5)。
【数据】总基因数:213,067;分配到直系同源群:210,182(98.6%);直系同源群总数:10,906;平均基因/直系同源群:19;核心直系同源群:3,304(30.30%);单基因直系同源群:207(1.90%);单拷贝直系同源群:2,562(23.49%);硬核心基因组:2,682簇;软核心基因组:5,150簇;壳基因组:4,032簇;云基因组:8,533簇;重复簇:88
3.4 系统发育基因组学分析
OrthoFinder共推断出9,000棵无根直系同源群基因树。其中3,304棵包含所有物种,被STAG(Emms and Kelly, 2018)和FastME(Lefort et al., 2015)算法用于构建最大似然法共识树(见图5)。

STRIDE算法鉴定了11个支持良好的基因重复事件,全部与单一根位置一致,未发现冲突证据。这使N. nova菌株4254被确认为基部谱系,也是最终树扎根的最佳外群。观察到被鉴定为N. nova(4254)、Nocardia sp.(AUSMDU00024985)和N. vulneris(HUJEG-1、HUJEG-1-P-200和enayuan-GCF_001689765.1)的菌株与其他菌株存在分歧。巴西诺卡菌菌株分为5个不同的分支。
分支1包含3株来自墨西哥的临床菌株(4004、4207和N-100)和1株来自以色列的临床菌株(760185026)。分支2包含参考菌株(FDAARGOS 352)以及2株保藏菌株(NBRC 14,402和NCTC 11294)。分支3包含2株来自以色列的临床菌株(760185023和760185027)。分支4包含1株保藏菌株(IFM 10847)和1株来自台湾的环境菌株(NPDC005960)。分支5包含2株来自中国的临床菌株(N-45和BJ06-0105)和8株来自以色列的临床菌株(740990171、740800435、760185024、740801790、760185025、740802916、740802900和4323611)。分支支持值高度支持这一系统发育排列。
使用不同贝叶斯和基于似然的物种界定方法(bPTP和GMYC检验)进行的补充分析进一步支持了这一拓扑结构。bPTP分析正确划定了N. nova、N. vulneris和N. brasiliensis类群。具体而言,N. nova和N. vulneris与N. brasiliensis的区分具有高贝叶斯支持值,分别为1.00和0.91。相比之下,N. brasiliensis被识别为单一融合复合体(补充图1)。Generalized Mixed Yule Coalescent(GMYC)方法鉴定了6个最大似然(ML)簇,阈值时间为−0.01257025,似然比(LR)检验值接近边缘显著(P = 0.0613)。
【数据】基因树总数:9,000;用于物种树的树:3,304;STRIDE重复事件:11个;bPTP支持值:N. nova = 1.00,N. vulneris = 0.91;GMYC ML簇:6个;阈值时间:−0.01257025;LR检验P = 0.0613
3.5 次级代谢产物生物合成基因簇的鉴定
最初鉴定出与22个已知BGCs匹配的基因组区域,相似度百分比……
(注:原文结果3.5节在此处截断,后续内容原文未提供。)
【数据】已知BGC匹配数:22个(原文节选在此截断,完整数据见原文)
讨论与解读
巴西诺卡菌是一种病原性放线菌,已从多种环境来源(包括土壤和腐烂有机物)中分离获得。尽管其病原体角色自1909年(Lindenberg, 1909)即被认识,但自1990年代起,从培养液中分离到具有抗菌(Itoh and Miyadoh, 1992; Tanaka et al., 1997)、抗肿瘤(Kobayashi et al., 1997; Tsuda et al., 1999)和免疫调节(Komaki et al., 1999b; Komatsu et al., 2004)活性的次级代谢产物,标志着对该放线菌生物技术潜力和生物医学应用的新视角的开端。
对其他病原性放线菌的既有研究表明,分枝杆菌属(Mycobacterium)携带6至23个已知BGCs(主要为糖类和脂肪酸),红球菌属(Rhodococcus)携带19至33个已知BGCs(主要为NRPS、萜烯和糖类),棒状杆菌属(Corynebacterium)含有4至7个已知BGCs(主要为PKS和萜烯)。其中,铁载体及致病性和生存因子(如分枝菌酸、邻苯二酚、分枝杆菌素和类气杆菌素非NRPS铁载体)在三个属中最为普遍,而红球菌属还拥有一些抗菌物质(如达托霉素和抗霉枯草菌素)(Ceniceros et al., 2017; Doroghazi and Metcalf, 2013)。相比之下,本研究的基因组挖掘揭示了巴西诺卡菌基因组中BGCs的丰富程度和多样性远超上述病原放线菌属,进一步支持其作为天然产物新来源的潜力。
【编译者解读】本研究将泛基因组学与系统发育基因组学方法系统应用于一个长期被忽视的病原放线菌物种,方法学上有两点值得关注:一是以开放型泛基因组特征量化了巴西诺卡菌的基因组可塑性,为后续天然产物挖掘提供了群体基因组学依据;二是将临床菌株与公共数据库基因组整合分析,揭示了地理来源对系统发育分歧的影响。但研究也存在局限——antiSMASH预测的BGCs与真实化合物表达之间仍有距离,预测的抗菌、抗肿瘤活性代谢物尚需实验验证。未来若能将基因组挖掘与异源表达或培养组学策略结合,有望将基因组潜力转化为实际可用的天然产物。
参考来源
Cruz-Medrano, M. G. (2026). Pangenome analysis of Nocardia brasiliensis reveals phylogenetic divergence, high genomic diversity and widespread distribution of biosynthetic gene clusters involved in secondary metabolite biosynthesis. Molecular Phylogenetics and Evolution. DOI: 10.1016/j.ympev.2026.108686
DOI: 10.1016/j.ympev.2026.108686