基于Flux-to-AI框架预测假单胞菌代谢能力与细胞包膜特性

来源:Predicting Strain-Specific Metabolic Capabilities in the Genus Pseudomonas with a Flux-to-AI Approach Reveals Hidden Cell Envelope Properties.(Comput Struct Biotechnol J)| 编译:DNA Lab Space

📎 相关工具:论文撰写

导读

假单胞菌属细菌广泛存在于空气、土壤和水体中,因其代谢多样性和生态功能而备受关注。本研究构建了44株假单胞菌的基因组规模代谢模型(GEMs),通过Flux-to-AI框架将代谢建模与机器学习相结合,系统预测了菌株在不同碳源利用上的代谢能力差异。研究发现,高代谢 versatility 与菌株降解有毒化合物的能力相关,且转录-表达(ME)模型揭示菌株间蛋白质组分配差异,最终指向与细胞包膜相关的菌株特异性资源分配策略。

研究背景

假单胞菌属为革兰氏阴性菌,在空气、土壤和水体生态系统中扮演重要角色。根据地球微生物组计划,它们是地球上最丰富的微生物之一。在土壤中,它们可作为植物促生根际细菌,通过产生铁载体和植物激素等机制增强养分交换并抑制病原菌。在水生环境中,假单胞菌可通过降解含氮化合物和碳氢化合物等污染物以及积累重金属来改善水质——废水处理中的反硝化过程即为典型例证,它们将亚硝酸盐(NO₂⁻)和硝酸盐(NO₃⁻)转化为氮气(N₂),对氮循环平衡至关重要。其形成生物膜和产生生物表面活性剂的能力有助于分解疏水性化合物。临床环境中的假单胞菌可表现致病性,并能适应宿主代谢。尽管每年有大量基因组序列被报道,但假单胞菌菌株间的基因组变异与其代谢能力多样性之间的关系仍不清楚,且缺乏系统分析不同菌株的预测工具。

研究方法

Flux-to-AI框架概述

Flux-to-AI框架整合了基因组规模代谢建模与机器学习,用于系统研究假单胞菌属的菌株特异性代谢能力。研究遵循先前已验证的多菌株代谢建模步骤[36,73–75]。首先选择基因组信息,随后以人工精选的参考GEM为模板,通过比较基因组学方法重建菌株特异性GEMs。重建模型在标准化环境条件下进行验证和模拟,以预测大量营养利用场景下的代谢表型。这些步骤减少了后续机器学习分析中的特征依赖性和共线性。预测表型随后作为生物学可解释特征用于机器学习分类,再进行特征稳健性分析和ME模型模拟,以探究分类器识别的代谢能力的机制基础。

假单胞菌基因组序列选择

用于重建的假单胞菌基因组下载自BV-BRC数据库[29]和NCBI GenBank[28]。搜索针对假单胞菌属物种,选择状态为“complete”的基因组。基于基因组元数据,使用与氮去除和废水处理过程相关的关键词进行筛选,包括“wastewater”、“denitrification”、“nitrate”、“activated sludge”、“ammonium”和“ammonia”。所有下载数据经清洗和重复项检查后,最终获得44条独特基因组序列。为确保基因预测和注释的一致性,所有基因组序列使用Prokka 1.14.6[76]重新注释。

多菌株GEMs重建与iSD1509扩展

以P. aeruginosa PA14的最新模型iSD1509作为菌株特异性重建的参考模型[27]。iSD1509基于iPau21[77]构建。P. aeruginosa模型自2017年以来不断改进,MEMOTE评分达到基因必需性预测90%和碳源预测93%,包含迄今为止任何假单胞菌模型中最多的基因数(1,509个)。单一模板可能带来某些谱系特异性通路在远缘物种中代表性不足的潜在限制;然而,目前仅有P. putida存在经人工精选的GEMs,本研究其他12个菌株仅有基于P. aeruginosa构建的草稿模型。本计算研究聚焦于使用标准化模板矩阵评估模拟环境中的代谢通量边界,作为废水中假单胞菌微生物组和多生物群落的来源。

iSD1509的好氧和厌氧生物量目标函数被用作所有属模型的标准化生长约束。比较检查确认核心大分子系数保持高度标准化,同时iSD1509恰当反映了真实的属特异性创新,包括特殊的环丙烷脂质(如clpn_pa_17_0_cyc_c)和脂多糖核心(PA_core_lipidA_c)。这一基线确保后续机器学习分类反映真实的通量分布,且可通过实验确定的信息进一步增强。

选定模板模型后,对iSD1509进行了多次初始模拟,发现模型无法在蔗糖和异生物质(苯、甲苯和二甲苯)上生长,也无法进行反硝化。因此,通过人工精选添加了部分模型反应以填补这些缺口,参考资源包括UniProt(https://www.uniprot.org/)、Kyoto Encyclopedia of Genes and Genomes(https://www.genome.jp/kegg/)、InterPro、PseudomonasDB,以及P. putida KT2440(iJN1463)、E. coli K-12 substr. MG1655(iML1515)和N. europaea(iGC535)的模型。所有添加的反应和代谢物均使用COBRA Toolbox功能(checkMassChargeBalance)[78]进行质量和电荷平衡检查。反应和代谢物的详细信息可在http://bigg.ucsd.edu/ [67]查看。除非另有说明,反应使用默认摄取速率,以便不同模型解之间进行更直接的比较。精选后,iSD1509能够在蔗糖上生长、降解异生物质,并在厌氧条件下进行反硝化。对于多亚基复合物,将参考基因-蛋白质-反应规则(复合物保留“AND”逻辑,同工型保留“OR”逻辑)直接映射到目标菌株基因座标签。随后进行功能验证阶段,系统消除在模拟M9(好氧和厌氧)和LB(好氧)培养基中不贡献生长表型的基因相关非必需反应。

该迭代精选过程使用MEMOTE[37]评估。MEMOTE通过检查注释完整性、化学计量一致性、代谢物和反应注释、生物量配方及整体网络完整性,提供GEMs的标准化评估。评分使用默认指标生成,但基因注释评分采用最佳值而非所有基因注释评分的平均值。所有重建模型的MEMOTE评分均高于81.9%,中位评分为85.1%,表明模型精选良好,质量足以用于比较性约束性代谢模拟。

扩展参考模型后,从BV-BRC下载P. aeruginosa UCBPP-PA14基因组,RefSeq ID为NC_008463.1[29]。将所有44条菌株特异性基因组序列与参考基因组进行BLAST比对。从BLAST结果中,以60%的PID阈值提取双向最佳命中。根据先前发表的方案[20]重建多菌株基因组。简言之,将BLAST结果解析为同源矩阵,行为iSD1509基因,列为菌株基因组ID。使用PID阈值将矩阵二值化为基因存在/缺失矩阵。使用COBRApy包[78]将同源矩阵信息用于重建草稿菌株特异性模型。使用函数rename_genes()将存在的基因映射至iSD1509模型基因,缺失基因保留在模型中(称为外部基因)以供进一步检查。草稿模型重建完成后,逐一敲除所有外部基因,随后在以葡萄糖为主要碳源的M9培养基上进行好氧和厌氧条件下的生长模拟。好氧模拟中,氧气摄取速率限制为20 mmol g DW⁻¹ h⁻¹,硝酸盐摄取速率为零;厌氧模拟则相反。若草稿模型产生生物量(生物量目标 > 0.001),则将该外部基因及其相关反应从模型中移除;否则保留该外部基因并标记以供进一步检查。iSD1509的好氧和厌氧生物量反应均用于菌株模型。

菌株代谢能力测定

多种培养基成分(M9、LB、吗啉丙磺酸和合成囊性纤维化痰培养基)取自先前报道的重建模型[27,35]。培养基中代谢物对应的交换反应边界设置为默认值(−1,000, 1,000),碳源除外(17 mmol g DW⁻¹ h⁻¹),氧气和硝酸盐摄取速率设为20 g DW⁻¹ h⁻¹。除非另有说明,采用默认摄取速率以提供标准化模拟框架,使重建模型间的代谢表型可直接比较,同时最小化菌株特异性转运参数引入的变异性。如Dahal等人先前报道,在厌氧模拟中……

Predicting Strain-Specific Metabolic Capabilities in the Gen
▲ 论文配图

研究结果

P. aeruginosa模型(iSD1509)的扩展

首要目标是获得高质量的假单胞菌GEM作为多菌株重建的参考。研究使用了最近发表的P. aeruginosa PA14 GEM(iSD1509),因为它建立在先前重建模型之上,包含任何P. aeruginosa GEM中最大的基因含量(1,509个基因),且是最准确的模型,基因必需性和底物利用预测准确率分别为92.4%和93.5%[27]。该模型主要用于研究毒力和药物增效。因此,研究测试了该模型降解异生物质(二甲苯、甲苯和苯)的能力。由于模型无法代谢这些化合物,研究使用P. putida KT2440(iJN1463)模型添加异生物质反应,Escherichia coli K-12 substr. MG1655(iML1515)模型添加中间反应[30],以及Nitrosomonas europaea(iGC535)添加硝化反应[31],因为这些模型注释完善且精选良好。对模板模型基因组进行同源性搜索,提取参与异生物质代谢基因的双向最佳命中对。共添加了3个转运反应和2个代谢反应(见Dataset S1)。反应添加后,模型能够在好氧(M9)条件下利用二甲苯、甲苯和苯作为碳源生长。精选后,模型包含1,514个基因和2,030个反应。

【数据】基因必需性预测准确率:92.4%;底物利用预测准确率:93.5%;添加反应数:3个转运+2个代谢;精选后基因数:1,514;反应数:2,030

假单胞菌菌株的比较基因组学

为生成具有代表性的比较代谢分析数据集,从BV-BRC和NCBI GenBank数据库中选择44个假单胞菌基因组,选择标准包括基因组完整性、注释质量以及属内系统发育和生态多样性代表性。优先选择具有公开注释的完整或高质量草稿基因组,并广泛覆盖临床、土壤、水生和废水环境中常见物种。当同一物种有多个基因组可用时,选择能捕获种内多样性同时最小化冗余的菌株。该数据集为重建菌株特异性GEMs和系统比较不同生态位中的预测代谢能力提供了标准化资源。按13个物种的分布如图1A和B所示,其中Pseudomonas sp.、P. aeruginosa、P. putida和P. fluorescens在数据集中拥有最多的基因组数。

(A) Species distribution of the 44 Pseudomonas genomic sequences downloaded from the Pathosystems Resource Integration Center (PATRIC) and National Center for Biotechnology Information (NCBI) GenBank databases. (B) Phylogenetic tree of 44 Pseudomonas strains reconstructed from 16S ribosomal RNA (rRN
▲ (A) Species distribution of the 44 Pseudomonas genomic sequences downloaded from the Pathosystems Resource Integration Center (PATRIC) and National Center for Biotechnology Information (NCBI) GenBank databases. (B) Phylogenetic tree of 44 Pseudomonas strains reconstructed from 16S ribosomal RNA (rRN

系统发育树显示,P. aeruginosa菌株与参考菌株PA14聚为一组,符合预期,因为它们属于同一物种(图1B)。在P. aeruginosa簇附近,发现若干Pseudomonas sp.菌株与P. fluorescens聚在一起,表明亲缘关系更近。还观察到其他Pseudomonas sp.菌株与P. zhaodongensis和P. stutzeri聚类,突显了未分类分离株间的系统发育多样性。这种聚类可能反映分类学不确定性或不完整的物种分配,而非不同的进化轨迹,强调了Pseudomonas sp.群体内部存在的遗传异质性。最后,P. putida菌株与P. protegens、P. asiatica、P. plecoglossicida和P. monteilii共同构成最远的分支。

将44条基因组序列与假单胞菌参考基因组进行双向BLAST比较。从比较结果中提取参考模型基因的百分比同一性(PID),生成1,514(模型基因)× 44(假单胞菌基因组)的同源矩阵。模型基因按参与的子系统进行注释,并生成PID热图(图1C)。P. aeruginosa基因组相对于参考基因组表现出最高的同一性比率,部分基因组在PID上显示变异,特别是在与转运功能相关的基因中。这符合预期,因为这些基因组属于同一物种的菌株。先前的泛基因组研究估计P. aeruginosa核心基因组大小为655至2,500个基因[32,33],因此菌株间直系同源基因数在此范围内是预期的。同样,已显示核心基因组大小随泛基因组重建中包含的菌株数而变化[33,34],样本量增加时核心基因组减小,反之亦然。

关于其他假单胞菌物种,在转运类别中观察到的直系同源基因较少,其次是氨基酸和碳水化合物代谢相关基因。这种基因组含量差异与P. putida菌株的报道一致[35],可能归因于物种所处生活方式和环境相关的不同代谢能力[36]。基于比较同源性分析(图1C),辅因子和维生素代谢、核苷酸代谢和萜类生物合成相关基因在分析的菌株中表现出比其他功能类别更高的一致性序列保守性。

【数据】基因组数:44;物种数:13;模型基因数:1,514;基因组矩阵:1,514×44;PID阈值:60%

菌株特异性GEMs的重建

为系统比较不同假单胞菌物种的代谢潜力,以精选参考模型为基础,通过基于同源性的基因转移、模型精炼和质量评估重建菌株特异性GEMs。首先,使用3个氨基酸序列同一性(PID)阈值(60%、70%和80%)评估直系同源严格性对GEM重建的影响。这些阈值代表中度到严格的同源性标准,覆盖了基于同源性的细菌GEM重建中常探索的范围;评估多个同一性阈值可系统评估直系同源置信度与模型完整性之间的权衡。在80% PID值下,仅9个模型(对应P. aeruginosa)拥有参考模型90%以上的基因,其余模型则低于约45%。在70% PID值下,38个模型拥有50%以上的基因。最后,在60% PID值下,41个初步模型拥有50%以上的基因。基于该分析(图S1),最终重建选择60% PID阈值,因为它在保留直系同源基因含量、维持模型功能性和最小化跨不同假单胞菌物种广泛缺口填补需求之间提供了最佳平衡。

所有存在基因(来自参考基因组)均映射至直系同源基因的基因座(来自菌株),基因-蛋白质-反应规则相应修改。对每个菌株模型中的所有外部基因进行基因必需性分析(M9和Luria–Bertani [LB]培养基)。与这些基因相关的非必需反应从模型中消除(Dataset S1)。在最小化外部基因数量并进行功能评估后,所有菌株特异性模型均能在M9和LB培养基上生长。使用MEMOTE[37]验证模型,所有模型评分均高于……

(A) Potential auxotrophies for the 44 strain-specific genome-scale metabolic models (GEMs). Rows are the GenBank accessions for the strains. Columns represent the nutrient for which the strains are auxotrophic. The Pseudomonas aeruginosa model had no additional auxotrophies; thus, it is not plotted.
▲ (A) Potential auxotrophies for the 44 strain-specific genome-scale metabolic models (GEMs). Rows are the GenBank accessions for the strains. Columns represent the nutrient for which the strains are auxotrophic. The Pseudomonas aeruginosa model had no additional auxotrophies; thus, it is not plotted.
Decision tree classifier of Pseudomonas species based on the 405 simulated conditions across 44 strain-specific models. Bar plots represent the classes that are split by the decision tree based on the ability of the models to grow on each substrate. Arrows show the outcome of the decision. Pie chart
▲ Decision tree classifier of Pseudomonas species based on the 405 simulated conditions across 44 strain-specific models. Bar plots represent the classes that are split by the decision tree based on the ability of the models to grow on each substrate. Arrows show the outcome of the decision. Pie chart
使用代谢和表达(ME)模型预测的通量。每个菌株的代谢(M)模型与ME模型之间各子系统标准化通量的差异。给出了每个子系统中的反应数量。结果按每个模型的物种着色。仅显示变化最大的子系统。手动整理的恶臭假单胞菌ME模型作为比较纳入(标记为P. putida;可在https://github.com/jdtibochab/pputidame/tree/master/model获取)。所有模型的约束条件相同,每种模式仅菌株特异性基因组序列不同。
▲ 使用代谢和表达(ME)模型预测的通量。每个菌株的代谢(M)模型与ME模型之间各子系统标准化通量的差异。给出了每个子系统中的反应数量。结果按每个模型的物种着色。仅显示变化最大的子系统。手动整理的恶臭假单胞菌ME模型作为比较纳入(标记为P. putida;可在https://github.com/jdtibochab/pputidame/tree/master/model获取)。所有模型的约束条件相同,每种模式仅菌株特异性基因组序列不同。

【数据】PID阈值测试:60%、70%、80%;80%阈值下>90%基因模型数:9个;70%阈值下>50%基因模型数:38个;60%阈值下>50%基因模型数:41个;MEMOTE评分:均>81.9%,中位85.1%

讨论与解读

假单胞菌物种展现出显著的代谢多功能性,这是其在多样环境、临床和工业生态位中生存的基础。本研究开发了Flux-to-AI框架,整合比较基因组学、基因组规模代谢建模、机器学习和ME建模,研究基因组多样性如何转化为菌株特异性代谢表型。通过重建44株假单胞菌的GEMs并模拟425种营养条件下的生长,研究识别了区分物种并揭示底物利用不同策略的关键代谢能力。ME模型分析提供了机制支持,证明这些代谢差异伴随着中心代谢、转运和细胞包膜相关通路中蛋白质组分配的变化。该研究建立的模型、计算流程和分析构成了研究假单胞菌属功能多样性的标准化资源。

编译者解读

本研究的方法论亮点在于将GEMs的数百次模拟输出转化为机器学习可用的生物学特征,使“代谢表型”成为分类假单胞菌物种的可量化指标。ME模型的引入尤为关键——它不仅验证了通量预测,还将代谢差异与蛋白质组分配联系起来,指向细胞包膜相关功能这一非直观结论。从合成生物学应用角度,该框架可用于预测菌株在特定污染物降解或目标产物合成中的潜力,减少湿实验筛选成本。局限在于模型预测仍需实验验证,且参考模板的单一性可能低估远缘菌株的独特代谢通路。后续若能将此框架扩展至更多菌株并整合实验数据迭代优化,将更具实用价值。

参考来源

Focil-Espinosa C, Dalldorf C, Martinez D, Zepeda A, Zuniga C. Predicting Strain-Specific Metabolic Capabilities in the Genus Pseudomonas with a Flux-to-AI Approach Reveals Hidden Cell Envelope Properties. Comput Struct Biotechnol J. PMID: 42597399.

PMID: 42597399

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 基于染色质可及性的酿酒酵母基因表达水平多机器学习模型预测 09-12