来源:Efficient cell factory design by combining meta-heuristic algorithm with enzyme-constrained metabolic models(Bioresource Technology)| 编译:DNA Lab Space | 原文许可:elsevier-subscription
导读
微生物细胞工厂的理性设计长期受困于代谢网络复杂性与组合爆炸问题。本文提出MetaStrain——一个整合酶约束模型(ecModels)与元启发算法的统一计算框架,通过降维预筛选与智能搜索两大模块,自动预测非直觉的组合基因编辑靶点。在酿酒酵母中模拟验证了2-苯乙醇与亚精胺生物合成的显著提升,并在大肠杆菌中通过湿实验实现了L-色氨酸产量最高61.25%的提升,展示了计算预测与实验验证之间的高效闭环。
研究背景
21世纪人工智能与合成生物学的快速发展,使微生物应用拓展至生物燃料、医药、食品添加剂及工业酶等领域。全球对石油基产品的需求增长与环境可持续性关切,推动微生物发酵生物合成路径逐步替代传统化学合成。然而,要在传统化学生产的竞争格局中立足,必须开发高性能微生物细胞工厂(MCFs),通过代谢工程重编程细胞以获得更优的滴度、速率和产率(TRY)指标。
传统菌株优化高度依赖研究者经验,以定性和直觉性设计原则为主,需大量试错实验,耗时费力且探索范围有限。约束型建模的发展为定量代谢模型提供了可靠基础,但组合靶点预测仍受制于组合爆炸的计算瓶颈。本文提出的MetaStrain框架,正是针对这一核心矛盾,将酶约束模型与元启发算法深度融合,以实现高效、稳定、可实验验证的组合基因靶点预测。
研究方法
2.1 MetaStrain框架
MetaStrain工作流程包含四个关键步骤:
(1) 模型预处理与参考通量获取:针对不同微生物,首先调整并验证ecModels,以准确模拟不同环境条件下的代谢状态。具体包括:基于特定培养基组成和可用实验数据约束交换反应——将培养基中不存在底物的摄取速率限制为零,实验测定的摄取和分泌通量约束至观测值。为确保数值稳定性,所有初始定义为无穷大的反应(主要为胞内通量)上限设为有限值1000。为提高蛋白质合成相关通量的分辨率,模型精度设为10⁻⁹。必需基因从敲除操作的候选列表中排除以避免致死表型。同理,阻断反应从决策变量中移除,因其操作不产生表型变化。此步骤经人工验证以防止潜在靶点的错误排除,确保生物学可行性与计算效率。对于外源产物,将相关途径纳入模型,包括添加新反应、更新现有反应、实施基因操作和设置约束。随后通过FBA(通量平衡分析)施加目标产物的最低生产水平,获得野生型菌株表型。
(2) 基因降维与注释:采用ecFSEOF方法预筛选和压缩基因组规模搜索空间。由于表型评估计算密集,此预筛选构成关键的计算权衡。通过将候选靶点缩小至100个以内,MetaStrain确保相对较小的随机初始化群体即可充分探索决策空间。这显著降低了搜索空间复杂度,为组合优化提供高效起点,同时大幅降低硬件门槛,使研究者可在本地桌面环境运行该框架。
(3) 优化过程与算法实现:MetaStrain集成高效的元启发优化框架,以目标产物产率为目标函数,根据不同算法的要求编码个体。主要步骤包括群体初始化、适应度评估和进化操作。附加技术如精英保留以加速收敛、适应度函数中的正则化项以控制靶点数量、自适应参数控制及外部存档,可进一步增强算法性能。
(4) 结果分析与验证:鉴于算法的随机性,每个靶向产物在特定菌株中独立进行十次实验。优化结果用公式(7)评分并进行统计分析,以识别具有强稳定性和生物学意义的组合基因靶点。结果进一步与实验验证靶点比较及途径机制研究验证,评估其合理性与可行性。此外,每个最优策略可进一步进行靶点冗余分析,穷举搜索可获得固定大小的组合,为湿实验实施提供直接、可操作的指导,实验验证对确保预测可靠性至关重要。
2.2 酿酒酵母ecModel
基因组规模代谢模型(GEMs)通过基因-蛋白质-反应(GPR)规则整合基因、酶和反应,广泛用于表示微生物代谢网络。这些模型将微生物代谢编码为M×N维化学计量矩阵(S矩阵),行代表代谢物,列对应反应,矩阵元素表示化学计量系数。GECKO方法通过在S矩阵中引入额外行列,将酶作为反应组分显式纳入。该方法强调代谢通量的基本约束(公式1):每个通量(vⱼ)不能超过最大酶促速率(v_max),后者由酶的胞内浓度及其转换数决定。
vⱼ ≤ k_catⁱʲ · [Eᵢ] (1)
其中[Eᵢ]表示每个酶Eᵢ的胞内浓度,k_catⁱʲ为转换速率。该定量方法在酶水平施加软约束,整合蛋白质组学数据。在缺乏详细蛋白质组学数据的情况下,应用类似FBAwMC方法的全局酶质量约束,引入称为"蛋白质池"的伪代谢物,确保所有代谢反应通量保持在生物学合理范围内。本研究采用酿酒酵母ecModel ecYeast8.3.4——一种特征明确的工业底盘——由Lu等人开发,其相关参数见补充材料。
【数据】菌株:酿酒酵母ecYeast8.3.4;通量上限:1000;模型精度:10⁻⁹;候选靶点上限:100;独立实验次数:10
2.3 大肠杆菌ecModel
大肠杆菌是代谢工程中的基石模式生物,具有特征明确的遗传背景、快速生长及成熟可靠的基因组编辑工具。已有高质量大肠杆菌GEMs可用。在此基础上,Ye等人整合酶动力学信息构建了ecModel ec_iML1515,相关参数见补充材料。为确保计算预测与实验系统紧密吻合,研究者在ec_iML1515之上引入了菌株和条件特异性约束,并进行靶向模型精炼。
具体而言,基线L-色氨酸生产菌株MGHT-10-1携带b2600、b3708和b2599的敲除,并过表达末端L-色氨酸生物合成基因b1260、b1261、b1262、b1263和b1264。在模型中,对应于敲除的反应通过将其上限设为0进行约束。对于过表达,由于缺乏可直接校准的参考通量或倍数变化测量值,采用表型对齐策略:将模型的L-色氨酸合成速率和葡萄糖摄取速率分别固定为本研究基线菌株MGHT-10-1的实验测定值0.02 mmol gDW⁻¹h⁻¹和1.8 mmol gDW⁻¹h⁻¹,然后执行FBA最大化生物量。该约束集相比未对齐模型显著提升相关途径的通量,从而在模型层面有效表征过表达。
关于培养基和环境约束,通过从模型中移除不可用离子(如Fe³⁺、Ni²⁺和MoO₄²⁻)来匹配实验培养基配方。为模拟酵母提取物的添加,启用其组成营养物——特别是氨基酸(包括酪氨酸和苯丙氨酸)——的摄取,将相应反向交换反应(通常以a_REV后缀表示)的上限设为1000 mmol gDW⁻¹h⁻¹。此外,考虑培养基中柠檬酸盐的存在,将反向柠檬酸盐交换反应的上限显式设为1000 mmol gDW⁻¹h⁻¹。这些无限制摄取设置反映了培养基的营养丰富特性,假设这些组分相较主要碳源对细胞生长非限制性。在算法搜索阶段,为维持可行性并避免非生理性极端解,仅对生长和产物形成施加最小下限——具体为最小生长速率0.1和最小产物形成速率0。
【数据】菌株:大肠杆菌ec_iML1515(MGHT-10-1);L-色氨酸合成速率:0.02 mmol gDW⁻¹h⁻¹;葡萄糖摄取速率:1.8 mmol gDW⁻¹h⁻¹;反向交换反应上限:1000 mmol gDW⁻¹h⁻¹;最小生长速率:0.1;最小产物形成速率:0;基因敲除:b2600、b3708、b2599;过表达基因:b1260-b1264

研究结果
4.1 MetaStrain:优化代谢工程策略的新框架
MetaStrain框架通过模块化计算流程设计最优代谢工程策略。这一物种无关的框架包含两个主要模块(图1a、b):初始筛选模块和搜索模块。得益于模块化架构,MetaStrain可整合各种菌株设计算法进行降维,从而补充和扩展其适用性。此外,它允许集成智能计算领域的高级优化算法。结合定制编码方案和独特的评估流程,这些组件使整个工作流程中组合基因靶点策略的全自动预测成为可能。
在第一个模块中,采用先前算法ecFactory的第一步来降低酶编码基因的维度,从而为下游优化生成优先候选基因集。在搜索模块中,每个个体编码一个组合基因编辑策略,使用ecMOMA模拟相应工程菌株的表型(图1c),以目标产物产率作为适应度值。为快速预测,首先采用依赖于筛选模块降维和靶点注释的二进制编码遗传算法(binGA)。此外,两种替代元启发算法——符号编码遗传算法(symGA)和带可选外部存档的自适应差分进化(JADE)——可独立应用于降维后的基因列表。与binGA不同,这两种算法自主确定每个基因的操作类型(过表达、敲低或敲除),不依赖先前注释。尽管计算强度更高,但该方法消除了初始筛选的潜在偏差,拓宽了靶点相互作用的探索空间,并保持与未注释降维工作流的兼容性。
搜索过程中可加入精英保留策略以加速收敛,同时通过优化适应度函数或参数控制选定的编辑靶点数量。为增强框架鲁棒性,进行了多次独立优化运行。这使得能够对结果进行统计分析,并基于综合标准(公式7)选择最有前景的策略。优化结果通过识别和移除冗余靶点进一步精炼,有助于枚举固定大小的最优基因靶点组合,在预测性能与实验可行性之间保持平衡。MetaStrain的多功能性和有效性通过对不同目标产物和宿主菌株设计MCFs的案例研究得到验证。部分结果随后经湿实验进一步验证,详见后续章节。
【数据】算法:binGA、symGA、JADE;评估方法:ecMOMA;适应度:目标产物产率;独立运行次数:多次
4.2 MetaStrain增强酿酒酵母2-苯乙醇生产的基因靶点预测计算机模拟评估
首先评估MetaStrain在2-苯乙醇(2-PE)生产中的应用——2-PE是一种用于食品、化妆品和制药的高价值芳香化合物——以检验其在酿酒酵母中导航组合基因设计空间和恢复生物学意义策略的能力。三维相平面分析揭示了2-PE生产、生物量合成和葡萄糖消耗之间的显著代谢权衡(见补充材料),强调需要合理调整代谢网络以优化资源分配而不损害细胞活力。
使用ecYeast8.3.4的模拟表明,2-PE生产的理论最大通量为4.9009 mmol gDW⁻¹h⁻¹,初始适应度值为0.1231。基于ecFSEOF,鉴定出52个候选基因(表1),每个基因具有指定的编辑方向:过表达、敲除或敲低。
进一步设计了灵活的个体编码(图2a),可与各种算法接口,展示了所提出框架的多功能性。首先实施binGA,在上述52个候选基因上运行。该算法在两种适应度函数下均表现出稳健的收敛结果——有正则化项(F₂)和无正则化项(F₁)——识别出多种具有生物学意义的编辑策略(图2b、c)。使用两种适应度函数的binGA搜索均采用精英策略。
其中,涉及敲低两个靶点——YAL038W(CDC19)和YPL262W(FUM1)——的策略被重复预测(图2d)。机制上,CDC19编码丙酮酸激酶,这是糖酵解中的关键酶,催化磷酸烯醇丙酮酸不可逆转化为丙酮酸。敲除丙酮酸激酶反应已被提出作为增加莽草酸途径通量的理论策略。然而,CDC19的完全敲除被发现无法在葡萄糖上生长。为克服此问题,Williams等人(2015)实施了基于群体感应连接RNA干扰的动态、生长后期抑制系统来下调CDC19,该方法使产物滴度显著增加。敲低CDC19降低糖酵解通量,从而减少丙酮酸进入三羧酸(TCA)循环的输入,增加前体苯丙氨酸的可用性,并通过Ehrlich途径促进2-PE生物合成。为解决伴随的丙酮酸供应减少,细胞采用补偿机制。值得注意的是,CDC19的旁系同源物PYK2的活性在低葡萄糖条件下转录去抑制,提供丙酮酸激酶活性的替代来源。此外,丙酮酸可通过其他代谢途径再生,如丙氨酸的转氨基作用。这些备用途径有助于维持必要的丙酮酸池以支持莽草酸途径和整体代谢稳态,确保CDC19敲低策略的可行性。
FUM1编码延胡索酸酶,催化TCA循环中延胡索酸转化为苹果酸。敲低FUM1削弱TCA循环活性,减少能量代谢中的过度竞争,进一步优化碳通量向目标产物的分配。CDC19和FUM1的联合敲低不仅减少竞争代谢途径的资源消耗,还协同增强碳通量向目标代谢途径的分配。该策略有效重塑代谢网络中的全局资源分布,为2-PE的高效生物合成提供了清晰的组合基因靶点(表2)。此外,还鉴定出非直觉性编辑如ARO8和ACO1的敲低,为实验验证提供了可测试的假设。
为释放计算机设计的全部潜力,移除了每个候选基因的指定编辑方向,仅在降维基因集上搜索。该策略显著扩展了搜索空间,同时增加了搜索景观的复杂性,对算法性能提出更高要求。最初采用symGA进行搜索。尽管加入了精英保留策略,symGA表现出快速收敛(见补充材料)。在十次独立实验中稳定性较低,十次运行中没有任何单一靶点被一致预测,许多基因表现出…

【数据】菌株:酿酒酵母ecYeast8.3.4;2-PE理论最大通量:4.9009 mmol gDW⁻¹h⁻¹;初始适应度:0.1231;候选基因数:52;预测策略:CDC19+FUM1敲低;重复预测靶点:YAL038W、YPL262W




讨论与解读
本研究提出的MetaStrain算法将ecModels与高效元启发算法相结合,为复杂代谢工程中的组合基因靶点优化挑战提供了创新解决方案。其在多个优化任务中的卓越表现证明该算法能够识别非直觉性和创新性的基因编辑策略,同时确保结果稳定性,为开发高效微生物细胞工厂提供关键支持。
与MEWpy等通用工具箱不同,MetaStrain被设计为专门面向湿实验适用性的闭环框架。利用核心的双模块架构进行降维和优化,MetaStrain进一步整合了专用冗余分析工具。这些工具自动从优化结果中严格过滤非必需靶点,输出简洁的固定大小策略。这一能力直接弥合了计算预测与湿实验实施之间的鸿沟,高效识别和构建高产大肠杆菌菌株MGT-20即为明证。利用ecModels而非传统GEMs的附加价值在于其显式的酶合成和使用反应,使MetaStrain能够通过调节酶约束来数学表征遗传干预,特别是过表达和敲低。
编译者解读:MetaStrain的核心价值在于将计算成本从"组合爆炸"压缩至可操作的搜索空间——通过ecFSEOF预筛选将候选基因控制在百以内,再以元启发算法智能探索。这种"降维+搜索"的两段式设计,既保留了ecModels的酶约束精度,又规避了穷举搜索的不可行性。大肠杆菌中61.25%的L-色氨酸产量提升验证了其实验闭环能力。局限在于:模型预测的准确性仍高度依赖初始模型的注释质量与参数校准,且对非模式菌株的适配性尚未验证。未来若能将深度学习代理模型替代部分FBA评估,计算效率或可再提升一个量级。
参考来源
Liao W. Efficient cell factory design by combining meta-heuristic algorithm with enzyme-constrained metabolic models. Bioresource Technology, 2026. DOI: 10.1016/j.biortech.2026.134706
DOI: 10.1016/j.biortech.2026.134706