来源:Resource-aware cell factory design through multi-scale metabolic models with expression and proteome constraints(Fundamental Research)| 编译:DNA Lab Space | 原文许可:elsevier-subscription
导读
代谢工程中,理性设计微生物细胞工厂以实现高效生物合成仍是核心挑战。虽然整合蛋白质资源分配的先进建模框架(如酶约束模型ecGEM和表达-热力学通量模型ETFL)具有优越的预测能力,但缺乏实际的菌株设计工作流程。本研究开发了StrainOptimizer——一个模块化计算平台,在多尺度建模层面整合资源分配原理,包括表达-代谢耦合、亚细胞区室化和酶容量。基准测试表明,各原理各有优势:耦合代谢与表达的模型可识别非代谢靶点,细胞器水平蛋白质组约束提高了高蛋白成本产品的预测精度,基于蛋白质使用的目标函数持续优于传统通量方法。在工程化香紫苏醇高产酿酒酵母菌株中应用该平台,发现了传统方法遗漏的前体可用性新瓶颈,实验验证成功率达55%,滴度提升最高26%,生产率提高45%。
研究背景
生物制造利用工程微生物作为细胞工厂,为生产多种有价值化学品提供了可持续且环境友好的途径。该领域的核心挑战在于理性设计微生物菌株以实现经济高效的高产生产。尽管合成生物学的进展加速了基因工程周期,但由于细胞代谢的固有复杂性,有效修饰靶点的理性识别仍是主要瓶颈。
为应对这一挑战,系统生物学和基因组规模代谢建模提供了强大的计算机模拟框架。过去二十年中,已开发了众多经典计算算法(如OptKnock、OptForce、FSEOF和iBridge)来指导代谢工程。然而,这些方法建立在主要依赖化学计量约束的经典基因组规模代谢模型(GEM)之上,其预测细胞表型的能力常受限于忽略了有限酶容量和蛋白质组分配等关键生物学限制。
近年来,蛋白质资源分配原理已被认为是连接代谢通量与细胞生理学的基本概念。细胞必须最优地分配其有限的蛋白质组,以满足内在功能需求(如能量和前体供应)和外在生产需求。这一认识催生了新一代模型框架——ecGEM和ETFL——它们将蛋白质组分配约束纳入代谢模型,显著提高了预测能力。然而,这些先进模型缺乏系统性的菌株设计工作流程,限制了其在实际工程中的应用。StrainOptimizer平台的开发正是为了弥合这一鸿沟。
研究方法
2.1 平台框架
StrainOptimizer平台是一个开源Python包,采用模块化架构设计。它由五个主要模块组成:Manipulation(操作)、Simulation(模拟)、Analysis(分析)、Score rule(评分规则)和Strain design workflow(菌株设计工作流)。其中Strain design workflow模块作为核心,协调调用其他四个模块来预测目标化合物的遗传靶点。
该平台兼容多种建模框架,包括标准基因组规模代谢模型(GEM)、酶约束GEM(ecGEM)以及表达-热力学通量(ETFL)模型。值得注意的是,为降低计算复杂度并确保ecGEM和ETFL框架预测性能之间的公平比较,所有后续模拟和分析均采用表达-通量(EFL)建模方法。EFL是完整ETFL框架的简化变体:它保留了详细的蛋白质组分配和表达约束,但省略了热力学约束,从而提高了大规模靶点筛选的计算效率。需要强调的是,本研究中使用的EFL模型并非我们提出的新型结构修改,而是原始ETFL框架内原生提供的既有变体[13,23]。具体而言,EFL公式保留了所有全面的高分子合成和蛋白质组分配约束——包括mRNA和蛋白质表达、核糖体需求和酶容量——但在结构上省略了热力学模块(如吉布斯自由能计算和代谢物浓度界限)。我们平台中使用的酿酒酵母特异性EFL模型是利用原始开发者提供的官方开源yETFL代码库(https://github.com/EPFL-LCSB/yetfl)生成的,该代码库天然支持这种无热力学变体的构建。
Strain design workflow模块目前包含四种不同算法:ecFSEOF[17]、EUVA[17]、ecFactory[17]和iBridge[6]。这些算法已从其原始形式进行了适配,融入了先进功能,包括转录组数据整合、细胞器水平蛋白质组约束的应用以及与多种目标函数的兼容性(pFBA[58]、ppFBA[38]、MOMA[51]和MOPA[52])。
Manipulation模块提供关键模型修改功能,如更新酶周转率(kcat)、模拟基因敲除/敲低/过表达以及整合多组学数据。转录组数据整合使用troppo包(https://github.com/BioSystemsUM/troppo)中的GIMME方法[59]实现。
Simulation模块包含四种不同的目标函数用于预测细胞状态,兼容ecGEM和ETFL模型:基于通量的优化方法——简约FBA(pFBA)(最小化所有代谢通量之和)、MOMA(根据参考状态最小化蛋白质使用的调整);以及基于蛋白质的优化方法——蛋白质约束pFBA(ppFBA)(最小化维持表型所需的总酶使用量)、MOPA(根据参考状态最小化蛋白质使用的调整)。
Score rule模块提供两种评分和排序潜在遗传靶点的规则。如我们先前工作[17]所述,K-score根据与某基因相关的所有反应的平均通量得分(生产状态与野生型状态的平均通量之比)计算。此外,通量控制系数(FCC)[60]用于量化每个反应对细胞生长和生产通量的控制程度。
Analysis模块包括评估和可视化预测的工具,包括相平面分析以可视化工程菌株的生产包络面,以及网络分析功能以评估预测靶基因的代谢距离和网络连通性。
【数据】平台语言:Python;模块数:5;兼容模型:GEM、ecGEM、ETFL/EFL;算法数:4;目标函数数:4;kcat更新:支持;转录组整合方法:GIMME;评分规则:K-score、FCC
2.2 模拟目标函数
菌株设计工作流的第一步需要在各种生产条件下模拟细胞状态,以与野生型参考进行比较。这一过程依赖于不同的模拟目标来估计代谢通量和酶使用的分布。StrainOptimizer平台支持四种不同目标来比较通量水平和蛋白质水平优化策略,均兼容ecGEM和ETFL模型框架。
pFBA[58]是一种两步优化方法,用于识别最具通量效率的表型。第一步,执行标准FBA以最大化主要目标(v_obj),通常是生物质生产速率,找到其最优值(v_obj^opt):
(1) min./max. v_obj
(2) subject to S·v = 0
(3) lb_i ≤ v_i ≤ ub_i, i=1,…,n
其中S是化学计量矩阵,v是反应通量向量,lb和ub是每个通量i的下界和上界。第二步,将主要目标固定为约束(v_obj = v_obj^opt),最小化绝对通量之和以找到最紧凑的解:
(4) min. Σ|v_i|(i=1到n)
(5) subject to v_obj = v_obj^opt
类似于pFBA,ppFBA[38]寻找最具蛋白质效率的解。第一步最大化主要目标后,第二步最小化总蛋白质质量使用:
(6) min. Σe_i(i=1到m)
(7) subject to v_obj = v_obj^opt
其中e_i代表反应i的酶使用量,m是模型中的总酶数。
MOMA[51]通过假设扰动菌株将从参考(野生型)通量分布做出最小可能改变来预测其通量分布。它最小化参考与生产条件之间代谢通量的绝对差异之和:
(8) min. Σ|v_i′ − v_i|(i=1到n)
其中v_i′和v_i分别代表反应i在生产条件和野生型条件下的代谢通量。
MOPA[52]在蛋白质组水平上应用与MOMA相同的原理。它需要参考酶使用分布,并最小化参考与生产条件之间酶使用通量的绝对差异之和:
(9) min. Σ|e_i′ − e_i|(i=1到n)
其中e_i′和e_i分别代表反应i在生产条件和野生型条件下的酶使用量。
【数据】目标函数:pFBA(两步:最大化v_obj→最小化Σ|v_i|);ppFBA(最大化v_obj→最小化Σe_i);MOMA(最小化Σ|v_i′−v_i|);MOPA(最小化Σ|e_i′−e_i|)
2.3 基准数据集收集
基准数据集从酿酒酵母中五项高质量、系统性的代谢工程研究中整理而来。本研究明确排除了通过自动化文本挖掘或LLM生成的大规模数据集,因为这些数据常缺乏严格的生物学背景、存在不同的亲本菌株背景以及高噪声水平,会损害基准测试的准确性。
为确保一致的遗传和环境背景,每个产品案例研究中的实验验证靶点严格来自单一、全面的文献来源,而非跨不同研究聚合。这包括2-苯乙醇[33]、亚精胺[34]、游离脂肪酸[35]、香紫苏醇[36]和血红素[15]的生产靶点。选择这些产品是因为其前体代谢物的多样性和广泛的蛋白质合成成本范围。基准数据集共包含111个经实验验证的遗传靶点,每个案例研究贡献11至38个遗传靶点。
【数据】物种:酿酒酵母;案例数:5;产品:2-苯乙醇、亚精胺、游离脂肪酸、香紫苏醇、血红素;总靶点数:111;每案例靶点数:11-38
2.4 评估指标
为系统评估菌株设计算法的性能,我们使用了四个不同的指标。前两个评估预测准确性,后两个量化预测靶点的新颖性和非显而易见性。
Precision(精确率)衡量预测的遗传靶点中真正阳性(即经实验验证)的比例。高精确率分数表示算法具有低假阳性率。其计算公式为:
Precision = TP / (TP + FP)
其中TP(真正例)是预测且经实验验证的靶点数,FP(假正例)是预测但未经实验验证的靶点数。
Recall(召回率)衡量所有已知阳性靶点中被算法识别的比例。其计算公式为:
Recall = TP / (TP + FN)
其中FN(假负例)是未被算法预测出的实验验证靶点数。
Distance(距离)定义为从靶点反应到底物或产物的最短代谢路径长度(最小反应步骤数)。Connectivity(连通性)定义为与靶点反应相连的相邻反应数。这两个指标需结合解释:高连通性单独通常表明是众所周知的中心代谢枢纽,但与高代谢距离的交集则指向远处的复杂调控节点。预测这些远处枢纽对特定产品通量的系统性影响往往超出常规人类直觉。
【数据】评估指标:Precision、Recall、Distance(最短代谢路径长度)、Connectivity(相邻反应数)
研究结果
3.1 StrainOptimizer框架
我们开发了StrainOptimizer——一个模块化的计算机模拟菌株设计平台,扩展了我们先前工具ecFactory[17]的能力。为增强其对研究社区的可扩展性和可访问性,我们将整个代码库从MATLAB迁移到Python——一种具有更通用和广泛科学生态系统的开源语言[26]。该平台采用模块化架构开发,包含五个核心组件:Manipulation、Simulation、Score rule、Analysis和Strain design workflow。这种模块化为用户提供了显著的灵活性,既支持简化的一键式靶点预测,也支持设计复杂的定制计算工作流(图1)。

我们先前开发的ecFactory算法通过将酶约束FSEOF(ecFSEOF)与酶使用变异性分析相结合,展示了整合式多步骤菌株设计方法在靶点预测中的优势,确保了预测稳健性并最小化预测中的假阳性数量[17]。在此,我们从两个重要方面扩展了其能力。首先,基于代谢目标受关键酶丰度影响的原理,我们纳入了通量控制系数(FCC)[27]分析,作为靶点的可选评分和筛选方法(图1、S1)。其次,虽然原始ecFactory严格限于ecGEM,我们将算法适配为兼容机制上更复杂的多尺度模型。具体而言,我们选择表达-热力学通量(ETFL)模型作为代表性多尺度框架。
我们选择ETFL框架不仅因为其整合了严格的热力学约束,还因为其与成熟的Python生态系统兼容。此外,ETFL开发者提供了标准化操作程序(SOP),能够直接从现有ecGEM快速自动重建新物种的ETFL模型,使其特别适合通用可扩展的菌株设计平台[13]。
为进行严格的算法评估,我们建立了高质量基准数据集。认识到即使在同一物种内,由于宿主菌株遗传背景的差异[28-32],遗传修饰的效果也可能显著不同,我们以高严格性整理了数据集。对于酿酒酵母中五个选定的系统性代谢工程案例研究,实验验证靶点均来自单篇论文以确保一致的遗传背景。这包括2-苯乙醇[33]、亚精胺[34]、游离脂肪酸[35]、香紫苏醇[36]和血红素[15]的生产靶点。这些产品因其前体代谢物的多样性和广泛的蛋白质合成成本范围而被选中。基准数据集共包含111个经实验验证的遗传靶点,每个案例研究涵盖11-38个遗传靶点(表1)。
除高质量数据集外,全面的评估指标套件同样重要。为评估预测准确性,我们采用了两个标准指标:精确率(预测靶点中真正阳性的比例)和实验一致性/召回率(所有已知阳性靶点中被识别的比例)。除准确性外,代谢工程师的关键需求是在基因组规模上发现新靶点以进一步改善生产。我们假设,与主要产品生物合成途径拓扑距离较远或网络连通性较高的遗传靶点不太明显且可能更具影响力[6]。因此,为量化预测的新颖性,我们引入了两个额外指标:距离(从靶点反应到底物或产物的最短代谢路径长度,即最小反应步骤数)和连通性(与靶点反应相连的相邻反应数)。
为评估预测靶点的非直观性,这两个指标必须结合解释。虽然高连通性单独通常表明是众所周知的中心代谢枢纽,但其与高代谢距离(远离靶点产品途径)的交集则指向远处的复杂调控节点。预测这些远处枢纽对特定产品通量的系统性影响往往超出常规人类直觉。因此,这一组合指标可作为算法新颖性的稳健指示器,评估预测靶点对人类工程师而言的洞察力和非显而易见性(方法)。
总之,StrainOptimizer平台结合增强算法、高质量基准和全面评估指标,建立了稳健且整合的框架,为各种细胞工厂的系统优化提供了关键基础。
【数据】平台语言:Python(从MATLAB迁移);核心组件:5个;算法扩展:FCC筛选、ETFL兼容;基准数据集:111个验证靶点;产品数:5;每案例靶点数:11-38
3.2 StrainOptimizer在基因靶点预测和筛选中的评估
利用StrainOptimizer框架,我们比较了ecGEM和EFL模型在菌株设计中的性能,并评估了新的FCC评分方法在靶点筛选中的效果。为确保与ecGEM直接公平比较,我们使用了表达-通量(EFL)模型——完整表达-热力学通量(ETFL)框架的简化变体(排除热力学约束的ETFL变体)[13]。具体而言,EFL保留了ETFL的详细蛋白质组分配和表达约束,但明确排除了其热力学约束。我们采用这一EFL框架是因为其计算强度显著低于完整ETFL模型,且更适合多种工业菌株的自动重建。
由于ecFactory是一个整合式多步骤算法,我们首先分析了每个阶段生成的靶点集合:初始预测(L1),随后两个连续筛选步骤(L2和L3),以及我们新引入的FCC方法(图S1)。简要而言,L1分离基本的通量耦合靶点。L2随后筛选掉酶效率低的冗余靶点。L3利用组合模拟消除同一途径内功能重叠的靶点。最后,FCC方法可视为L3的平行步骤,评估酶丰度如何控制代谢通量(详见方法)。
对于ecGEM和EFL模型,我们观察到明显趋势:随着筛选水平从L1增加到L3,预测靶点的平均数量减少(L1:69,L2:50,L3:16,FCC:9),而平均精确率持续提高(L1:0.13,L2:0.14,L3:0.34,FCC:0.50)(图2A)。这种精确率的提高以筛选掉一些真正阳性为代价,导致召回率下降(L1:0.37,L2:0.30,L3:0.15,FCC:0.14)。引人注目的是,我们新的FCC方法比最严格的L3靶点实现了更高的精确率(L3对FCC:0.34对0.50),同时保持了相当的召回率水平(L3对FCC:0.15对0.13),主要通过识别更小、更精细的高置信度靶点集。

随后我们使用距离和连通性指标评估了预测的新颖性。我们发现高精确率的L3和FCC方法的靶点在连通性(L1:14,L2:14,L3:9,FCC:10)和距离(L1:6.6,L2:6.7,L3:6.7,FCC:5.6)方面平均得分较低,表明它们代表更直观、更易发现的遗传策略。这为用户创造了明确的权衡(图2B):对于寻求快速初始改良的研究人员,FCC或L3的高精确率靶点是理想选择。相反,对于处理高度工程化菌株的专家,更广泛的L1集合可作为发现新靶点以进一步提高产量的更丰富来源。
【数据】平均靶点数:L1=69,L2=50,L3=16,FCC=9;平均精确率:L1=0.13,L2=0.14,L3=0.34,FCC=0.50;召回率:L1=0.37,L2=0.30,L3=0.15,FCC=0.14;连通性:L1=14,L2=14,L3=9,FCC=10;距离:L1=6.6,L2=6.7,L3=6.7,FCC=5.6
3.3 亚细胞蛋白质组约束提高菌株设计预测精度
我们进一步探究了亚细胞蛋白质组约束对菌株设计预测性能的影响。细胞器的蛋白质组分配是细胞资源管理的重要层面,但经典模型通常将其忽略。我们在ecGEM和EFL模型中引入了细胞器水平的蛋白质组约束,评估其对不同蛋白质合成成本产品的预测效果。
图3展示了亚细胞蛋白质组约束的概念示意及酿酒酵母在30种不同培养条件下主要细胞器的蛋白质质量分数分布。结果显示,不同细胞器的蛋白质分配随培养条件显著变化,表明亚细胞蛋白质组约束能提供额外的信息维度,提高对高蛋白成本产品(如血红素)的预测精度。

对于高蛋白成本、细胞器特异性产品(如血红素),引入亚细胞蛋白质组约束后,预测精确率显著提高。这一结果表明,细胞器水平的资源分配约束能够捕捉到传统模型无法反映的生物学限制,特别是对于需要特定细胞器内大量蛋白质合成的产品。
【数据】培养条件数:30;细胞器类型:主要细胞器(原文未详述具体类型);蛋白质量分数:随条件变化(原文未给出具体数值)
3.4 基于蛋白质的模拟目标改善菌株设计预测性能
我们比较了基于通量和基于蛋白质的模拟目标函数在菌株设计中的表现。图4A显示了五种不同产品在通量水平和蛋白质水平上生长与生产之间的曼哈顿距离比较。结果表明,在蛋白质水平上,生长与生产之间的冲突通常比通量水平更为明显,这反映了蛋白质资源分配的竞争关系。

图4B展示了比较生产与野生型条件时蛋白质使用和代谢通量的log2倍数变化分布。蛋白质使用的变化幅度通常大于代谢通量的变化,表明细胞通过调整蛋白质组分配来响应生产需求,而这种调整在传统通量分析中往往被忽视。基于蛋白质的优化目标(ppFBA和MOPA)在识别非代谢靶点方面优于传统通量目标,特别适用于高蛋白成本产品。
【数据】产品数:5;比较维度:通量水平与蛋白质水平;变化度量:log2倍数变化(具体数值原文未详述)
3.5 StrainOptimizer在香紫苏醇高产酿酒酵母中的应用
为展示平台的实用价值,我们将StrainOptimizer应用于工程化香紫苏醇高产酿酒酵母菌株。图5A展示了预测靶点的计算工作流,该工作流整合了菌株特异性数据(表型、转录组学)、代谢模型(ecGEM、EFL)以及不同发酵阶段(葡萄糖期和乙醇期)。

该平台识别出传统方法遗漏的前体可用性新瓶颈。实验实施这些靶点后,成功率达55%,滴度提升最高26%,生产率提高45%。这一结果验证了StrainOptimizer在将资源分配理论转化为实际工程策略方面的有效性。

【数据】菌株:工程化香紫苏醇高产酿酒酵母;成功率:55%;滴度提升:最高26%;生产率提高:45%;发酵阶段:葡萄糖期、乙醇期
讨论与解读
本研究的核心发现是蛋白质资源分配原理的最佳应用具有情境依赖性。在模型层面,ecGEM和EFL模型的比较揭示了它们的互补优势。例如,在预测游离脂肪酸靶点时,ecGEM在识别磷酸戊糖途径靶点方面更有效,而EFL模型则精确定位了TCA循环中的关键靶点,表明整合两种模型类型的策略最为实用。更重要的是,EFL模型可以将靶点搜索空间扩展到代谢酶之外。预测下调全局转录用于低蛋白成本产品2-苯乙醇,与上调线粒体表达用于高蛋白成本、细胞器特异性产品血红素,展示了多尺度模型捕获与系统级资源权衡相关的遗传靶点的独特能力。
StrainOptimizer弥合了资源分配理论与应用工程之间的鸿沟,提供了一个在酵母系统中验证的稳健框架,同时展示了扩展到多种物种和底物的显著潜力。
【编译者解读】StrainOptimizer的亮点在于将"蛋白质资源分配"这一系统生物学原理真正落到了工程可用的工具层面。FCC评分方法在保持召回率的同时将精确率从0.34提升至0.50,这一改进直接回应了代谢工程中"预测靶点过多、验证成本过高"的实际痛点。将模型从MATLAB迁移至Python生态也是明智之举——降低了使用门槛,便于社区采纳和扩展。不过,55%的实验成功率虽具说服力,但样本量有限,且目前验证仅限于酿酒酵母。从合成生物学应用角度看,该框架向非模式工业菌株(如大肠杆菌、曲霉)的迁移将是检验其通用性的关键一步。
参考来源
Wang H. Resource-aware cell factory design through multi-scale metabolic models with expression and proteome constraints. Fundamental Research, 2026. DOI: 10.1016/j.fmre.2026.07.008
DOI: 10.1016/j.fmre.2026.07.008