基于混合建模与枣莲果汁的酿酒酵母生物量优化研究

来源:Optimizing Saccharomyces cerevisiae biomass production with Ziziphus lotus juice via hybrid modeling approaches(Process Biochemistry)| 编译:DNA Lab Space | 原文许可:elsevier-subscription

📎 相关工具:参考文献格式化

导读

传统发酵底物成本高、可持续性差,推动研究者寻找非常规碳源。本研究首次将北非传统果实——枣莲(Ziziphus lotus)汁用作酿酒酵母发酵碳源,结合Plackett-Burman筛选、响应面法(RSM)、人工神经网络(ANN)与遗传算法(GA),实现生物量从3.81 g/L提升至7.23 g/L的近两倍增长。混合建模策略在预测精度上显著优于传统RSM,为微生物发酵过程的非线性优化提供了可迁移的方法框架。

研究背景

酿酒酵母是生物技术领域最重要的微生物之一,长期用于食品、饮料和制药工业,能够将糖转化为乙醇、二氧化碳和生物量。其大规模生产通常依赖糖蜜、葡萄糖等富含糖类的底物,但对传统原料的依赖引发了经济性与可持续性担忧。枣莲(Ziziphus lotus)属于鼠李科灌木植物,广泛分布于阿尔及利亚奥雷斯地区等干旱和半干旱区域,其红色果实(俗称"Nbeg"或"jujube")营养丰富,含氨基酸、三酰甘油、碳水化合物、蛋白质、甾醇、膳食纤维、维生素和矿物质等多种成分。碳水化合物约占果实可食部分的10.15%,是主要组分。将这种丰富的自然资源开发为发酵碳源,兼具经济与生态价值。然而,枣莲汁中复杂的营养成分与酵母代谢之间的非线性关系,使传统统计优化方法面临精度瓶颈,需要引入机器学习等混合建模手段加以突破。

研究方法

2.1 枣莲汁的制备

采自阿尔及利亚姆西拉地区的枣莲果实经过精细的制备流程。首先将果实清洗、干燥,随后在蒸馏水中煮沸60分钟,温度100°C,料液比为1:5(质量/体积)。煮沸后,通过纱布挤压提取果汁(ZLJ),再经4000 rpm离心30分钟澄清,有效去除种子和细胞碎片。所得上清液富含营养物质,作为发酵培养基的碳源。为确保对培养条件的精确控制,采用DuBois等[23]描述的比色法测定提取果汁的总糖含量。随后将果汁适当稀释,以达到培养基所需的浓度。本研究使用的ZLJ从与发酵底物应用相关的参数角度进行了表征。在接种前,采用标准分光光度法对配制好的发酵培养基(枣莲汁补充氮源和矿物盐)测定了总糖[23]、蛋白质含量[24]、总酚含量[25]和总黄酮含量[26]。ZLJ的详细代谢组学分析不在本工作范围内。

【数据】煮沸温度:100°C;煮沸时间:60min;料液比:1:5(w/v);离心转速:4000rpm;离心时间:30min;总糖测定方法:DuBois比色法

2.2 微生物培养

本研究使用购自LeSaffre(阿尔及利亚,目录号2300042)的商业酿酒酵母菌株。将冻干酵母先在YPD培养基上纯化,通过形态学和理化特性确认其身份和纯度。确认后,该菌株被赋予实验室代码LMA-Sc,并在15%甘油中于4°C保存。接种时,将LMA-Sc菌株从甘油储备液中在YPD琼脂上划线复苏,随后在含酵母提取物(10 g/L)、蛋白胨(20 g/L)和葡萄糖(20 g/L)的液体YPD培养基中培养。所得培养物以2%(v/v)接种量接种摇瓶。种子培养物在30°C、搅拌条件下培养14小时以达到指数生长期。然后将此活跃生长期的培养物以2%(v/v)接种量接种实验发酵瓶。以ZLJ为主要碳源的发酵培养基补充了氮源(蛋白胨和YE)、硫酸铵、磷酸二氢钾和必需矿物质。用1 M NaOH或1 M HCl将pH调至6.0,培养基在使用前于121°C灭菌15分钟。该配方为酵母生物量生产提供了最佳环境。长期保存时,酵母细胞以甘油储备液形式于–80°C保存,以保持活力和遗传稳定性。发酵在250 mL锥形瓶中进行,每瓶含50 mL培养基。以2%(v/v)的制备好的种子液接种,调节光密度(OD;λ=660 nm)至2,并在30°C、200 rpm旋转摇床连续振荡条件下培养。该装置提供均匀混合和通气,以支持酵母最佳生长和生物量生产。培养pH、温度和接种量根据先前研究[27,28]固定在酿酒酵母的报道最优值(pH=6,温度=30°C,接种量=2% v/v)。这种方法允许选择性研究营养组成的影响,同时避免与公认的物理参数产生混杂交互作用。生物量浓度作为培养基性能指标,最初通过660 nm光密度(OD660)测量,随后转换为细胞干重。干重测定遵循美国国家可再生能源实验室(NREL)[29]描述的程序。收集细胞,洗涤以去除残留培养基,转移至预先称重的容器中,在对流烘箱中于105°C干燥过夜,直至获得恒重。

【数据】菌株:S. cerevisiae LMA-Sc(LeSaffre,目录号2300042);YPD组分:YE 10g/L、蛋白胨 20g/L、葡萄糖 20g/L;接种量:2%(v/v);种子培养:30°C、14h;发酵pH:6.0;灭菌:121°C、15min;发酵体系:250mL瓶/50mL培养基;OD660:2;培养条件:30°C、200rpm;干重测定:105°C过夜;保存:15%甘油4°C、–80°C长期

2.3 统计设计

采用PBD来识别培养基组分的主要效应,假设所有交互作用可忽略,并确定影响酵母生物量生产的显著变量[30]。通过15次实验运行筛选10个因素(补充材料表S1),每个变量在低水平和高水平下测试。PBD的一阶多项式模型表达如下:

(1) y = β₀ + ∑βᵢxᵢ

其中y代表实验响应(酵母生物量),x₁…xᵢ是编码自变量,β₀和βᵢ分别是截距和线性项的回归系数。补充材料表S2显示了Plackett-Burman设计中测试的变量水平,每个变量代表一种培养基组分,在低(-1)和高(+1)水平下测试。编码水平分配给酵母提取物(YE)、蛋白胨、KH₂PO₄、MgSO₄、MnSO₄、FeSO₄、CaCl₂、NaCl、(NH₄)₂SO₄和[ZLJ]等因素。每个因子的编码按以下方程计算:

(2) xᵢ = (Xᵢ − X₀) / ΔX

其中xᵢ是编码值,Xᵢ是实际值,X₀是中心点,ΔX是高或低水平与中心值之间的步长变化。随后,采用Box-Behnken设计(BBD)优化PBD识别出的显著因素。选择用于BBD的因素为酵母提取物(X₁)、MgSO₄(X₂)、MnSO₄(X₃)和[ZLJ](X₄),在三个水平(-1、0、+1)下测试其对酵母生物量生产的影响(补充材料表S3),其他变量保持在低水平。响应数据拟合二阶多项式模型:

(3) y = β₀ + ∑βᵢxᵢ + ∑βᵢᵢxᵢ² + ∑βᵢⱼxᵢxⱼ

其中βᵢᵢ和βᵢⱼ分别代表二次项和交互项系数。该模型能够详细理解变量间的线性、二次和交互效应,有助于准确预测和优化酵母生物量生产。

【数据】PBD设计:10因素15次实验;BBD设计:4因素3水平27次实验;因素编码:低(-1)、中心(0)、高(+1)

2.4 数据分析

所有实验设计、模型拟合和统计分析均使用JMP 17(SAS Institute)进行。模型充分性基于关键统计参数评估,包括相关系数(R²)、F检验和p值。采用95%置信水平评估模型可靠性和有效性,遵循既定指南[31]。这种严格评估确保了在不同条件下酵母生物量响应预测的稳健性和可信度。

【数据】软件:JMP 17;置信水平:95%

2.5 机器学习辅助优化

#### 2.5.1 模型开发

虽然RSM能有效识别显著因素和交互作用,但它依赖预定义的多项式模型,可能无法完全代表生物系统的非线性动态。鉴于调控酵母生长的复杂代谢调控和营养相互作用,ANN被整合为补充方法以提高生物量生产预测精度。GA随后与ANN耦合,实现对营养组成的全局优化,避免收敛到局部最优。ANN是数据驱动的建模工具,能够捕捉多个输入变量与系统响应之间的复杂非线性关系[32,33]。本研究采用多层感知器(MLP)形式的前馈神经网络,这是生物过程建模中使用最广泛的ANN架构[34]。网络由输入层、一个或多个隐藏层和输出层组成。输入层和输出层的神经元数量分别对应过程变量数和响应参数数,而隐藏神经元的最优数量取决于系统复杂度,必须凭经验确定[35]。在模型训练期间,输入数据通过网络向前传播。在每个神经元处,计算输入的加权和,并通过激活函数进行变换。

【数据】ANN架构:MLP前馈神经网络;隐藏层数:1个或多个(最优需经验确定)

研究结果

3.1 生物量生产显著培养组分的筛选

本研究基于PBD通过15次实验运行评估了10个自变量对酵母生物量生产的影响,详见补充材料表S2。PBD的正交性使得每个因素可以在不考虑交互作用的情况下独立评估[40]。将一阶模型拟合实验数据,由方程11表示:

(11) Y = 13.46 + 0.66X₁ + 0.033X₂ − 0.1583X₃ − 0.3583X₄ + 0.3583X₅ − 0.23X₆ − 0.09X₇ + 0.18X₈ − 0.31X₉ + 2.39X₁₀

其中Y代表酵母生物量产量,X₁-X₁₀表示表S2中列出的测试因素。模型表现出很强的解释力,R²为0.99,表明99%的生物量产量变异得到了解释。F值进一步证实了回归的统计显著性。使用P值(表1)对参数显著性进行统计评估,确定了四个对生物量生产有显著影响的因素:酵母提取物、MgSO₄、MnSO₄和糖浓度。其中,糖浓度影响最大,置信水平达99.99%。相反,其余变量对生物量产量无显著影响(p > 0.05)。表1还总结了模型拟合统计量,包括R²、调整R²、RMSE和失拟概率。尽管调整R²值为0.96证实了模型的稳健性,但预测R²与调整R²之间的差异凸显了一阶方程的局限性[40]。在复杂的多变量系统中,一阶和二次多项式模型的类似局限性已有报道,强非线性效应降低了经典RSM公式的预测稳健性[21]。

这些结果与酿酒酵母的代谢需求一致,同时揭示了通过优化实现生物量两倍增长的生化基础。枣莲基培养基中较高的糖水平通过糖酵解和磷酸戊糖途径增强碳通量,提高ATP、还原力和生长增殖所必需的生物合成前体的供应[41]。酵母提取物通过提供易同化的有机氮、氨基酸、肽和B族维生素发挥关键作用,驱动蛋白质合成、核苷酸产生和核糖体生物发生。RSM分析中酵母提取物显著的线性和二次效应凸显了生物量形成对氮水平的敏感性,偏离(过量或缺乏)都会破坏代谢平衡并损害生长效率[42]。酵母提取物与MgSO₄之间的显著交互作用进一步强调了协同代谢互作——镁离子作为ATP依赖酶(包括糖酵解激酶)的必需辅因子,并支持核糖体稳定和核酸代谢。因此,最佳的Mg²⁺供应增强了氮源衍生构建模块向生物量的掺入,放大了酵母提取物的促生长效应[43]。同时,Mn²⁺补充通过激活碳水化合物代谢酶和增强氧化应激防御(通过锰依赖性超氧化物歧化酶)来增强细胞性能,这是对枣莲等富含糖的果实底物所施加的渗透和氧化挑战的关键适应[44]。总体而言,这些增强的营养动态可能加速核糖体生物发生和翻译速率,促进观察到的显著生物量积累[45]。

【数据】PBD模型:R²=0.99;调整R²=0.96;显著因素:YE、MgSO₄、MnSO₄、糖浓度;糖浓度置信水平:99.99%;不显著因素:p>0.05

酿酒酵母实际生物量值与预测生物量值的对比图。
▲ 酿酒酵母实际生物量值与预测生物量值的对比图。

3.2 Box-Behnken设计优化筛选因素

在识别显著变量后,采用BBD确定总糖、酵母提取物、MgSO₄和MnSO₄的最佳水平,如文献[30]所推荐。共进行27次不同因素组合的实验运行,观测和预测的生物量产量汇总于表2。回归分析证实了模型的充分性,Fisher F检验值为18.6513,p值高度显著(<0.0001),与文献[46]的发现一致。决定系数(R²=0.96)表明模型解释了约96%的响应变异,显示出很强的预测能力。此外,失拟不显著(prob >F = 0.80 > 0.05),证实了模型可靠性。拟合的BBD表示为二阶多项式(方程12),捕捉了自变量对生物量生产的线性、二次和交互效应[47]。

(12) Y = 24.23 + 0.99X₁ + 0.25X₂ + 0.17X₃ + 5.71X₄ − 1.515X₁X₂ − 0.99X₁X₃ + 0.74X₁X₄ − 1.34X₂X₃ + 0.127X₂X₄ + 0.47X₃X₄ − 2.22X₁² − 0.78X₂² − 0.56X₃² − 0.15X₄²

模型项的统计显著性通过ANOVA评估(补充材料表S4)。酵母提取物(p = 0.023)和总糖浓度(p < 0.0001)表现出强线性效应,而酵母提取物与MgSO₄之间的交互作用(p = 0.0411)也显著。二次效应同样重要,特别是酵母提取物平方项(p = 0.0022),表明响应面存在曲率。这些发现表明,营养供应和矿物质补充在生物量形成中均起关键作用,其中糖浓度是最具影响力的因素(置信水平99.99%)。

【数据】BBD实验次数:27次;F值:18.6513;p值:<0.0001;R²=0.96;失拟prob>F=0.80;YE线性p=0.023;糖浓度p<0.0001;YE×MgSO₄交互p=0.0411;YE²二次项p=0.0022

RSM模型标准化残差的正态Q-Q图。
▲ RSM模型标准化残差的正态Q-Q图。
响应面曲线显示MgSO₄与YE对酿酒酵母生物量生产的显著交互作用。
▲ 响应面曲线显示MgSO₄与YE对酿酒酵母生物量生产的显著交互作用。

3.3 最优点

通过求解回归模型(方程12)并分析响应面图,确定酵母提取物、MgSO₄、MnSO₄和糖的最佳浓度分别为5.26 g/L、0.01 g/L、0.1 g/L和80 g/L。在此条件下,预测最大生物量产量为30.49。该值使用方程(13)转换为干重,其中λ=660 nm处的吸光度与生物量浓度相关。

(13) y = 4.4633x − 3.58;R² = 0.98

这些结果为在枣莲基培养基中最大化酿酒酵母生物量生产所需的条件提供了稳健的估计。

【数据】最优条件:YE 5.26g/L、MgSO₄ 0.01g/L、MnSO₄ 0.1g/L、糖 80g/L;预测最大生物量:30.49(OD660);干重换算方程:y=4.4633x−3.58,R²=0.98

3.4 验证实验

优化后,进行三次重复的验证试验以验证模型可靠性。实验结果与预测值紧密匹配,如图1所示,偏差极小(<5%)。强相关性表明模型具有高预测精度,并证明了其在优化条件下的稳健性。具体而言,预测值与观测值的高度一致性强调了模型可靠指导酵母培养的能力。重要的是,该验证确认了通过BBD确定的最佳营养组合可以在实验中重现,从而弥合了统计优化与实际应用之间的差距。这种验证不仅增强了模型的稳健性,还提高了其在大规模生物量生产过程中应用的潜力。

除实验验证外,还通过残差分析评估了RSM模型的充分性。标准化残差的正态Q-Q图(图2)显示残差紧密遵循理论正态分布,表明正态性假设合理满足,并确认了模型的统计可靠性。

优化和实验验证后,在接种前对最终配制的ZLJ基发酵培养基进行了表征。测定了总糖、蛋白质含量、总酚含量和总黄酮含量,以描述用于酵母培养的培养基组成。结果汇总于补充材料表S5,提供了支持高效生物量生产的优化培养基的组成概况。

【数据】验证实验重复次数:3次;预测值与实验值偏差:<5%;优化培养基表征:总糖、蛋白质、总酚、总黄酮(具体数值见补充材料表S5)

3.5 三维响应面图

生物量生产训练数据集的RMSE值与第一隐藏层神经元数量的关系。
▲ 生物量生产训练数据集的RMSE值与第一隐藏层神经元数量的关系。
图1 RMSE值随训练数据集(A)和验证数据集(B)中第1层和第2层神经元数量的等高线图。
▲ 图1 RMSE值随训练数据集(A)和验证数据集(B)中第1层和第2层神经元数量的等高线图。
The integrated 4–25–20–1 multitask ANN architecture to predict the production of Baker’s yeast biomass.
▲ The integrated 4–25–20–1 multitask ANN architecture to predict the production of Baker’s yeast biomass.
训练、外部验证和外部测试中面包酵母产量的实验值与预测值散点图。
▲ 训练、外部验证和外部测试中面包酵母产量的实验值与预测值散点图。
生物量产量实验值与预测值之间的残差图。
▲ 生物量产量实验值与预测值之间的残差图。
开发模型的适用域图。
▲ 开发模型的适用域图。
未优化(初始条件)、RSM和RSM–ANN–GA优化条件下的生物质产量。
▲ 未优化(初始条件)、RSM和RSM–ANN–GA优化条件下的生物质产量。
Optimizing Saccharomyces cerevisiae biomass production with
▲ 论文配图

讨论与解读

本研究证实枣莲汁是促进酿酒酵母生物量生产的可行且可持续的碳源。Plackett-Burman筛选确定的关键培养基组分通过RSM和混合RSM-ANN-GA方法得到了有效优化。ANN模型表现出很强的预测性能,GA辅助优化将生物量产量提升至7.23 g/L,较初始培养基(3.81 g/L)实现了约两倍的提升。这些结果证明了将统计设计、机器学习和进化优化整合用于高效生物过程开发的价值。

尽管结果令人鼓舞,但仍存在若干挑战。实验在摇瓶规模进行,pH、溶解氧、搅拌和培养模式等关键过程参数未进行优化。此外,枣莲提取物的季节性变异以及单宁等天然存在的化合物可能影响酵母生长或产品质量。因此,需要在受控生物反应器条件下进行进一步验证、更广泛的模型测试和技术经济评估。

编译者解读:本研究的方法论价值在于将传统RSM的因子筛选能力与ANN的非线性拟合优势、GA的全局寻优能力有机串联,形成了"筛选—建模—优化"的完整闭环。枣莲汁作为北非地区丰富的低成本碳源,其开发契合循环生物经济的理念。值得注意的是,ANN模型的适用域(applicability domain)分析为模型外推提供了质量边界,这是许多同类研究容易忽视的关键环节。局限在于摇瓶规模与生物反应器放大之间的差距,以及果汁批次间的成分波动对模型迁移性的潜在影响。未来若能在控制发酵罐中验证并建立果汁成分快速检测与模型在线校正机制,该策略有望成为非粮原料发酵优化的通用范式。

参考来源

期刊:Process Biochemistry, 2026

DOI: 10.1016/j.procbio.2026.02.023

DOI: 10.1016/j.procbio.2026.02.023

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12