来源:Machine learning-driven dynamic control strategy enhances D-pantothenic acid production by Escherichia coli(Biochemical Engineering Journal)| 编译:DNA Lab Space | 原文许可:elsevier-subscription
导读
D-泛酸(维生素B5)是食品、医药和饲料行业的重要大宗生物产品,其发酵生产长期受限于缺乏精准的实时过程调控手段。本研究构建了"前馈人工神经网络+支持向量机"两阶段混合建模框架,实现发酵过程的实时预测与动态优化。通过粒子群算法和遗传算法生成三阶段动态温控-pH控制策略,将D-泛酸产量提升至125.98 g/L,较静态最优控制提高17.4%。这一工作展示了机器学习与工业发酵过程控制深度融合的潜力。
研究背景
D-泛酸是动植物生长代谢所必需的水溶性维生素。第一代化学合成法虽在大规模生产和原料获取方面仍有优势,但需使用有机溶剂并进行手性分离,存在环境污染和高成本等固有缺陷。第二代微生物发酵法通过微生物代谢葡萄糖生产D-泛酸,具有显著的环境和经济优势,但通常需在培养基中外源添加前体β-丙氨酸。近年来,基于基因编辑和合成生物学技术,无需外源β-丙氨酸的第三代从头发酵生产技术已逐步建立,微生物发酵因此成为D-泛酸生产中有前景的可持续替代方案。
发酵过程性能直接决定最终D-泛酸产量,实时监测与精准过程调控对高效生产至关重要。然而,传统发酵控制常依赖启发式经验和离线取样分析,难以实现即时响应。数据驱动的机器学习方法为解决这一瓶颈提供了新可能——但如何将模型预测与过程控制策略有机结合,仍是该领域的核心挑战。
研究方法
2.1 数据库数据的收集与预处理
所有发酵实验均使用大肠杆菌DPAT6菌株[12],在5 L搅拌式发酵罐中进行,该菌株基于课题组前期工作构建的母本菌株开发。实验产生的全部数据被汇编为专用发酵数据库。发酵过程参数(包括温度和pH)在每批次中手动设定,作为过程调控的核心变量(表S1)。DPAT6发酵采用葡萄糖补料策略,偶联pH-stat控制[13]和溶解氧联动转速控制。典型发酵周期持续60–75小时。
样品(5 mL)在接种后特定时间点从发酵罐中取出:0、12、16、20、24、36、40、44、48、60、64和68小时,并立即在4℃下以12,000 rpm离心2分钟。细胞生长通过Ultrospec 3000分光光度计(Pharmacia Biotech,乌普萨拉,瑞典)在600 nm波长下测定光密度(OD600)进行监测。葡萄糖浓度使用生物传感器分析仪(Sieman Technology,深圳,中国)测定。上清液中D-泛酸滴度通过高效液相色谱(HPLC)定量,使用配备C18色谱柱(250 × 4.6 mm,5 μm粒径;Agilent Technologies,圣克拉拉,CA,美国)和200 nm紫外检测器的Agilent 1260系统。流动相由水、磷酸和乙腈组成(949:50:1,v/v/v),流速0.9 mL/min,柱温维持30℃。有机酸副产物(如乙酸)使用Aminex HPX-87H离子排阻色谱柱(300 × 7.8 mm;Bio-Rad,赫拉克勒斯,CA,美国)分析,以5 mM硫酸为流动相,流速0.6 mL/min,柱温60℃[14]。
最终数据集包含所有批次的时间序列发酵数据(表S2),涵盖各采样时间点的发酵时间、OD600(以下简称OD)、温度、pH、溶解氧(DO)、转速、补料体积、氨水、残糖和D-泛酸滴度。完整数据集包含207个独立样本(表S3),随机分为三个子集:60%作为训练集用于模型拟合,20%作为验证集用于超参数调优和训练过程中的性能评估,剩余20%作为独立测试集用于最终模型性能评估。
数据预处理根据各机器学习算法的要求进行。对于基于距离的模型,使用公式(1)对所有特征进行归一化处理。根据特定模型需要生成特征交互项。所有统计计算、模型构建和数据可视化均在R和Python中实现,使用tidymodels包(R)和TensorFlow库(Python)[15]。
(1) x_norm = (x_i − x_min) / (x_max − x_min)
其中x_norm为归一化值,x_i为原始数据值,x_min为数据最小值,x_max为数据最大值。
需要指出的是,由于补料分批发酵的时序特性,简单随机分割不可避免地会在训练集和验证集之间引入时间相关性。然而,由于本模型被设计为批次内预测的实时软传感器(即利用同批次早期数据预测后期时间点的滴度),这种数据划分与实际应用场景一致。为进一步排除批次间过拟合风险,研究团队利用现有数据集进行了额外的留一批交叉验证(补充材料表S5),无需额外实验即证实了模型的泛化能力。

2.2 机器学习模型的构建与评估
研究评估了五种机器学习算法用于构建D-泛酸滴度预测模型,即弹性网络、支持向量机(SVM)[16]、k近邻(KNN)[17]、随机森林(RF)[18]和极端梯度提升(XGBoost)[19]。时间序列发酵数据作为各模型的输入特征,D-泛酸滴度作为目标输出变量。SVR目标函数的核心公式[式(2)–(3)]和XGBoost目标函数[式(4)]如下所示;所有算法的详细描述,包括其超参数和原理,见补充方法S1。
(2) y_i − w^T x_i − b ≤ ε + ξ_i;w^T x_i + b − y_i ≤ ε + ξ̂_i;ξ_i ≥ 0,ξ̂_i ≥ 0 (i = 1, 2, …, n)
(3) min(w,b,ξ,ξ̂) ½||w||² + C∑(ξ_i + ξ̂_i)
(4) Obj(θ) = ∑l(y_i, ŷ_i) + ∑Ω(f_K)
为提高最终模型的预测精度,采用网格搜索、贝叶斯优化[20]和模拟退火[21]进行超参数优化,并耦合5折交叉验证(图1)。网格搜索中,为每种算法随机生成50组超参数组合,通过在训练集上训练确定每种算法的最优超参数集。在网格搜索结果基础上,进一步应用贝叶斯优化和模拟退火进行迭代超参数调优。所有调优后的模型在验证集上评估性能,选择预测精度最高的模型。最终最优模型在训练集和验证集合并数据上重新训练,完成数据驱动模型构建。
模型性能采用两个关键指标评估:决定系数(R²)和均方根误差(RMSE),分别通过式(5)和式(6)计算。
(5) R² = 1 − SS_res/SS_tot
(6) RMSE = √[(1/n)∑(y_i − ŷ_i)²]
其中SS_res为残差平方和,SS_tot为总平方和,n为样本数,y_i为第i个观测值,ŷ_i为第i个预测值。

2.3 模型引导的发酵调控
对于模型引导的发酵过程优化,采用两种全局优化算法:粒子群优化(PSO)[22]和遗传算法(GA)[23]。优化后的D-泛酸滴度预测模型作为优化的适应度函数。由于DO和转速等变量通过自动化反馈回路控制,优化聚焦于两个手动可调设定点:温度和pH——这是发酵过程中唯一可修改的环境参数。此步骤的目标是确定最优温度和pH设定点以最大化D-泛酸滴度。
然而,优化后的D-泛酸滴度预测模型需要除温度和pH之外的多个输入特征,否则无法直接用于计算优化。因此,设计了一个前馈人工神经网络(ANN)作为软传感器,以弥合可控环境参数与未测量过程状态变量之间的差距(图2)。ANN架构由3个节点的输入层(发酵时间、温度、pH)、两个隐藏层(分别为128和64个神经元)和预测6个关键状态变量(DO、转速、OD、氨水、残糖和补料体积)的输出层组成。
为在中等数据集规模(207个样本)下降低过拟合风险,ANN采用早停法训练(监测验证损失,patience为50个epoch)和10%的验证集分割。从三个环境输入到六个状态变量的相对简单映射——这是一个低维回归任务——不需要过于复杂的架构。此外,ANN在总数据集90%(约186个样本)上训练,而非主SVM-RBF模型使用的124个样本,因为软传感器和最终预测器是独立训练的。所得模型在保留测试集上取得了令人满意的预测精度,证实过拟合得到了充分控制。
【数据】菌株:E. coli DPAT6;反应器:5 L搅拌式发酵罐;取样时间点:0、12、16、20、24、36、40、44、48、60、64、68 h;离心:12,000 rpm,4°C,2 min;HPLC条件:C18柱(250×4.6 mm,5 μm),UV 200 nm,流速0.9 mL/min,柱温30°C;有机酸分析:Aminex HPX-87H柱,5 mM H₂SO₄,流速0.6 mL/min,柱温60°C;数据集:207个独立样本(训练集60%、验证集20%、测试集20%);ANN架构:3输入节点→128神经元→64神经元→6输出节点;早停patience:50 epochs;ANN训练数据:约186个样本(总数据90%)
研究结果
3.1 相关性分析与特征重要性排序
首先评估了D-泛酸滴度的分布及其对关键发酵条件的依赖关系(图3A、B、C)。初步分析表明,D-泛酸滴度峰值出现在发酵60小时后,最适温度和pH范围分别为30–32℃和6.7–6.8。对所有特征变量计算Pearson相关系数,并生成带显著性检验的相关性矩阵(图4A)。结果显示,所有特征变量与D-泛酸滴度均显著相关(P < 0.05)。
发酵时间、pH、转速、氨水、补料体积和OD与D-泛酸滴度呈正相关,相关系数分别为0.85、0.26、0.60、0.87、0.94和0.87;温度和残糖呈负相关,相关系数分别为−0.14和−0.40。这些相关性与大肠杆菌补料分批发酵的生理特征一致,所有评估特征均保留作为后续机器学习模型构建的输入变量。
此外,使用Boruta[24]和随机森林算法对数据集中的特征变量进行重要性排序(图4B、C)。两种算法得出了一致的结果:补料体积、发酵时间和OD是对D-泛酸滴度影响最显著的特征变量,这与相关性分析的发现一致。


【数据】发酵时间与滴度相关系数:0.85;pH:0.26;转速:0.60;氨水:0.87;补料体积:0.94;OD:0.87;温度:−0.14;残糖:−0.40;显著性:P < 0.05;最适温度范围:30–32°C;最适pH范围:6.7–6.8;峰值出现时间:60 h后
3.2 D-泛酸滴度预测模型的构建
九个特征变量(发酵时间、温度、pH、DO、转速、氨水、补料体积、残糖和OD)作为模型输入,D-泛酸滴度作为目标输出。评估了五种机器学习算法(弹性网络、SVM、KNN、RF和XGBoost)用于D-泛酸滴度预测模型的构建。首先采用网格搜索在训练集上优化六种评估模型变体的超参数,每种算法测试50组随机超参数组合(图5A)。
结果表明,SVM-RBF模型在5折交叉验证中表现最佳,最小RMSE为7.38 g/L,R²为0.95(图6A);弹性网络模型表现第二,RMSE为7.75 g/L,R²为0.94。在网格搜索结果基础上,进一步应用贝叶斯优化和模拟退火对每个模型进行迭代超参数调优(图5B、C)。通过贝叶斯优化和模拟退火进行的超参数调优均证实SVM-RBF模型是最优算法。贝叶斯优化后,SVM-RBF模型的RMSE从7.38降至7.27,R²约为0.95,与之前相当。
三种优化方法均显示XGBoost的预测性能最差。XGBoost性能不佳可能归因于其基于树的结构——当目标变量(如补料体积、发酵时间)超出训练数据中观察到的范围时,基于树的模型难以有效捕捉外推能力,这是回归树在生物过程应用中的已知局限性[25]。
在验证集上对超参数优化后的模型进行验证(表1),结果显示经模拟退火调优的SVM-RBF模型(Sim-SVM-RBF)在训练集和验证集上均表现出最佳综合性能,最小RMSE为5.03 g/L,R²为0.982。Sim-SVM-RBF模型优化后的内部参数列于表2。据此,选择Sim-SVM-RBF模型并在训练集和验证集合并数据上重新训练,生成最终的*Sim-SVM-RBF预测模型。
该模型的关键优势在于能够实时预测D-泛酸滴度:输入与模型训练时相同的特征变量,即可在任何给定发酵条件下快速准确地预测D-泛酸滴度,无需耗时的离线HPLC检测。最终*Sim-SVM-RBF模型在独立测试集上评估,RMSE为5.34 g/L,R²为0.978,证实了其优异的稳定性和预测精度(图7)。



【数据】SVM-RBF网格搜索最优:RMSE 7.38 g/L,R² 0.95;弹性网络:RMSE 7.75 g/L,R² 0.94;贝叶斯优化后SVM-RBF:RMSE 7.27 g/L,R²约0.95;Sim-SVM-RBF验证集:RMSE 5.03 g/L,R² 0.982;*Sim-SVM-RBF测试集:RMSE 5.34 g/L,R² 0.978
3.3 机器学习模型的可解释性分析
SHAP(Shapley Additive exPlanations)分析[26]是一种基于博弈论的可解释性工具,用于解释机器学习模型的预测结果并量化每个特征对模型预测的贡献。它通过计算每个样本中每个特征的SHAP值来评估特征值变化如何影响模型输出。较高的正SHAP值表示特征对模型预测有更显著的正向贡献,而较高的负SHAP值则表示更显著的负向贡献。
计算了每个特征变量在所有样本中的平均绝对SHAP值,以量化其对*Sim-SVM-RBF模型预测的总体贡献(表3)。平均绝对SHAP值越高,表示该特征对模型输出的影响越大。结果显示,影响最大的两个特征变量是补料体积和发酵时间,平均绝对SHAP值分别为16.38和11.50。这一发现与补料分批发酵的生理特征高度一致——碳源补料和发酵时间是细胞生长和产物生物合成的主要驱动力。
SHAP蜂群图(图8A)展示了每个特征在所有样本中的SHAP值分布,分布区间越宽表示对模型预测的总体影响越大。瀑布图(图8B)量化了代表性样本中每个特征对模型预测的贡献,展示了每个特征如何相对于总体均值移动预测值。例如,在预测D-泛酸滴度为70 g/L的样本中,补料体积为902 mL,贡献为+14;发酵时间为40 h,贡献为+8.16。

【数据】补料体积平均绝对SHAP值:16.38;发酵时间:11.50;示例样本:预测滴度70 g/L,补料体积902 mL(贡献+14),发酵时间40 h(贡献+8.16)
3.4 三阶段动态发酵控制策略的开发与验证
将优化后的Sim-SVM-RBF模型与PSO和GA优化算法集成,实现模型引导的发酵过程优化。借鉴链式法则[27],对DPAT6发酵进行温度和pH的动态优化。首先,验证前馈ANN软传感器仅使用时间、温度和pH作为输入即可准确预测发酵状态参数。然后将前馈ANN的输出输入Sim-SVM-RBF模型,生成预测的D-泛酸滴度,作为PSO和GA优化的目标函数,以确定最大化D-泛酸滴度的最优温度和pH设定点。
对于静态全过程优化(整个发酵过程中温度和pH恒定),GA算法(图S1)确定的最优恒定条件为:发酵时间63.9 h,温度30.1℃,pH 6.77;PSO算法得到的最优恒定条件为:发酵时间65.8 h,温度30.0℃,pH 6.78。这些条件与原始数据库中最高滴度的静态发酵批次一致。对该高产批次(30.0℃,pH 6.80)进行发酵动力学分析,结果如表S4所示。细胞生长动力学和产物形成动力学的拟合曲线见图S2。所有发酵动力学参数均具有统计学显著性。X₀在P < 0.05水平显著,X_max、μ_max、α和β均在P < 0.001水平极显著,表明动力学模型能够很好地描述该发酵过程。
基于以上动力学分析,开发了三阶段动态控制策略:0–24 h维持36℃、pH 6.2;24–44 h切换至32.5℃、pH 6.6;44 h后降至30℃、pH 6.8(图9A)。该策略根据大肠杆菌发酵的生理阶段特征,分阶段调整温度和pH——前期高温高酸度促进细胞快速生长,中期温和条件平衡生长与产物合成,后期低温近中性pH优化产物积累。在该三阶段策略下的发酵参数时间曲线如图9B所示,D-泛酸最大滴度达到125.98 g/L。

【数据】GA最优静态条件:63.9 h,30.1°C,pH 6.77;PSO最优静态条件:65.8 h,30.0°C,pH 6.78;三阶段策略:0–24 h(36°C,pH 6.2)→24–44 h(32.5°C,pH 6.6)→44 h后(30°C,pH 6.8);最大D-泛酸滴度:125.98 g/L;较静态最优提高:17.4%;动力学显著性:X₀(P < 0.05),X_max、μ_max、α、β(P < 0.001)
讨论与解读
本研究构建了完整的"数据采集→模型训练→可解释性分析→动态策略生成→实验验证"闭环框架。核心创新在于将前馈ANN软传感器与SVM-RBF预测模型级联,解决了发酵过程优化中"可控变量少、状态变量多"的维度不匹配问题。通过SHAP分析确认了补料体积和发酵时间作为最关键影响因素,为过程理解提供了数据驱动依据。三阶段动态控制策略的17.4%产量提升,验证了分阶段调控比恒定条件更契合微生物的生理代谢需求。
编译者解读
从合成生物学应用视角看,该研究展示了机器学习在工业发酵优化中的实用价值——无需深入理解全部代谢调控机制,仅依靠过程数据即可获得可执行的优化策略。其方法学亮点在于混合建模策略:ANN负责状态预测、SVM-RBF负责滴度预测、PSO/GA负责策略搜索,三层架构各司其职。局限在于数据驱动模型对历史数据的依赖——当菌株改造或培养基变更时,模型可能需要重新训练。未来若能将代谢模型与机器学习结合,或引入迁移学习,有望进一步提升模型的跨批次适应能力。该框架对维生素、氨基酸等大宗发酵产品的智能化生产具有直接参考意义。
参考来源
Zhang B. Machine learning-driven dynamic control strategy enhances D-pantothenic acid production by Escherichia coli. Biochemical Engineering Journal, 2026. DOI: 10.1016/j.bej.2026.110384
DOI: 10.1016/j.bej.2026.110384