来源:Genetic algorithm-guided sample design enables efficient machine learning-driven optimization of tauroursodeoxycholic acid production in engineered Escherichia coli(Bioresource Technology)| 编译:DNA Lab Space | 原文许可:elsevier-subscription
导读
数据驱动的机器学习(ML)方法为复杂发酵过程建模与优化提供了有力工具,但往往依赖大规模实验数据集,这在低通量微生物发酵体系中难以实现。本研究提出一种遗传算法(GA)辅助的自适应采样策略,将GA与人工神经网络(ANN)耦合,以有限的实验预算实现工程大肠杆菌中牛磺熊去氧胆酸(TUDCA)生物转化培养基的高效优化。实验验证获得TUDCA/TCDCA比值达2.18 ± 0.06,TUDCA滴度达7.11 ± 0.12 g/L。该策略为实验资源受限条件下的低通量发酵优化提供了可行且高效的解决方案。
研究背景
微生物发酵是可持续生产燃料、化学品和高价值生物活性化合物的核心技术。然而,发酵性能受培养基组成、操作条件和细胞代谢状态之间复杂的非线性相互作用支配,使理性优化面临挑战。传统实验设计方法(如响应面法RSM和Box-Behnken设计)虽被广泛应用,但其低阶多项式假设可能无法准确捕捉复杂的生物响应。数据驱动的机器学习方法已成为建模和优化复杂生物过程的有效工具,人工神经网络因其强大的非线性逼近能力和在发酵过程中改进的预测性能而备受关注。然而,生成大规模实验数据集的高昂成本限制了其应用,这在低通量发酵体系中尤为突出——有限的实验能力使样本高效策略成为必需。尽管在信息丰富区域充分采样时,ML模型可以基于小数据集训练,但设计不佳、信息含量低的采样策略仍构成瓶颈。
研究方法
2.1 培养基
Luria-Bertani(LB)和2 × YT培养基用作基础培养基。此外,在LB培养基基础上通过进一步优化组分,开发了改良发酵培养基。所有培养基的组成和配方见补充材料。
【数据】培养基:LB、2 × YT;改良发酵培养基基于LB优化
2.2 工程大肠杆菌的构建
本研究使用工程大肠杆菌菌株ST-7进行生物转化。菌株ST-7通过CRISPR/Cas9辅助的基因组整合策略,将Ca7α-HSDH(7α-HSDH1)和Ec7β-HSDH2(7β-HSDH2)靶向整合至大肠杆菌BL21 Star™(DE3)基因组中构建而成(见补充材料)。采用标准分子生物学技术进行PCR扩增、基因克隆、质粒构建和转化。本研究中所有菌株的详细信息见补充材料。
【数据】菌株:E. coli ST-7(BL21 Star™(DE3)背景);整合基因:Ca7α-HSDH、Ec7β-HSDH2;方法:CRISPR/Cas9辅助基因组整合
2.3 单因素优化
以600 nm处光密度(OD600)和TUDCA/TCDCA比值作为响应变量。在本研究所述培养基优化过程中,TUDCA/TCDCA比值定义为液相色谱测定的TUDCA与TCDCA色谱峰面积之比。LB培养基作为基础配方,基于文献进行单因素实验,评估单一培养基组分(包括碳源、氮源、磷酸盐、无机盐和金属离子)的影响,具体如下。
碳源筛选与浓度梯度。 首先评估不同碳源(葡萄糖、果糖、甘油、蔗糖、玉米糊精和淀粉)对OD600和TUDCA/TCDCA比值的影响。随后,将最优碳源的浓度分别设为0、10、20、30、40、50和60 g/L,以确定其对培养基性能的影响。
氮源评估与浓度优化。 测试酵母提取物、胰蛋白胨、氯化铵和硫酸铵等氮源对目标产物形成的影响。后续实验将酵母提取物浓度设为0、10、20、30、40、50和60 g/L,以确定其最适水平。
磷酸盐类型与浓度效应。 筛选不同磷酸盐,包括磷酸氢二钾(K2HPO4)、磷酸二氢钾(KH2PO4)、磷酸氢二钠(Na2HPO4)、磷酸二氢钠(NaH2PO4)和磷酸氢二铵((NH4)2HPO4),考察其对发酵性能的影响。所选磷酸盐的浓度随后从0至18 g/L(0、3、6、9、12、15和18 g/L)调整,评估其对TUDCA/TCDCA比值的影响。
【数据】响应变量:OD600、TUDCA/TCDCA比值;碳源种类:葡萄糖、果糖、甘油、蔗糖、玉米糊精、淀粉;碳源浓度梯度:0-60 g/L;氮源种类:酵母提取物、胰蛋白胨、氯化铵、硫酸铵;酵母提取物浓度梯度:0-60 g/L;磷酸盐种类:K2HPO4、KH2PO4、Na2HPO4、NaH2PO4、(NH4)2HPO4;磷酸盐浓度梯度:0-18 g/L
2.4 遗传算法
本研究将GA实现为GA辅助的自适应采样策略,用于迭代实验设计,而非传统的计算机模拟全局优化求解器。具体而言,该工作流采用“湿实验循环”序贯架构(见补充材料),其中GA生成的候选培养基组成在摇瓶培养中进行实验评估,所得TUDCA/TCDCA转化数据纳入后续采样周期。这一迭代过程通过直接生物反馈实现候选培养基组成的逐步细化与经验数据集的持续扩展。与依赖替代模型适应度评估的传统ANN-GA优化框架不同,本研究的适应度评估通过每轮采样获得的实验测量值完成。因此,候选解在纳入下一轮自适应采样迭代之前,均经过实验验证筛选。GA程序使用Python中的DEAP包编写。基于单因素实验,在预定义范围内优化三个配方变量(X1、X2和X3),范围分别为10–50、10–50和0–9。初始种群由该设计空间内随机生成的10个个体组成,实验测得的TUDCA/TCDCA比值用作适应度函数。采用锦标赛选择(tournsize = 3)进行父代选择。使用混合交叉(cxBlend,α = 0.5)和高斯变异(μ = 0,σ = 1,indpb = 0.2)生成子代,交叉和变异概率分别为0.7和0.5。所有候选值向下取整为整数以确保实验可行性。使用固定随机种子(seed = 42)保证可重复性。每一代中,新生成的候选个体均进行实验评估,结果反馈至GA以指导后续迭代。
【数据】优化变量:X1(10-50)、X2(10-50)、X3(0-9);初始种群:10个个体;选择方法:锦标赛选择(tournsize=3);交叉:混合交叉α=0.5,概率0.7;变异:高斯变异μ=0,σ=1,indpb=0.2,概率0.5;随机种子:42;编程语言:Python(DEAP包)
2.5 人工神经网络
使用GA辅助自适应采样策略生成的数据训练有监督ANN(见补充材料),以玉米糊精、酵母提取物和KH2PO4浓度作为输入,TUDCA/TCDCA比值作为输出。所有变量使用Python中的StandardScaler函数进行标准化,以提高数值稳定性并减少尺度相关偏差;预测的TUDCA/TCDCA比值乘以100以便清晰展示。ANN使用Python 3.12.3中的PyTorch和scikit-learn实现。构建了3-16-16-1架构的全连接前馈网络。隐藏层使用ReLU激活函数,输出层使用线性激活函数进行回归。模型使用均方误差(MSE)损失和Adam优化器训练。数据集以8:2比例随机分为训练集和验证集,使用固定随机种子(42),训练300轮,批大小为8。选择验证MSE最低的模型进行后续分析。超参数基于验证损失和MSE进行优化(见补充材料)。为评估ANN预测稳定性,在搜索空间内均匀采样的10个独立点进行了实验测试,作为外部验证集。这些数据不参与训练和超参数调整。通过比较预测值与实验值在一致性、偏差和排序可靠性方面的表现来评估模型性能。
【数据】网络架构:3-16-16-1;激活函数:ReLU(隐藏层)、线性(输出层);损失函数:MSE;优化器:Adam;训练/验证比:8:2;随机种子:42;训练轮数:300;批大小:8;外部验证样本:10个
2.6 Plackett-Burman设计
基于单因素实验,采用Plackett-Burman设计识别对TUDCA/TCDCA比值有显著影响的培养基组分。这种两水平筛选方法将每个因子设为高水平(+1)和低水平(−1),以快速确定其显著性。高水平对应单因素试验获得的最适浓度,低水平设为零。具体而言,玉米糊精在10 g/L(−1)和20 g/L(+1)下测试,酵母提取物在10 g/L(−1)和20 g/L(+1)下测试,KH2PO4在0 g/L(−1)和6 g/L(+1)下测试。
【数据】玉米糊精:10 g/L(−1)、20 g/L(+1);酵母提取物:10 g/L(−1)、20 g/L(+1);KH2PO4:0 g/L(−1)、6 g/L(+1)
2.7 最速上升法
在Plackett-Burman筛选后,将三个最显著因子——玉米糊精(A)、酵母提取物(B)和KH2PO4(C)——进行最速上升路径实验,以在RSM优化前快速接近最优响应区域。增量变化由拟合回归模型的系数引导:
(1) TUDCA/TCDCA = -44.65 + 11.79 A + 35.29 B - 21.69 C
相应地,各因子的步长根据相对系数大小和因子范围计算:
(2) ΔA = (11.79/35.29) × (20-10)/2 = 1.67 ≈ 2 g·L⁻¹
(3) ΔB = (20-10)/2 = 5 g·L⁻¹
(4) ΔC = (21.69/35.29) × (6-0)/2 = 1.84 ≈ 2 g·L⁻¹
这些增量逐步应用于A、B和C,监测所得TUDCA/TCDCA比值以确定朝向最优发酵培养基的最有利方向。
【数据】回归模型:TUDCA/TCDCA = -44.65 + 11.79A + 35.29B - 21.69C;步长:ΔA ≈ 2 g/L、ΔB = 5 g/L、ΔC ≈ 2 g/L
2.8 Box-Behnken设计
Plackett-Burman筛选确定的三个关键因子——玉米糊精(A)、酵母提取物(B)和KH2PO4(C)——进一步进行Box-Behnken设计优化。具体实验设计矩阵及结果见补充材料。
【数据】设计方法:Box-Behnken设计;因子:A(玉米糊精)、B(酵母提取物)、C(KH2PO4)
研究结果
3.1 碳源、氮源和磷酸盐来源对细胞生长和生物转化的单因素效应
通过单因素实验评估碳源、氮源和磷酸盐来源对细胞生长和TUDCA生物转化效率的影响(图1)。对于碳源,玉米糊精在所有测试底物中支持最高的生物量(OD600),并达到最大TUDCA/TCDCA比值(0.154)(图1a)。进一步浓度优化显示,虽然生物量随玉米糊精浓度单调增加,但TUDCA/TCDCA比值呈钟形趋势,在20 g/L时达到峰值(TUDCA/TCDCA = 0.757),表明高效转化存在最佳碳源供应窗口(图1b)。

对于氮源,酵母提取物优于胰蛋白胨和无机氮盐,同时实现更优的生物量积累和更高的TUDCA/TCDCA比值(最高达0.397)(图1c)。浓度分布分析显示,细胞生长和转化效率均先升高后降低,在20 g/L酵母提取物时观察到最佳性能(OD600 = 2.5;TUDCA/TCDCA = 1.583)(图1d)。
对于磷酸盐来源,虽然无机磷酸盐补充通常相对于LB对照降低生物量,但磷酸二氢盐(KH2PO4和NaH2PO4),尤其是KH2PO4,显著提高了TUDCA/TCDCA比值(图1e)。后续浓度优化表明,在6 g/L KH2PO4时转化比达到最大值0.301,尽管生物量逐渐下降(图1f)。
综上,单因素实验表明玉米糊精、酵母提取物和KH2PO4对细胞生长和TUDCA生物转化效率均具有显著的非线性效应。因此,这三个培养基组分被确定为关键因素,并选作后续GA辅助自适应采样策略的输入特征。
【数据】玉米糊精最适浓度:20 g/L(TUDCA/TCDCA = 0.757);酵母提取物最适浓度:20 g/L(OD600 = 2.5;TUDCA/TCDCA = 1.583);KH2PO4最适浓度:6 g/L(TUDCA/TCDCA = 0.301);碳源筛选中玉米糊精最高比值:0.154;氮源筛选中酵母提取物最高比值:0.397
3.2 基于遗传算法的样本筛选
GA优化过程中培养基组成和相应TUDCA/TCDCA比值的迭代演化总结于补充材料中。
玉米糊精(A)浓度的演化(图2a)。 前两代中玉米糊精浓度分布广泛,表明初始种群基本随机。从第3代开始,浓度开始收敛至10–20 g/L范围,提示定向优化开始。第4代中,分布进一步向25–30 g/L移动,表明出现两个潜在最优区域。其中,较高浓度范围与更优适应度相关,并在后续选择中被优先保留。
酵母提取物(B)浓度的演化(图2b)。 酵母提取物浓度在前两代中也广泛分散。从第3代开始,数值逐渐聚集在40–50 g/L范围,对应观察到的最高TUDCA/TCDCA比值。这一趋势表明较高酵母提取物水平对目标响应具有正向贡献,导致在GA选择压力下较高B值持续富集。
KH2PO4(C)浓度的演化(图2c)。 KH2PO4浓度最初呈随机分布。从第3代起,数值向较低水平移动,到第4–5代,观察到向0 g/L的明显趋势。这一结果表明KH2PO4对TUDCA转化具有负效应,导致其在适应度驱动的选择压力下逐渐减少。
适应度演化(图2d)。 对各代平均和最佳适应度值的分析显示,第4代出现显著改善,表明GA快速识别出高性能培养基配方。第4代达到的最高TUDCA/TCDCA比值为1.417,被GA辅助自适应采样策略选为最优培养基组成。

经过五代GA优化,基于适应度标准共筛选出50个高质量培养基配方。这些配方代表设计空间中富含高TUDCA/TCDCA比值的区域,并在探索与利用之间实现了有效平衡。该精选数据集随后用作ANN建模的训练和验证输入,使TUDCA生物转化性能的精细预测以及超越离散GA搜索的培养基组成进一步优化成为可能。
【数据】GA代数:5代;每代样本数:10个;总筛选配方数:50个;第4代最高TUDCA/TCDCA比值:1.417;玉米糊精收敛范围:10-20 g/L(第3代)、25-30 g/L(第4代);酵母提取物收敛范围:40-50 g/L;KH2PO4趋势:向0 g/L收敛
3.3 GA引导的ANN建模与最优培养基组成预测
#### 3.3.1 基于SHAP分析的模型解释
使用训练后的ANN模型探索培养基组分与TUDCA/TCDCA比值之间的关系并预测响应。变量X1、X2和X3分别对应玉米糊精、酵母提取物和KH2PO4。预测的响应面如图3a所示。模型表明,增加X1和X2导致预测比值升高,而增加X3则导致比值降低。高比值主要在高X1和X2结合低X3时出现,表明X1和X2具有正向贡献而X3具有负向贡献。
为进一步解释模型,使用SHAP值量化每个变量的贡献(图3b)。如图所示,X2具有强正效应,较高的X2值始终与正SHAP值相关,表明增加X2可提高预测比值。相比之下,X3表现出负效应,较高水平对应负SHAP值,表明降低X3可改善响应。X1的SHAP值较小且分散,无明显趋势,表明其影响相对较弱且可能呈非线性。

虽然SHAP分析(图3b)突出了各变量的主效应,但成对交互通过响应面等高线图(图3c–e)展示,为设计空间内的非线性交互提供了直观可视化。
【数据】SHAP分析:X2正效应最强;X3负效应;X1弱且非线性;ANN架构:3-16-16-1
#### 3.3.2 关键变量的交互分析
为进一步解释交互效应,详细分析了关键变量间的成对关系(图3c–e)。
X1-X2交互(图3c)。 当X2在35至50 g/L范围时,TUDCA/TCDCA比值达到峰值,呈现先升后降趋势。X1呈双相响应,在10 g/L和30 g/L附近出现局部最大值,其中30 g/L处峰值更高。该交互表明X2的正向贡献受X1水平调节,反映碳源与氮源之间的非线性耦合。
X1-X3交互(图3d)。 X1同样呈现双相模式,最优区域在30 g/L附近。在该水平下,降低X3可提高比值,在X3 = 0 g/L时达到最大值。当X1在10 g/L左右时,X3呈钟形效应,比值先升后降。该模式表明X3的负效应具有条件依赖性,受X1水平影响。
X2-X3交互(图3e)。 TUDCA/TCDCA比值随X2增加先升后降,在35至50 g/L之间达到峰值。在该范围内,较低的X3浓度始终导致较高比值,在X3 = 0 g/L时响应最大。该交互强化了SHAP值推断的X3抑制作用,并表明其效应跨越X2的不同水平。
总体而言,这些结果表明模型响应受变量间的个体效应和交互效应共同支配。酵母提取物(X2)对TUDCA/TCDCA比值具有最强正影响,而KH2PO4(X3)呈现负效应。玉米糊精(X1)贡献适中,可能通过模型内的非线性交互发挥作用。
【数据】X2最优范围:35-50 g/L;X1双相峰值:10 g/L和30 g/L(30 g/L更高);X3最优值:0 g/L
#### 3.3.3 ANN在独立均匀采样条件下的预测性能
为评估GA-ANN模型在定义设计空间内的预测性能,在搜索空间内均匀选取了10个独立采样点进行实验验证。将ANN预测值与实验测量值进行比较,评估模型在未见数据上的泛化能力。

验证结果表明,ANN模型在大多数采样点上能够较好地预测实验测得的TUDCA/TCDCA比值,预测值与实验值之间具有良好的一致性。散点图显示预测值与实验值之间存在正相关关系,对角线表示理想预测情况。该外部验证进一步确认了GA辅助采样策略生成的数据集能够有效支持ANN模型在有限实验预算下实现可靠的预测性能。
【数据】验证样本数:10个;预测与实验值相关性:正相关(具体相关系数原文未详述)
3.4 响应面法验证与最优培养基确认
为验证GA-ANN预测结果的可靠性,使用响应面法(RSM)对关键变量间的交互效应进行了进一步分析。RSM预测的培养基组分交互效应如图5所示。

RSM分析结果与ANN预测趋势一致,进一步确认了玉米糊精、酵母提取物和KH2PO4之间的非线性交互关系。最优培养基组成经实验验证后,在20 g/L鸡胆汁粉作为底物的条件下,实现了TUDCA/TCDCA比值2.18 ± 0.06和TUDCA滴度7.11 ± 0.12 g/L的最终结果。

【数据】最优条件下TUDCA/TCDCA比值:2.18 ± 0.06;TUDCA滴度:7.11 ± 0.12 g/L;底物:20 g/L鸡胆汁粉;最终TUDCA含量:54%
讨论与解读
本研究展示了一种高样本效率的微生物培养基优化策略,将GA辅助自适应采样策略与ANN建模相结合。通过迭代引导物理实验朝向设计空间中的信息丰富区域,该策略在数据有限的条件下生成紧凑且信息丰富的数据集,实现数据高效的生物过程优化。所得数据集使ANN能够捕捉所探索实验空间内培养基组成与过程性能之间的非线性关系。该经验策略特别适用于低通量发酵优化,在实验通量受限时为生物过程开发提供了务实且经济高效的途径。
将该策略应用于鸡胆汁粉的全细胞生物转化,实现了TUDCA/TCDCA比值2.18 ± 0.06、TUDCA滴度7.11 ± 0.12 g/L以及最终TUDCA含量54%。尽管具有实际效用,但本策略仍属经验优化方法,未明确纳入机理过程知识或形式化稳健性分析。未来工作应侧重于整合动力学信息、代谢约束和混合建模策略,以提高机理可解释性、预测稳健性和外推能力。
编译者解读: 本研究值得关注的方法论价值在于将GA从传统的计算机模拟求解器转变为“湿实验循环”的采样导航工具,以50个样本的训练集驱动ANN实现了对非线性发酵系统的有效建模。这一思路对合成生物学中普遍的低通量菌株筛选场景具有直接借鉴意义——当自动化发酵平台不可及、实验成本高昂时,智能采样策略可以显著压缩数据需求。值得注意的是,ANN揭示的玉米糊精双相效应是二次回归模型难以捕捉的,这也从侧面提示传统RSM在复杂生物体系中的局限。局限在于策略仍属黑箱经验优化,机理可解释性不足,且最优培养基的适用性是否可跨菌株、跨底物推广尚待验证。
参考来源
Li, C. (2026). Genetic algorithm-guided sample design enables efficient machine learning-driven optimization of tauroursodeoxycholic acid production in engineered Escherichia coli. Bioresource Technology, 2026. DOI: 10.1016/j.biortech.2026.135434
DOI: 10.1016/j.biortech.2026.135434