来源:Machine learning strategy to boost 1-deoxynojirimycin production through fermentation by Bacillus amyloliquefaciens(Journal of Bioscience and Bioengineering)| 编译:DNA Lab Space | 原文许可:elsevier-subscription
导读
1-脱氧野尻霉素(1-DNJ)是一种具有重要药用价值的天然亚氨基糖生物碱,微生物发酵法是其可持续生产的重要途径。然而,发酵过程中营养参数与理化参数之间存在复杂的非线性交互作用,传统单因素优化难以捕捉。本研究以解淀粉芽孢杆菌ACCC 10270为出发菌株,将单因素实验与人工神经网络(ANN)相结合,在有限数据条件下构建了高效的预测模型。经单因素优化后,1-DNJ产量从842 ± 2.32 mg/L提升至1064 ± 4.64 mg/L;ANN模型进一步预测并验证了87.47%的抑制率和1179 ± 8.44 mg/L的产量。敏感性分析锁定接种量和发酵温度为最关键工艺变量。
研究背景
1-DNJ作为一种亚氨基糖类天然生物碱,在治疗和营养保健领域的应用不断扩展。相较于植物提取,微生物生物合成提供了一条可持续、可规模化的替代路线。但发酵过程的优化受制于营养参数与理化参数之间复杂的非线性相互作用,传统优化方法往往力不从心。
本研究以解淀粉芽孢杆菌ACCC 10270为对象,采用单因素实验与人工神经网络模型相结合的策略提升1-DNJ产量。研究首先通过LC-MS/MS确认该菌株能够利用可溶性淀粉和蛋白胨生产1-DNJ,随后以α-葡萄糖苷酶抑制率为评价指标,结合单因素实验和ANN机器学习模型对发酵条件进行系统优化。该机器学习框架为1-DNJ发酵优化提供了一条可行的技术路径,所识别的关键发酵参数也为后续研究奠定了基础。
研究方法
材料与化学试剂
1-DNJ(98%,批号:CYR-T0042210901)购自四川翠益润生物科技有限公司(中国成都)。9-芴甲氧羰酰氯和α-葡萄糖苷酶购自麦克林生化科技有限公司(中国上海)。蛋白胨购自北京奥博星生物技术有限公司(中国北京)。可溶性淀粉购自国药集团化学试剂有限公司(中国上海)。琼脂、MgSO₄、FeSO₄、KCl、KI和I₂由天津科密欧化学试剂有限公司(中国天津)提供。NaCl购自湖南汇虹试剂有限公司。实验用水为超纯水,其他试剂均为分析纯。
【数据】1-DNJ纯度:98%;批号:CYR-T0042210901;其他试剂级别:分析纯;实验用水:超纯水
菌株复苏与种子培养
解淀粉芽孢杆菌ACCC 10270菌株购自中国农业微生物菌种保藏管理中心(ACCC),北京,中国。将菌株冻干粉溶于水,然后接种到琼脂平板上。待细菌生长后,挑取单菌落置于新的生长培养基上。该操作重复两次。随后将细菌接种到液体培养基中,在35 °C、60 rpm条件下培养24 h。最后,将所得液体培养基保存于4 °C。此外,所用发酵培养基的典型配方为:40.0 g淀粉、20.0 g蛋白胨、5.0 g NaCl、1.0 g KCl、0.5 g MgSO₄、0.2 g FeSO₄和1.0 L蒸馏水。
【数据】菌株:解淀粉芽孢杆菌ACCC 10270;复苏温度:35°C;复苏转速:60 rpm;复苏时间:24 h;保存温度:4°C;发酵培养基配方:淀粉40.0 g/L、蛋白胨20.0 g/L、NaCl 5.0 g/L、KCl 1.0 g/L、MgSO₄ 0.5 g/L、FeSO₄ 0.2 g/L
LC-MS/MS鉴定1-DNJ
采用LC-MS/MS方法对生物碱1-DNJ标准品和菌株发酵液进行鉴定,并比较其组分。分析使用Vanquish Flex UHPLC Orbitrap Exploris 120 MS LC-MS/MS(Thermo Fisher Scientific,Waltham,MA,USA)。取2 μL样品注入ACQUITY BEH_C18色谱柱(2.1 × 100 mm,1.7 μm,Waters Corporation,Milford,MA,USA)。流动相由溶剂A(20 mM乙酸铵)和溶剂B(含0.1%甲酸的乙腈)组成。梯度洗脱条件如下:0至0.5 min为0% A,0.5至10 min为90% A,10至12 min为90% A,12至12.1 min为0% A,12.1至15 min为0% A,流速为0.3 mL/min。采用正离子模式,喷雾电压为3.8 kV,毛细管温度为593.15 K。
【数据】进样量:2 μL;色谱柱:ACQUITY BEH_C18(2.1 × 100 mm,1.7 μm);流动相A:20 mM乙酸铵;流动相B:含0.1%甲酸的乙腈;流速:0.3 mL/min;喷雾电压:3.8 kV;毛细管温度:593.15 K;梯度洗脱时间:0–15 min
发酵与1-DNJ测定
将菌株种子培养液接种到50 mL离心管中,加入20 mL发酵培养基,置于恒温振荡培养箱中,在60 rpm、35 °C条件下培养72 h。发酵结束后,将发酵培养基用高压灭菌器灭菌,培养滤液以10,000 rpm离心,采用Surwit LC-10Tvp HPLC系统(Surwit Technology Inc.,杭州,中国)通过高效液相色谱(HPLC)检测1-DNJ含量(参考文献33,略有修改);将9-芴甲氧羰酰氯乙腈浓度改为50 mM以消除残留氨基酸的影响。
【数据】发酵体积:20 mL;转速:60 rpm;温度:35°C;时间:72 h;离心转速:10,000 rpm;9-芴甲氧羰酰氯乙腈浓度:50 mM;HPLC系统:Surwit LC-10Tvp
α-葡萄糖苷酶抑制的高通量平台
采用紫外-可见吸收光谱法评估α-葡萄糖苷酶的抑制效率。典型分析步骤如下:向5 mL离心管中加入350 μL 1%可溶性淀粉溶液,随后加入50 μL不同1-DNJ浓度(0.10、0.20、0.40、0.60和0.80 mg/mL)的样品溶液和50 μL 20 U/mL的α-葡萄糖苷酶溶液。反应在35 °C水浴中孵育45 min。最后加入50 μL I₂/KI溶液(25 mM),使体积达到4.0 mL。随后用UV8000紫外-可见分光光度计(上海美谱达仪器有限公司,上海,中国)在190至700 nm波长范围内扫描。本研究中所有实验均重复三次。
还建立了96孔高通量平台用于测定α-葡萄糖苷酶抑制活性。通常,向96孔板(最大300 μL)中加入35 μL 1%可溶性淀粉溶液、5 μL样品溶液和5 μL α-葡萄糖苷酶溶液(20 U/mL)。然后将板在35 °C孵育45 min。最后加入5 μL I₂/KI溶液(25 mM)和200 μL超纯水,用Synergy HT酶标仪(BioTek Instruments, Inc.,Winooski,VT,USA)扫描。
【数据】可溶性淀粉浓度:1%;1-DNJ浓度梯度:0.10、0.20、0.40、0.60、0.80 mg/mL;α-葡萄糖苷酶浓度:20 U/mL;孵育温度:35°C;孵育时间:45 min;I₂/KI浓度:25 mM;终体积:4.0 mL;扫描波长:190–700 nm;96孔板最大体积:300 μL;平行次数:3次
单因素实验设计
考虑发酵过程中影响1-DNJ产量的主要发酵参数。单因素实验的自变量为发酵温度(X1)、发酵时间(X2)、接种量(X3)、初始pH(X4)、碳含量(X5)和氮含量(X6)。设计这些参数的不同组合(表S1)并进行实验。发酵结束后取发酵液测定α-葡萄糖苷酶抑制率。α-葡萄糖苷酶抑制效率作为发酵过程的参考评价指标。此外,单因素实验结果确定后续实验中各变量的最佳水平。
【数据】自变量:发酵温度(X1)、发酵时间(X2)、接种量(X3)、初始pH(X4)、碳含量(X5)、氮含量(X6);评价指标:α-葡萄糖苷酶抑制率
人工神经网络优化发酵过程
进一步使用该数据集构建并训练ANN模型,以发酵液对α-葡萄糖苷酶的抑制率作为输出变量。如图1所示,用于优化解淀粉芽孢杆菌ACCC10270发酵条件的ANN是一种具有三层(6-n-1)架构的前馈反向传播网络。输入层由六个节点组成,对应关键发酵参数:发酵温度、发酵时间、接种量、初始pH、碳含量和氮含量。输出层包含一个神经元,代表预测的α-葡萄糖苷酶抑制效率。隐藏层神经元数量(n)的范围为4至13,由式1给出的经验公式确定。

(1)L = m + n + a
其中L为隐藏层节点数,m为输入节点数,n为输出节点数,a为1至10之间的常数(34)。应优化神经元数量以避免过拟合或欠拟合。ANN模型使用R环境中的neuralnet包(35–38)构建和训练。数据集包含32次实验运行及相应的发酵条件和α-葡萄糖苷酶抑制率(表S1),在模型训练前归一化至0–1范围。实验数据集分为训练集(70%)、测试集(30%)和验证集(训练集的40%)。最佳训练算法的选择取决于对所开发神经网络模型在常见训练算法下的评估,同时改变网络中隐藏神经元的数量。本研究中使用的常见训练算法包括:反向传播算法(backprop+)、加权反向弹性反向传播算法(rprop+)、随机均值梯度下降算法(sag)、加权非反向弹性反向传播算法(rprop−)和简单线性回归算法(slr)。其他参数设置如下:阈值d = 0.01,stepmax = 10⁷,rep = 1,startweights = NULL。以每种隐藏神经元数量训练得到的人工神经网络的均方误差(MSE,式2)作为指标(n = 20)来确定最佳训练算法。确定最优训练算法后,仅改变网络中隐藏神经元数量,将不同隐藏神经元数量训练模型得到的预测值(输出)与观测值(目标)进行线性拟合,以拟合得到的相关系数R²(式3)和斜率k作为指标(R²和k越接近1越好)。
【数据】网络架构:6-n-1三层前馈反向传播网络;隐藏层神经元范围:4–13;数据集:32次实验运行;归一化范围:0–1;训练集比例:70%;测试集比例:30%;验证集比例:训练集的40%;阈值d:0.01;stepmax:10⁷;rep:1;startweights:NULL;MSE评估n:20
研究结果
发酵液的LC-MS/MS分析
采用LC-MS/MS方法(40)对生物碱1-DNJ标准品和解淀粉芽孢杆菌ACCC10270发酵液进行鉴定,其一级和二级质谱图如图2A和B所示。标准品DNJ在一级质谱离子色谱图中显示出单一强峰,m/z比为164.0911(图2A)。在发酵液样品中,观察到[M+H]⁺离子峰在164.0927处(图2B)。DNJ标准品和发酵液均在164[M+H]⁺和146[M+H-H₂O]⁺处显示二级质谱峰,符合1-DNJ的预期特征(41)。这证实了解淀粉芽孢杆菌ACCC10270菌株产生1-DNJ。

【数据】标准品DNJ一级质谱m/z:164.0911;发酵液[M+H]⁺离子峰m/z:164.0927;二级质谱峰:164[M+H]⁺和146[M+H-H₂O]⁺
1-DNJ的测定
通过柱前衍生化建立了1-DNJ的线性范围(0.02–0.25 mg/mL)。图S1显示了解淀粉芽孢杆菌ACCC10270发酵液的HPLC图谱,由此计算出起始实验发酵液中1-DNJ的含量为842 ± 2.32 mg/L。
【数据】1-DNJ线性范围:0.02–0.25 mg/mL;起始发酵液1-DNJ含量:842 ± 2.32 mg/L
α-葡萄糖苷酶抑制的高通量平台
使用紫外-可见分光光度计测定发酵液中α-葡萄糖苷酶的抑制效率。图2C显示了I₂/KI在200–700 nm波长范围内的三个特征峰,分别在225 nm、287 nm和350 nm处。图2C还显示了590 nm处的强吸收峰,归属于可溶性淀粉和I₂/KI的显色峰(42)。在α-葡萄糖苷酶介入后,590 nm和350 nm吸收峰降低,其中590 nm处变化显著。图2C还显示混合物的吸光度等于其各组分吸光度之和。未观察到显著的相互作用或光谱重叠。这表明该方法对目标化合物具有高特异性,表现出良好的选择性,在组分共存的条件下无相互干扰。因此,本研究中1-DNJ对α-葡萄糖苷酶的抑制作用可通过590 nm处的吸光度计算,如式10所示。
(10)IR % = [ 1 − ( A_sample − A_blank ) / ( A_control − A_blank ) ] × 100
其中IR%为1-DNJ对α-葡萄糖苷酶的抑制率(%),A_sample和A_control分别为样品和对照在590 nm处的吸光度。CDNJ与α-葡萄糖苷酶抑制率之间存在线性关系(图2D)。拟合曲线(Y = 0.46 × X + 0.13)表现出强线性关系(R² = 0.9902),灵敏度和精密度分别为5.0%和4.2%,表明590 nm处的吸光度可用于评估发酵液对α-葡萄糖苷酶的抑制效率。两种分析方法的验证参数总结于表S2。高通量筛选方法的回收率分别为95.36%、89.76%和93.61%,检出限(LOD)为1.19 mg/L,定量限(LOQ)为3.99 mg/L(43),表明准确性令人满意。HPLC方法显示出相当的回收率(92.20%、91.30%和92.94%),但灵敏度较低,LOD和LOQ值分别为2.89 mg/L和9.65 mg/L。精密度以相对标准偏差表示,高通量方法为1.28%,HPLC方法为0.91%。总体而言,两种方法对于定量发酵样品中的目标化合物均有效可行。然而,高通量方法比HPLC方法显著省时。因此,对于发酵液中1-DNJ的测定,测量α-葡萄糖苷酶抑制的高通量方法比HPLC方法更快、更简便。
【数据】I₂/KI特征峰:225 nm、287 nm、350 nm;显色峰:590 nm;拟合曲线:Y = 0.46 × X + 0.13;R²:0.9902;灵敏度:5.0%;精密度:4.2%;高通量法回收率:95.36%、89.76%、93.61%;高通量法LOD:1.19 mg/L;高通量法LOQ:3.99 mg/L;HPLC法回收率:92.20%、91.30%、92.94%;HPLC法LOD:2.89 mg/L;HPLC法LOQ:9.65 mg/L;高通量法RSD:1.28%;HPLC法RSD:0.91%
单因素实验
通过单因素实验对发酵过程进行初步优化,以确定影响1-DNJ产量的各关键参数的初步最优范围,以发酵液的α-葡萄糖苷酶抑制活性为评价指标。如图3所示,发酵温度对生物催化活性产生显著影响,在35 °C时观察到最大抑制率(图3A)。偏离此最适温度会降低抑制率,表明酶或细胞活性欠佳。发酵时间进程显示,抑制率在72 h达到平台期(图3B),表明主要生产阶段已完成。接种量在1%(v/v)时最优(图3C),而该过程偏好中等碱性初始pH 9.0(图3D)。关于培养基组成,碳源浓度在4%(w/v)时最优(图3E)。更高浓度导致发酵液出现不良浑浊,可能反映了底物同化不完全或形态变化,而较低浓度则限制了前体供应。类似地,氮源浓度在1.72%(w/v)时表现出明显的最优值以支持最大产量(图3F)。因此,确定的基线最优条件为:发酵温度35 °C、时间72 h、接种量1%(v/v)、初始pH 9.0、碳源4%(w/v)、氮源1.72%(w/v)。在这些条件下进行的验证实验获得的发酵液α-葡萄糖苷酶抑制率为82.55%。随后的HPLC定量确认1-DNJ浓度为1064 ± 4.64 mg/L,较系统优化前的初始产量842 ± 2.32 mg/L提高了26.48%。

【数据】最适发酵温度:35°C;最适发酵时间:72 h;最适接种量:1%(v/v);最适初始pH:9.0;最适碳源浓度:4%(w/v);最适氮源浓度:1.72%(w/v);验证实验抑制率:82.55%;1-DNJ浓度:1064 ± 4.64 mg/L;初始产量:842 ± 2.32 mg/L;提升幅度:26.48%
算法选择与最终模型性能
单因素优化是一种常用方法,可通过调整参数来改进。然而,生物发酵的微妙性和复杂性可能被忽视(43)。因此,本研究利用ANN以上述数据集进一步探索发酵过程(图1)。通常,ANN的架构由层数、每层神经元数量、每层激活函数和训练算法组成(44)。神经网络的性能取决于其隐藏层数、神经元数量和训练算法(45)。预测性ANN模型的开发始于最优训练算法和网络架构的选择。系统评估了五种候选算法(backprop、rprop+、sag、rprop−和slr)。其性能基于不同隐藏层神经元数量(1至10)所构建模型的训练误差进行评估(图4A–E)。初步筛选显示,backprop(图4A)和slr(图4E)算法产生的模型训练误差较大且收敛不稳定,表明适用性较差。相比之下,使用rprop+(图4B)、sag(图4C)和rprop−(图4D)算法构建的模型在试验中表现出持续较低的误差和稳健的性能。此外,一个关键架构参数——隐藏层神经元数量——被同时优化。所有三种高性能算法(rprop+、sag、rprop−)在6个隐藏神经元时达到最小且稳定的训练误差,表明该架构有效捕捉了数据集中的非线性关系而不过拟合。为进一步区分这三种算法并验证模型泛化能力,采用了k折交叉验证。以交叉验证结果的RMSE作为比较指标(图4F–H)。当折数设置在5至8之间时,所有三种算法均产生稳定可靠的模型(RMSE < 0.52)。更少或更多的折数导致性能变异性增加和异常值数量增多(图4F)。加权弹性反向传播(rprop+)算法因其始终优越的性能而被选中。隐藏神经元数量的优化在6个神经元、2362个训练步骤后产生最小误差0.0074,R²值达到0.9935,斜率接近1,表明预测性能优异。


【数据】候选算法:backprop、rprop+、sag、rprop−、slr;隐藏层神经元评估范围:1–10;最优隐藏神经元数:6;k折交叉验证折数范围:5–8;交叉验证RMSE:<0.52;最优算法:rprop+;最小训练误差:0.0074;训练步骤:2362;R²:0.9935;斜率:接近1
ANN模型的变量重要性分析与预测
ANN模型的影响权重统计如图6A所示。敏感性分析表明,接种量和发酵温度是对α-葡萄糖苷酶抑制效率影响最大的两个工艺变量。基于机器学习的预测通过3D表面图展示了各变量间的交互作用:发酵温度与接种量(图6B)、发酵时间与初始pH(图6C)以及碳含量与氮含量(图6D)对α-葡萄糖苷酶抑制的联合效应。经过ANN模型优化后,预测的 refined 发酵条件将抑制率进一步提升至87.47%,1-DNJ产量达到1179 ± 8.44 mg/L。


【数据】最关键变量:接种量和发酵温度;预测抑制率:87.47%;预测1-DNJ产量:1179 ± 8.44 mg/L
讨论与解读
本研究将单因素实验与人工神经网络相结合,构建了一套适用于解淀粉芽孢杆菌发酵产1-DNJ的优化策略。单因素实验确定了各关键参数的最优水平,使产量从842 ± 2.32 mg/L提升至1064 ± 4.64 mg/L。ANN模型在有限数据集(32次实验运行)条件下,通过系统评估五种训练算法和隐藏层神经元数量,最终选定rprop+算法和6个隐藏神经元的架构,模型R²达0.9935,训练误差低至0.0074。敏感性分析明确指出接种量和发酵温度是最关键的过程变量,3D表面图进一步揭示了各参数间的交互作用。模型预测的优化条件将抑制率提升至87.47%,1-DNJ产量达1179 ± 8.44 mg/L。
编译者解读:该研究的亮点在于用计算成本极低的ANN模型(仅6个隐藏神经元)在32组数据上实现了高精度预测,这对数据获取昂贵的发酵优化场景尤为实用。rprop+算法对小型数据集的稳健性值得关注。但需注意,模型预测的1179 mg/L产量仅经过有限验证,放大到工业规模时溶氧、剪切力等未纳入模型的变量可能引入偏差。此外,α-葡萄糖苷酶抑制率作为间接指标虽与1-DNJ浓度线性良好(R² = 0.9902),但发酵液中其他代谢物对抑制率的潜在贡献未被完全排除。总体而言,该框架为合成生物学中发酵工艺的快速优化提供了可复制的范式。
参考来源
期刊:Journal of Bioscience and Bioengineering, 2026
DOI: 10.1016/j.jbiosc.2026.07.001
DOI: 10.1016/j.jbiosc.2026.07.001