来源:Real-time monitoring of lipopeptide biosynthesis in Bacillus subtilis fermentation using attenuated total reflectance Fourier transform infrared spectroscopy combined with chemometrics(Spectrochimica Acta Part A: Molecular and Biomolec)| 编译:DNA Lab Space | 原文许可:elsevier-subscription

导读
脂肽是一类由芽孢杆菌属通过发酵产生的生物表面活性剂,具有抗菌、抗病毒、抗肿瘤等多种生物活性,应用前景广阔。然而其发酵过程存在复杂性高、成本高、产量低等挑战。本研究开发了一种基于衰减全反射傅里叶变换红外光谱结合化学计量学的实时监测策略,通过PCA实现发酵阶段划分,LDA分类模型结合SG-SD预处理实现100%准确率,PLSR定量模型对菌体浓度、还原糖和脂肽产量的预测R²分别达0.9720、0.9762和0.9406,为工业规模脂肽生产提供了有效的过程监测工具。
研究背景
脂肽是由脂肪酸链与肽部分连接而成的两亲性化合物,根据碳链长度、支链位置和氨基酸组成形成多种结构变体。目前已鉴定的脂肽主要分为表面活性素、伊枯草菌素和丰原素三大类。大量研究表明,脂肽具有广谱生物活性,包括抗菌、抗病毒、抗肿瘤、免疫调节等效应,以及表面活性、生物膜抑制和植物促生长等功能。作者所在研究团队前期已阐明枯草芽孢杆菌来源脂肽的抗菌机制,证实其能破坏细菌膜完整性、干扰细胞壁生物合成并抑制生物膜形成。凭借其显著的生物活性,脂肽在医药、农业、工业和化妆品等领域具有广阔应用前景。然而,脂肽发酵过程面临复杂性高、成本高和产量低等挑战,亟需开发实时监测策略以实现过程优化。
研究方法
2.1 菌株与培养基
枯草芽孢杆菌菌株(GIM1.286;SHBCC)购自中国上海保藏生物技术中心。液体发酵培养基组成:蔗糖2.00%、牛肉浸膏0.20%、谷氨酸钠2.00%、MgSO₄·7H₂O 0.05%、CaCl₂ 0.20%和K₂HPO₄ 0.1%。
种子培养制备:在洁净工作台中用无菌接种环挑取一环枯草芽孢杆菌GIM1.286,接种于LB液体培养基中,于37°C、220 r/min条件下振荡培养18 h。
发酵培养制备:将所得种子培养液按4%接种量接种至液体发酵培养基中。在三个相同的5 L发酵罐(Biotech,上海)中同时进行72 h发酵。根据上述实验步骤,共设置7个采样点,每个采样点随机收集15个样品(3×5)。共获得105个样品(15×7)用于后续建模与分析。
然而,光谱数据分析常面临高维性(大量波长点)、样品采集成本高以及类别间潜在光谱重叠等挑战。此外,模型性能高度受样品划分方法影响。随机划分可能导致训练集和测试集缺乏代表性,从而引入显著偏差和预测误差,而Kennard-Stone算法提供了稳健的解决方案。该方法专门用于选择最具代表性的样品进行模型训练,从而增强模型泛化能力并确保对未知样品预测性能的严格评估。鉴于其在化学计量学和光谱分析中利用有限样品的广泛应用,本研究采用KS算法将数据集划分为训练集和测试集。
【数据】菌株:Bacillus subtilis GIM1.286(SHBCC);培养基组成:蔗糖2.00%、牛肉浸膏0.20%、谷氨酸钠2.00%、MgSO₄·7H₂O 0.05%、CaCl₂ 0.20%、K₂HPO₄ 0.1%;种子培养:37°C、220 r/min、18 h;接种量:4%;发酵罐:3个5 L发酵罐;发酵时间:72 h;采样点:7个;样品总数:105个
2.2 发酵过程中关键理化参数测定
菌体浓度:将发酵液样品稀释50倍,使用紫外-可见分光光度计在600 nm处测定吸光度。以无菌蒸馏水作为空白对照。吸光度值与细胞浓度成正比。
还原糖:将发酵液样品在8000 rpm、4°C条件下离心10 min,收集1 mL上清液稀释50倍,采用3,5-二硝基水杨酸法进行分析。
脂肽产量:将发酵液样品在8000 rpm、4°C条件下离心10 min,收集上清液。用6 mol/L HCl将上清液pH调至2.0,置于4°C冰箱中12 h。在8000 rpm、4°C条件下离心10 min收集沉淀。所得沉淀经甲醇提取,收集含脂肽溶液,在真空干燥箱中干燥、称重,记录为脂肽产量。
【数据】菌体浓度测定:稀释50倍,OD₆₀₀;还原糖测定:8000 rpm离心10 min(4°C),上清稀释50倍,DNS法;脂肽提取:6 mol/L HCl调pH至2.0,4°C放置12 h,8000 rpm离心10 min,甲醇提取,真空干燥称重
2.3 ATR-FTIR光谱设置与信号采集
使用配备衰减全反射附件的FTIR光谱仪(Bruker,德国)采集光谱数据。全文将该技术称为ATR-FTIR光谱法。发酵实验中,首先采集蒸馏水的背景光谱作为参比光谱。随后,将不同发酵时间的发酵上清液滴加至ATR探头上。每个样品使用ATR-FTIR光谱法进行三次重复扫描,取三次重复的平均光谱。各样品光谱在750–4000 cm⁻¹范围内以ATR模式采集,分辨率8 cm⁻¹,32次扫描累加。每次扫描后,用乙醇清洗ATR探头两次。整个实验共获得105个(7×15)ATR-MIR光谱,涵盖7个发酵时间点各15个样品。
【数据】光谱范围:750–4000 cm⁻¹;分辨率:8 cm⁻¹;扫描次数:32次/样品;重复:3次/样品;清洗:乙醇2次/扫描;总光谱数:105个
2.4 数据预处理
原始ATR-FTIR光谱中可能出现噪声、基线漂移和峰位偏移,影响后续建模结果。光谱平滑技术可减少噪声并提高信噪比。为缓解这些不利因素并增强后续模型的稳健性,本研究采用四种光谱预处理技术:FD、SD、SG-FD和SG-SD。SG平滑基于差分原理,通过计算光谱中相邻数据点之间的差值,有效抑制高频噪声。通过微分处理技术可以有效提高光谱数据质量。其中,FD可以消除基线漂移和背景干扰,使信号变化趋势更加明显。SD可以消除基线斜率的变化,提高数据的分辨率和检测灵敏度。通过SG-FD和SG-SD进一步优化处理效果,不仅能校正基线偏移,还能消除斜率的影响。这些预处理方法的合理应用显著提高了光谱数据的信噪比和分析可靠性,为后续定量检测和定性研究奠定了更准确的数据基础。
【数据】预处理方法:FD、SD、SG-FD、SG-SD;SG平滑原理:相邻数据点差分;FD功能:消除基线漂移和背景干扰;SD功能:消除基线斜率变化
2.5 数据分析方法与模型评价指标
#### 2.5.1 PCA
PCA作为一种经典的无监督多元统计方法,通过线性变换将高维数据投影到低维特征空间,从而有效提取数据集中的主要变化模式。PCA通过特征值分解将原始高维红外光谱数据(通常包含数千个波长变量)转化为少数正交主成分。这些主成分按方差贡献率降序排列,能最大程度保留原始光谱的特征信息。此外,通过构建三维主成分得分空间(通常为PC1-PC3),可以直观显示不同发酵时间样品的聚类特征和演变轨迹,从而实现发酵过程的动态监测和阶段划分。PCA通过舍弃低方差贡献率的次要成分,有效滤除光谱数据中的随机噪声和冗余信息,显著提高后续定量分析模型的稳健性和分析效率。
#### 2.5.2 XGBoost、SVM、KNN和LDA定性识别模型
XGBoost是一种可扩展且高效的机器学习系统,实现了梯度提升框架,在广泛的预测建模任务中展现出最先进的性能。SVM是一种强大的监督分类器,通过识别最优分离超平面来最大化类间间隔,该超平面由称为支持向量的关键样本定义。SVM以在高维和非线性空间中的有效性著称,利用核函数处理异质和复杂数据集,具有较高精度。KNN算法是一种基于实例的机器学习方法,广泛用于模式识别和分类任务。在分类中,KNN算法根据新样本最近邻的类别对其进行归类。具体而言,算法在分类过程中识别距离未知样本最近的k个训练实例。对于特征空间结构相对简单的数据(如红外光谱数据),KNN能有效捕获样本间的相似性并实现较高的分类精度。LDA用于将数据投影到最大化类间离散度与类内离散度比值的低维子空间中。
【数据】模型:XGBoost、SVM、KNN、LDA;KS算法用于数据集划分(训练集/测试集);LDA目标:最大化类间/类内离散度比值
研究结果
3.1 枯草芽孢杆菌发酵过程中关键理化参数变化
枯草芽孢杆菌产脂肽过程中关键理化参数的变化曲线如图1所示。发酵过程中,还原糖作为微生物生长的主要碳源和能源被消耗,反映代谢活性。初始12 h内,还原糖含量下降,而光密度(OD,指示菌体浓度)略有增加,脂肽合成有限。该阶段对应细菌生长的延滞期,各参数变化相对缓慢。12–24 h之间,还原糖被快速消耗,菌体浓度和脂肽产量均显著增加,表明微生物呈指数生长和产物积累,符合对数期特征。24–48 h期间,还原糖消耗速率减慢,这可能归因于枯草芽孢杆菌不仅利用现有糖类,还分泌纤维素酶等代谢产物将多糖降解为单糖。此期间,菌体生长达到最大值,脂肽产量达到峰值,符合稳定期特征。48 h后,还原糖几乎耗尽,细菌培养因营养耗竭进入衰亡期。脂肽产量在发酵末期略有下降,提示脂肽可能被用作替代营养源。基于上述观察,发酵过程可分为四个不同阶段:0–12 h(延滞期)、12–24 h(对数期)、24–48 h(稳定期)和48–72 h(衰亡期)。
【数据】延滞期:0–12 h;对数期:12–24 h;稳定期:24–48 h;衰亡期:48–72 h;还原糖:初始12 h下降,12–24 h快速消耗,48 h后几乎耗尽;脂肽产量:24–48 h达峰,末期略降
3.2 ATR-FTIR光谱分析
发酵样品的原始ATR-FTIR光谱如图2所示。从图中可以清晰看出,随着发酵的进行,微生物代谢活动导致样品组成发生变化,从而引起光谱变化。不同发酵时间的样品表现出相似的光谱趋势,但吸收峰强度不同。这些吸收峰的变化主要与发酵过程中化合物浓度(如糖类和蛋白质)的差异有关,导致样品间波段面积存在显著差异。3700–3300 cm⁻¹范围内的吸收峰归属于羟基(OH)的伸缩振动,这是葡萄糖的特征峰。2901和2975 cm⁻¹处的强峰代表脂肪族CH键的不对称伸缩振动。1740–1700 cm⁻¹处的吸收峰表明存在氨基酸两性离子CO峰或酰胺羰基峰,而1650–1580 cm⁻¹处的吸收峰为NH弯曲和CO伸缩振动,1550–1520 cm⁻¹处的吸收峰为NH弯曲和CN伸缩,提示蛋白质的存在。观察到的具体红外波段分配表如表1所示。对这些吸收峰进行定性分析,不仅有助于识别发酵过程中的关键化学物质,还为发酵过程的优化和控制提供了坚实的科学依据。这进一步验证了ATR-FTIR光谱在分析发酵产物化学成分方面的有效性。

【数据】OH伸缩振动:3700–3300 cm⁻¹(葡萄糖特征);CH不对称伸缩:2901、2975 cm⁻¹;CO/酰胺羰基:1740–1700 cm⁻¹;NH弯曲+CO伸缩:1650–1580 cm⁻¹;NH弯曲+CN伸缩:1550–1520 cm⁻¹
3.3 发酵过程定性识别模型
#### 3.3.1 PCA
将PCA应用于ATR-FTIR光谱数据进行降维,使样品在主成分空间中的分布能有效反映其类别归属。如图3(a)所示,三维PCA得分图清晰区分了不同发酵阶段的样品,前三个主成分(PC1、PC2和PC3)共同解释了总方差的99.1%。聚类模式呈现明显的时间演变特征:0 h样品与36 h样品部分重叠,提示可能因残留底物导致组成特征相似。12 h和24 h样品略有重叠,表明指数生长期快速产脂肽阶段的光谱相似性。48 h样品明显分离,而60 h和72 h样品重叠,反映发酵后期代谢稳定性。这种分离模式与先前测定的参数(菌体浓度、糖消耗和脂肽产量)一致,支持将发酵过程划分为四个不同阶段:0–12 h、12–24 h、24–48 h和48–72 h。PCA结果表明,发酵过程中理化参数的变化反映了糖代谢的动态,证实PCA是监测脂肽发酵过程中化学动力学的有效工具。

为识别驱动主成分且具有明确化学意义的关键光谱变量,对PCA模型进行了载荷分析。图3(b)显示了PC1和PC2上贡献最大的前20个光谱波段的载荷。分析表明,这些关键波段显著富集在与主要生物分子相关的特定区域。如表2所总结,最终驱动模型且具有明确生物学可解释性的信号主要来自关键化学区域,包括2833–1715 cm⁻¹(脂质)、1542–1507 cm⁻¹(蛋白质)和3750–3565 cm⁻¹(碳水化合物)。这一结果不仅验证了光谱数据的生化合理性,也证明了模型的有效性和可解释性——其判别力源于样品核心化学组成的差异。
【数据】PC1+PC2+PC3解释总方差:99.1%;关键化学区域:2833–1715 cm⁻¹(脂质)、1542–1507 cm⁻¹(蛋白质)、3750–3565 cm⁻¹(碳水化合物)
#### 3.3.2 XGBoost、SVM、KNN和LDA定性识别模型
如图4所示,混淆矩阵展示了不同分类器(XGBoost、SVM、KNN和LDA)在不同预处理方法(RAW、FD、SD、SG-FD、SG-SD)下,使用训练集5折交叉验证进行七类分类任务的性能。矩阵以真实标签为行、预测标签为列排列。表3提供了平均5折交叉验证结果和独立测试集泛化性能的比较汇总。

结果揭示了两个关键发现。第一,在分类器中,LDA的预测准确率显著优于其他模型,KNN次之,而XGBoost性能最低。LDA的显著效果可能归因于其线性特性和共同协方差结构的假设,这恰好适合光谱特征的数据分布。XGBoost性能相对较差可归因于其作为基于树的模型固有的复杂性,在处理低信噪比或高线性可分性的光谱数据时优势有限,同时更容易受到光谱噪声和冗余特征的干扰。第二,预处理技术的应用显著提高了模型预测精度。值得注意的是,SG-SD方法在所有分类器中均一致地产生优异的泛化能力(准确率=1.0000)。这可归因于其双重优势:SG平滑有效降低高频噪声,而SD增强重叠光谱峰的分辨率并消除基线漂移。这种组合成功提取了最具判别性的化学信息,从而提高了模型对未见数据的稳健性和泛化能力。
【数据】最佳分类器:LDA;最佳预处理:SG-SD;测试集准确率:1.0000;分类任务:七类;交叉验证:5折
3.4 PLSR定量预测模型
本研究采用PLSR将光谱数据与关键理化参数进行关联。PLSR定量预测模型的详细结果如图5所示。

【数据】原文未详述PLSR模型的具体数值细节(见图5及表4)
3.5 讨论
如表5所示,本模型对关键指标(如菌体浓度)的预测决定系数(R²p > 0.97)和预测均方根误差(RMSEP < 0.01)与近期同类先进研究相当。例如,豆粕发酵中可溶性蛋白监测(R²p = 0.9883)、菠萝酒发酵总酸度监测(R²p = 0.894)和固态多肽发酵中肽含量监测(R²p = 0.9441)均表现出可比性能。这证实了本方法的有效性和竞争力。但需指出,由于目标分析物、浓度范围和发酵基质不同,直接进行数值优劣排序不够严谨。例如,监测高浓度底物(如葡萄糖)与检测低浓度副产物(如乙酸盐)的模型,其RMSEP绝对值自然存在量级差异。因此,比较的重点不在于声称"优越性",而在于验证方法的可靠性。结果表明,针对特定的发酵体系和监测目标,所建模型达到了该领域公认的实际预测应用性能阈值(R²p > 0.9通常被认为表示优异的预测能力)。此外,本研究的工业意义在于——ATR-FTIR技术无需样品预处理即可实现实时原位监测,为工业规模脂肽生产的过程控制提供了切实可行的解决方案。
【数据】菌体浓度:R²p > 0.97,RMSEP < 0.01;对比文献:豆粕发酵可溶性蛋白R²p = 0.9883、菠萝酒总酸度R²p = 0.894、固态多肽发酵肽含量R²p = 0.9441;性能阈值:R²p > 0.9
讨论与解读
本研究成功将ATR-FTIR光谱与化学计量学方法相结合,实现了枯草芽孢杆菌发酵过程中关键参数的实时监测。在定性分析方面,LDA分类器配合SG-SD预处理在所有模型中表现最优(测试集准确率=1.0000),证明了光谱预处理与分类器选择的协同作用。在定量分析方面,SG-FD-PLSR模型对菌体浓度预测效果最佳(R² = 0.9720,RMSEP = 0.0044),SD-PLSR对还原糖(R² = 0.9762,RMSEP = 0.0897)和脂肽产量(R² = 0.9406,RMSEP = 0.1095)预测性能最优。与文献报道的同类监测模型相比,本研究的预测精度处于先进水平。该方法无需复杂样品预处理即可实现原位监测,具有工业应用潜力。
编译者解读
该研究将ATR-FTIR与化学计量学结合用于发酵过程监测,体现了过程分析技术在合成生物学放大生产中的实用价值。亮点在于系统比较了多种预处理与分类器的组合策略,为同类研究提供了方法学参考。SG-SD预处理在所有模型中一致提升性能,说明光谱噪声与基线漂移是影响模型鲁棒性的关键因素。不过,当前模型均基于单一菌株和固定培养基配方建立,其跨菌株、跨培养基的通用性尚待验证。从合成生物学角度看,若能将此监测策略与实时反馈控制回路耦合,有望实现发酵过程的自动化动态调控——这是工业脂肽生产降本增效的可行路径。
参考来源
期刊:Spectrochimica Acta Part A: Molecular and Biomolecular Spectroscopy, 2026
DOI: 10.1016/j.saa.2025.127347
DOI: 10.1016/j.saa.2025.127347