全细胞生物传感器阵列结合可解释机器学习

来源:Container-level proof-of-concept monitoring of postharvest apple blue mold using a whole-cell biosensor array and interpretable machine learning(Food Control)| 编译:DNA Lab Space | 原文许可:elsevier-subscription

📎 相关工具:蛋白可溶性优化分析

导读

苹果青霉病由扩展青霉引起,早期感染无症状、肉眼不可见,且伴随展青霉素污染风险。本研究构建了启动子驱动的全细胞生物传感器阵列,在密闭容器内非接触式采集感染果实释放的挥发性有机化合物信号,结合十种机器学习算法进行感染状态二分类与感染阶段多分类。LightGBM模型在独立测试集上二分类准确率达95.2%、AUC达0.983,多分类准确率达96.4%、宏平均AUC达0.995,并借助SHAP与LIME揭示了yeeN、evgA、dkgB等启动子-时间特征对阶段判别的贡献。

研究背景

扩展青霉是苹果采后贮藏与流通环节最具破坏性的真菌病害之一,造成严重的品质劣变和经济损失。该菌还能产生展青霉素,带来食品安全隐患。早期感染往往无症状、无法通过外观识别,传统基于外观的检查方法不仅费时费力,也难以对潜在感染样本做出及时准确的判断。因此,快速、无损的监测技术对采后品质控制和病害风险管理意义重大。

病原侵染会改变寄主果实的代谢状态,导致挥发性有机化合物(VOC)的组成与释放动态发生系统性变化,使VOC成为采后病害无损监测的重要信息载体。基于VOC的检测主要依赖气相色谱-质谱联用,虽然灵敏度高,但设备昂贵、操作复杂,难以用于快速筛查和在线监测。本研究尝试用工程化全细胞生物传感器阵列替代大型仪器,将VOC响应转化为可量化的生物发光信号,再借助机器学习完成病害识别与阶段判别。

研究方法

2.1 菌株与果实

扩展青霉野生型菌株T01最初从感染苹果中分离,按Li等(2015)所述方法获得。该菌株保存在马铃薯葡萄糖琼脂(PDA)平板上,于25 °C黑暗条件下培养。携带dkgB、yiaG、hipB、yeeN、ygcF、frC、elfA和evgA启动子-报告基因融合体的生物发光大肠杆菌菌株来自我们此前的研究(Sun等,2025)。新鲜苹果(Malus domestica Borkh. cv. Fuji)购自中国北京当地商业经销商,用于后续实验。

【数据】菌株:扩展青霉野生型T01、8株启动子-报告基因融合生物发光大肠杆菌(dkgB、yiaG、hipB、yeeN、ygcF、frC、elfA、evgA);培养基:PDA;温度:25 °C;光照:黑暗;苹果品种:Malus domestica Borkh. cv. Fuji;产地:中国北京

2.2 基于启动子的全细胞生物传感器阵列构建

本研究使用的启动子-荧光素酶报告系统基于此前建立的可诱导启动子构建体(图1A),它们构成了启动子驱动全细胞生物传感器平台的基础。菌株构建与表征的更多细节见Sun等(2025)。工程化生物发光大肠杆菌菌株在Luria-Bertani(LB)培养基中于37 °C、220 rpm振荡培养过夜,随后转接至新鲜LB培养基中继续培养3 h,以达到指数生长期。用新鲜LB培养基稀释培养物,制备成600 nm处光密度为0.2的细菌悬液。将标准化细菌悬液与1.5%(w/v)海藻酸钠溶液等体积混合,并按照Sun等(2025)的方法用0.5 M氯化钙交联固化,形成海藻酸钙微珠。随后将固定化细胞分装到96孔微板的各个孔中,组装成全细胞生物传感器阵列(图1B)。

Schematic illustration of the whole-cell biosensor array-based system for non-destructive monitoring of apple blue mold. (A) Schematic representation of the promoter-luciferase reporter system used in this study, illustrating the principle of inducible promoter activation and bioluminescent signal g
▲ Schematic illustration of the whole-cell biosensor array-based system for non-destructive monitoring of apple blue mold. (A) Schematic representation of the promoter-luciferase reporter system used in this study, illustrating the principle of inducible promoter activation and bioluminescent signal g

【数据】培养基:LB;温度:37 °C;转速:220 rpm;过夜培养后转接培养:3 h;菌液OD600:0.2;海藻酸钠浓度:1.5%(w/v);氯化钙浓度:0.5 M;微板规格:96孔

2.3 果实接种与贮藏

果实伤口接种按照Zhu、Chen、Xing、Prusky等(2025)的方法进行。简言之,从扩展青霉7天龄培养物中收获分生孢子,悬浮于无菌水中,最终浓度调整为1 × 10⁶ 个分生孢子 mL⁻¹。苹果经表面消毒、冲洗,并在室温下风干后接种。在每个苹果赤道区域等距人工制造4个伤口,每个伤口接种5.0 μL分生孢子悬浮液。接种等体积无菌水的苹果作为对照。接种后,将苹果置于5.5 L塑料容器中,在室温(约23 °C)下孵育,以观察青霉病症状发展并使用全细胞生物传感器阵列进行VOC传感(图1C)。每个容器放置4个苹果,每次实验设5个生物学重复,整个实验至少独立重复4次。由于本研究的VOC传感采用密闭容器顶空测量,所得响应模式代表每个容器内分组果实样品产生的容器级VOC谱,而非经过验证的单果读数。因此,本研究报道的所有机器学习标签和性能指标均对应容器级分组果实样品。

【数据】分生孢子浓度:1 × 10⁶ 个 mL⁻¹;培养龄期:7天;接种体积:5.0 μL/伤口;伤口数:4个/苹果;容器体积:5.5 L;温度:约23 °C;每容器苹果数:4个;生物学重复:5次;独立重复:至少4次;对照组:等体积无菌水

2.4 VOC暴露与无损传感

VOC暴露与无损传感按照Ma等(2023)的方法进行,并稍作修改。接种扩展青霉的苹果在室温下孵育,并于第2天(D2)和第3天(D3)进行分析。在本实验条件下,D2时未见明显病害症状,而D3时可观察到清晰症状(图S1)。选择D2和D3分别代表两个生物学和实践上不同的阶段:早期无症状阶段和可见症状阶段。D1未纳入建模,因为初步观察显示该时间点无可见症状且VOC诱导的生物传感器响应微弱、不稳定,难以在本实验设计中建立稳健的阶段分类标签。将全细胞生物传感器阵列置于密封塑料容器内,使其暴露于感染果实释放的VOC,而样品与生物传感器细胞之间无直接物理接触。使用多功能微板读数仪(Spark,Tecan,瑞士)在VOC暴露后1、2、3、4和5 h记录生物发光信号(图1D),从而捕获每个启动子的时间响应曲线。对于每个启动子菌株,发光信号在初始时间点(1 h)以对应的无菌水接种对照果实的响应进行归一化,并以诱导倍数(IF)表示,定义为相对于对照基线的比值。该归一化使得不同时间点和感染阶段的VOC诱导响应可以定量比较。为减少实验变异,全细胞生物传感器阵列由8个启动子菌株组成,每个启动子菌株在每次传感运行中设12个重复孔。

【数据】分析时间点:D2、D3;信号记录时间:VOC暴露后1、2、3、4、5 h;仪器:Spark多功能微板读数仪(Tecan,瑞士);启动子菌株数:8;每菌株重复孔数:12;归一化方式:以1 h无菌水对照为基线,表示为诱导倍数(IF);排除时间点:D1

2.5 苹果青霉病识别二分类模型构建与评价

对于苹果青霉病感染状态(对照 vs 感染)的二分类,以生物传感器响应特征作为输入矩阵(X),样品标签作为输出变量(Y)。所有建模和分析均在Python中完成。在机器学习矩阵中,每个模型实例对应一个匹配的生物传感器响应谱,由本传感流程产生的40个启动子-时间特征(8个启动子 × 5个监测时间点)组成。具体而言,在每次传感运行中,将8个启动子菌株中相同重复位置在全部5个监测时间点上进行匹配,构建一个40特征谱;因此,12个重复孔在每次运行中产生12个技术重复衍生谱用于模型构建。由于这些谱来自同一传感运行中暴露于同一密封容器顶空的重复孔,它们被视为技术重复衍生谱,而非独立的生物学观察。因此,数据划分和性能解释的有效生物学单元是容器/实验批次组。相应地,机器学习矩阵中的模型实例数大于有效独立容器级生物学组数。二分类数据集包含46个独立容器级生物学组,分别划分为36、3和7组用于训练、验证和独立测试子集。这些组分别对应432、36和84个技术重复衍生谱。数据集结构的更多细节见表S1。为降低技术重复衍生谱信息泄漏的风险,数据划分在组水平而非单个谱水平进行。组标识符由容器身份和独立实验批次组合定义,使同一实验批次中同一容器来源的所有技术重复衍生谱被分配到同一子集。随后将数据集按约80:5:15的比例划分为训练、验证和独立测试子集,同时尽可能保持类别分布。特征标准化参数仅使用训练子集估计,随后应用于验证和独立测试子集。共评估了10种分类算法,包括随机森林、决策树、自适应提升(AdaBoost)、极端梯度提升(XGBoost)、类别提升(CatBoost)、径向基核支持向量机(SVM-RBF)、线性核支持向量机(SVM-Linear)、LightGBM、LDA和梯度提升。

【数据】特征数:40(8启动子 × 5时间点);二分类数据集独立容器级生物学组:46组;训练/验证/测试组数:36/3/7;对应技术重复衍生谱:432/36/84;划分比例:约80:5:15;评估算法数:10种;标准化参数:仅用训练子集估计;每菌株重复孔:12

研究结果

3.1 扩展青霉感染过程中VOC诱导的全细胞生物传感器阵列响应特征

如图2所示,全细胞生物传感器阵列对D2和D3时扩展青霉感染苹果释放的VOC表现出阶段依赖性和时间动态响应模式。在1-5 h暴露期内,不同启动子菌株的IF值存在显著差异,反映了苹果青霉病进展过程中VOC谱的动态变化。在感染D2阶段,苹果表面未见明显病害症状(图S1),大多数菌株响应普遍较弱且不稳定,IF值接近基线水平。携带hipB、dkgB和frC启动子的菌株在多个时间点表现出轻微抑制或弱诱导(IF < 1.2)。此外,yeeN和yiaG菌株仅在少数样品或D2特定时间点出现诱导,总体响应水平仍然较低。相比之下,在青霉病症状更为明显的D3阶段(图S1),生物传感器阵列的总体VOC诱导响应增强。多个菌株,尤其是yeeN、yiaG和hipB启动子菌株,在若干监测时间点IF值显著升高,部分生物学重复的峰值诱导超过2.0。与D2相比,D3样品表现出更宽的动态范围和更高的一致性。层次聚类分析进一步基于VOC诱导响应模式清晰区分了D2和D3样品,表明全细胞生物传感器阵列有效捕获了不同感染阶段间挥发性代谢特征的差异。此外,单个启动子在1-5 h内的时间响应轨迹在D2和D3之间也差异显著,表明感染阶段和VOC暴露时间共同影响生物传感器阵列的响应特征。这些结果表明,启动子驱动的全细胞生物传感器阵列能够基于VOC响应指纹区分苹果青霉病不同感染阶段,为后续基于机器学习的病害识别和阶段判别提供了数据基础。

Response patterns of the whole-cell biosensor array to volatile metabolites released during apple blue mold progression. Heatmap showing induction factor (IF) values of different promoter-based biosensors monitored at 1-5 h after VOC exposure. Rows represent individual promoter strains at different
▲ Response patterns of the whole-cell biosensor array to volatile metabolites released during apple blue mold progression. Heatmap showing induction factor (IF) values of different promoter-based biosensors monitored at 1-5 h after VOC exposure. Rows represent individual promoter strains at different

【数据】监测时间点:1、2、3、4、5 h;D2阶段IF值:多数<1.2;D3阶段峰值IF:部分重复>2.0;启动子:hipB、dkgB、frC、yeeN、yiaG等;聚类方法:层次聚类;区分阶段:D2 vs D3

3.2 基于生物传感器阵列的苹果青霉病识别性能

基于全细胞生物传感器阵列响应特征构建的模型能够有效区分健康苹果与感染苹果(D2和D3),但不同机器学习算法之间性能存在差异。训练子集上的五折交叉验证显示,LightGBM、CatBoost和SVM-RBF模型达到了最高的中位准确率(0.948),而线性模型SVM-Linear和LDA表现相对较低。在表现最佳的模型中,LightGBM和CatBoost的四分位距相对较小,表明在本数据集内行为相对稳定(图3A)。在训练、验证和独立测试子集上的比较评估进一步显示,大多数集成学习模型在准确率、AUC、F1分数、MCC和Cohen's kappa等多个指标上优于线性模型和单决策树模型。其中,LightGBM在独立测试子集上表现最佳,准确率达0.952,AUC达0.983(图3B和C)。Bootstrap分析进一步显示,LightGBM模型的准确率为0.9518,95%置信区间为0.9036-0.9880;AUC为0.9834,95%置信区间为0.9451-1.0000(表S2)。F1分数、Cohen's kappa和MCC的95%置信区间分别为0.9379-0.9933、0.6045-0.9583和0.6196-0.9591。标签打乱/置换对照显示,观察到的准确率、AUC、F1分数、Cohen's kappa和MCC均高于1000个打乱标签模型生成的零分布,经验P值均为0.0010(表S2)。基于LightGBM模型的特征重要性分析识别出若干对二分类有贡献的信息性启动子-时间组合,其中yeeN_1h、hipB_5h、dkgB_5h和frC_2h的重要性得分较高(图3D)。综上,这些结果支持在本实验条件下使用全细胞生物传感器阵列结合机器学习从VOC响应指纹中判别苹果青霉病感染状态的可行性。在内部划分数据集内,LightGBM在所评估模型中表现出最强的总体分类性能,支持其作为内部概念验证分类器使用。

Performance of machine learning models for apple blue mold identification based on biosensor responses. (A) Distribution of classification accuracy obtained from five-fold cross-validation for different machine learning models. (B) Comparative performance of models on training, validation, and held-
▲ Performance of machine learning models for apple blue mold identification based on biosensor responses. (A) Distribution of classification accuracy obtained from five-fold cross-validation for different machine learning models. (B) Comparative performance of models on training, validation, and held-

【数据】五折交叉验证最高中位准确率:0.948(LightGBM、CatBoost、SVM-RBF);LightGBM测试集准确率:0.952;AUC:0.983;Bootstrap准确率:0.9518(95% CI 0.9036-0.9880);Bootstrap AUC:0.9834(95% CI 0.9451-1.0000);F1 95% CI:0.9379-0.9933;Cohen's kappa 95% CI:0.6045-0.9583;MCC 95% CI:0.6196-0.9591;置换检验经验P值:0.0010(1000次打乱);高重要性特征:yeeN_1h、hipB_5h、dkgB_5h、frC_2h;算法数:10种

3.3 关键启动子-时间特征对苹果青霉病识别的贡献

为进一步评估最优模型的分类行为和可解释性,对LightGBM分类器进行了概率校准、混淆矩阵分析和基于SHAP的解释。校准曲线用于描述性评估LightGBM模型在本数据集内的概率输出行为。训练子集上的预测概率总体接近理想校准线(图4A),而在独立测试子集上观察到波动,可能反映了独立容器级生物学组数量有限。混淆矩阵分析用于进一步检查各分析子集上的分类行为(图4B)。在独立测试子集上,LightGBM正确分类了98.6%的感染样品,仅少量健康样品被分类为感染。随后使用基于SHAP的解释识别对模型判别有信息贡献的启动子-时间特征(图4C)。结果显示,yeeN_1h、dkgB_5h、evgA_3h、evgA_2h和hipB_5h对模型输出贡献强烈。SHAP值在不同特征水平上的分布表明,这些启动子在特定VOC暴露时间点的响应变化与健康样品和感染样品的区分相关,凸显了生物传感器阵列中时间响应模式的重要性。总体而言,LightGBM模型在本数据集内表现出强分类性能,SHAP分析通过识别对二分类有信息贡献的启动子-时间特征提高了模型行为的透明度。这些特征应被解释为候选的模型相关信号,而非感染生物学的直接因果指标。

Reliability and interpretability analysis of the LightGBM model for binary classification of apple blue mold based on biosensor responses. (A) Probability calibration curves of the LightGBM model on the training and held-out test subsets. (B) Confusion matrices illustrating classification consistenc
▲ Reliability and interpretability analysis of the LightGBM model for binary classification of apple blue mold based on biosensor responses. (A) Probability calibration curves of the LightGBM model on the training and held-out test subsets. (B) Confusion matrices illustrating classification consistenc

【数据】测试集感染样品正确分类率:98.6%;高贡献特征:yeeN_1h、dkgB_5h、evgA_3h、evgA_2h、hipB_5h;校准评估:训练子集接近理想线,测试子集有波动;分析方法:校准曲线、混淆矩阵、SHAP

3.4 基于生物传感器阵列的苹果青霉病感染阶段判别

为评估全细胞生物传感器阵列能否区分苹果青霉病进展的不同阶段,进行了多分类分析以判别对照、D2和D3样品。观察到机器学习算法之间存在明显性能差异。训练子集上的五折交叉验证显示,SVM-RBF、CatBoost、随机森林、XGBoost和LightGBM达到了相似的高中位准确率,而线性模型和单决策树模型表现相对较低(图5A)。在训练、验证和独立测试子集上,LightGBM、SVM-RBF和XGBoost在多分类任务中表现相对一致。在这些模型中,LightGBM在准确率、加权F1分数、Kappa和MCC等多个指标上取得了最佳总体平衡(图5B)。基于独立测试子集的一对多ROC分析进一步表明,LightGBM模型对三个类别均有良好判别能力,其中D3表现最高(AUC = 1.000),其次是D2(AUC = 0.993)和对照(AUC = 0.987)。宏平均AUC达到0.995(图5C)。其余九个模型的结果也显示,基于树的集成模型在多分类任务中总体优于线性模型。这些结果表明,在本实验条件下,全细胞生物传感器阵列结合机器学习不仅能够识别苹果青霉病感染状态,还能进一步区分早期无症状阶段和可见症状阶段,为采后病害的精细化监测提供了概念验证。

Performance evaluation of machine learning models for multiclass classification of apple blue mold infection stages. (A) Accuracy distributions obtained from five-fold cross-validation for different models. (B) Overall classification performance on training, validation, and held-out test subsets eva
▲ Performance evaluation of machine learning models for multiclass classification of apple blue mold infection stages. (A) Accuracy distributions obtained from five-fold cross-validation for different models. (B) Overall classification performance on training, validation, and held-out test subsets eva

【数据】五折交叉验证高性能算法:SVM-RBF、CatBoost、随机森林、XGBoost、LightGBM;LightGBM测试集准确率:96.4%;宏平均AUC:0.995;各类AUC:D3 = 1.000、D2 = 0.993、对照 = 0.987;评估指标:准确率、加权F1、Kappa、MCC;分类类别:Control、D2、D3

3.5 LightGBM多分类模型的分类一致性与阶段特异性可解释性

为评估多分类模型的分类一致性和阶段特异性可解释性,对LightGBM模型进行了混淆矩阵分析和SHAP解释。在训练、验证和独立测试子集上的混淆矩阵显示,LightGBM模型在三个类别上均保持较高的分类一致性(图6A)。SHAP汇总图用于识别对D2类别判别贡献最大的特征(图6B),结果显示yeeN_1h、evgA_3h、dkgB_5h等启动子-时间特征在D2阶段判别中具有较高贡献。此外,SHAP分析还揭示了不同阶段之间特征贡献的差异,表明模型能够捕捉与感染阶段相关的特异性VOC响应模式(图6C)。这些结果进一步支持了全细胞生物传感器阵列结合可解释机器学习在苹果青霉病阶段判别中的可行性。

Classification consistency and stage-specific interpretability of the LightGBM multiclass model. (A) Confusion matrices of the LightGBM model on the training, validation, and held-out test subsets. (B) SHAP summary plot showing the top contributing features for discrimination of the D2 class. (C) SH
▲ Classification consistency and stage-specific interpretability of the LightGBM multiclass model. (A) Confusion matrices of the LightGBM model on the training, validation, and held-out test subsets. (B) SHAP summary plot showing the top contributing features for discrimination of the D2 class. (C) SH

【数据】分类类别:Control、D2、D3;D2高贡献特征:yeeN_1h、evgA_3h、dkgB_5h等;分析子集:训练、验证、独立测试;分析方法:混淆矩阵、SHAP汇总图、SHAP特征贡献分析

3.6 LightGBM多分类模型的局部可解释性

为评估模型对代表性样品的局部解释能力,对三个正确分类的D2样品和三个正确分类的D3样品进行了LIME解释(图7A-C为D2样品,图7D-F为D3样品)。绿色条表示对预测类别有正向贡献的特征,红色条表示负向贡献特征。LIME分析显示,不同样品之间对预测类别贡献最大的特征存在差异,但yeeN、evgA和dkgB等启动子相关特征在多个样品中反复出现,表明这些启动子-时间特征在阶段判别中具有稳定的贡献。这些局部解释结果与SHAP全局解释结果一致,进一步增强了模型的可信度和透明度。

Local interpretability of the LightGBM multiclass model for representative samples. (A-C) LIME explanations for three correctly classified D2 samples. (D-F) LIME explanations for three correctly classified D3 samples. Green bars indicate features contributing positively to the predicted class, while
▲ Local interpretability of the LightGBM multiclass model for representative samples. (A-C) LIME explanations for three correctly classified D2 samples. (D-F) LIME explanations for three correctly classified D3 samples. Green bars indicate features contributing positively to the predicted class, while

【数据】LIME分析样品数:6个(3个D2 + 3个D3);反复出现的特征:yeeN、evgA、dkgB相关启动子-时间特征;解释方法:LIME局部解释;颜色标识:绿色=正向贡献,红色=负向贡献

讨论与解读

本研究显示,将启动子驱动的全细胞生物传感器阵列与机器学习相结合,可在受控实验条件下支持苹果青霉病感染状态和感染阶段的非破坏性判别。在本数据集内,该框架区分了健康与感染样品,并进一步判别了对照、D2和D3类别,从而在容器水平提高了基于VOC的病害状态评估分辨率。在所评估的算法中,LightGBM在二分类和多分类任务中均表现出最强总体性能。与仅关注健康与感染分类的传统方法相比,本策略额外探索了阶段判别,可为受控实验条件下更精细的采后监测提供有用信息。这一能力具有现实意义,因为早期感染往往无症状,仅凭外观难以识别。总体而言,全细胞生物传感器衍生的VOC响应指纹与机器学习的结合支持了苹果青霉病动态病害状态判别的可行性,并为进一步验证提供了概念验证框架。

与先前报道的果实病害无损检测策略(包括电子鼻、成像方法等)相比,本研究的特色在于将工程化全细胞生物传感器作为VOC响应元件,把复杂的挥发性代谢信息转化为可标准化的生物发光信号,再通过可解释机器学习挖掘启动子-时间特征。SHAP和LIME的引入使模型不再只是黑箱,而能指出哪些启动子在哪个时间点的响应对判别最关键——例如yeeN_1h、evgA_3h、dkgB_5h等。这为后续理性设计更精简、更特异的传感器阵列提供了数据支撑。

编译者解读:该研究的方法学价值在于把合成生物学传感元件与机器学习分类器做了端到端整合,用96孔板级别的生物发光读出替代大型仪器,在容器尺度上完成了概念验证。局限也很明显:所有数据来自受控实验条件,容器级分组果实样品而非单果验证,独立生物学组仅46组,品种、贮藏条件和实际流通环境均未覆盖。从合成生物学应用角度看,下一步需要解决的是传感器阵列的长期稳定性、规模化制备一致性,以及在非受控仓储环境中的泛化能力。

参考来源

期刊:Food Control, 2026

DOI: 10.1016/j.foodcont.2026.112424

DOI: 10.1016/j.foodcont.2026.112424

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12