可见-近红外高光谱成像与机器学习联用实现椰枣糖浆快速无损评估

来源:Food Chem X | 编译:DNA Lab Space

Rapid and non-destructive estimation of chemical p
研究概览

导语

椰枣糖浆作为一种富含营养的天然甜味剂,其化学品质的实时监控对加工过程至关重要。传统湿化学检测方法存在耗时长、需样品前处理且破坏样本等局限。为解决这一瓶颈,研究人员将可见-近红外高光谱成像技术与多种机器学习回归模型相结合,开发了一种非接触、多指标同步预测新策略。该方法能够在数秒内获取糖浆的糖度、pH、水分及单糖组成等关键信息,为椰枣糖浆的在线质量控制和制造开辟了新途径。

研究背景

椰枣(*Phoenix dactylifera*)是中东和北非地区的重要经济作物,由其制成的椰枣糖浆富含葡萄糖、果糖、矿物质和酚类物质,广泛用作天然甜味剂和特色调味品。糖浆的化学性质,如总可溶性固形物(TSS)、含水量、pH值、糖分组成和颜色参数,直接决定了其感官品质、加工适性及货架稳定性。现行行业标准多依赖折光仪、酸碱滴定、高效液相色谱和卡尔·费休水分测定等手段,这些方法不可避免地对样品造成破坏,且操作复杂、反馈滞后,难以满足连续化生产对过程分析技术的需求。

近十年来,可见-近红外(VIS-NIR)光谱因含有丰富的C-H、O-H和N-H键振动倍频与合频信息,已成为食品品质快速检测的重要工具。然而,单点光谱只能反映局部区域的总体化学成分,无法提供空间分布信息。高光谱成像技术将光谱与数字成像融为一体,可同时获得样本每一像素点的连续光谱,既继承了传统光谱的无损、快速优势,又赋予了“化学成像”的能力,对揭示成分的空间异质性、鉴别局部污染或掺假具有独特价值。将其与化学计量学及机器学习算法结合,已经在蜂蜜、果汁、饮料等液态或半固态食品的真伪鉴别与成分预测中显示出巨大潜力。椰枣糖浆因黏度高、颜色深且成分复杂,其高光谱响应的模型构建尚处于起步阶段,亟需系统评估不同预处理策略和建模算法对关键化学指标的预测效能。

研究方法

研究人员从当地市场收集了涵盖不同批次、品种和加工工艺的椰枣糖浆样本共计120份,以充分体现商业样品的变异性。参考化学值的测定均采用标准方法:TSS使用数字阿贝折光仪在25 °C下测定,表示为°Brix;pH值通过校准后的pH计直接读取;水分活度用水分活度仪测量;葡萄糖、果糖和蔗糖含量则由高效液相色谱-示差折光检测器定量,结果以% (w/w)计。所有化学分析均重复三次取平均值,并保证样本温度一致。

高光谱图像采集使用推扫式可见-近红外高光谱成像系统,光谱范围覆盖400–1000 nm,光谱分辨率约2.8 nm,包含共212个波段。成像时,将约20 mL的椰枣糖浆均匀涂布于培养皿表面,防止气泡产生,并置于平移样品台上。光源为带稳压的卤素灯,通过采集多帧标准白板和盖上镜头盖的暗电流图像,依据公式计算出相对反射率图像,以消除暗电流和光源不均匀性的影响。每个样本获取全幅图像后,在图像中央划定50 × 50像素的矩形感兴趣区域,提取区域内所有像素的平均光谱,从而得到一条具有代表性的原始光谱曲线。

为了提升模型性能,研究比较了多种光谱预处理方法的单独及组合效果,包括Savitzky-Golay卷积平滑、一阶导数、标准正态变量变换(SNV)与多元散射校正(MSC)。极端的化学指标样本经主成分分析和Hotelling T²统计检验剔除以保证数据集合理性,最终将全部样本按3:1比例随机划分为校正集和预测集,确保两集合的化学值范围一致。

面对全波段高达数百维的光谱数据,降维与特征提取至关重要。研究采用竞争性自适应重加权抽样(CARS)和连续投影算法(SPA)两种策略筛选敏感波长。CARS通过自适应重加权采样结合指数衰减函数,舍弃回归系数绝对值较小的波长点,交互验证选出最低均方根误差对应的波长子集;SPA则通过投影运算寻找共线性最小的波长组合。最终,基于优选出的关键波长分别建立偏最小二乘回归(PLSR)、支持向量回归(SVR)和随机森林(RF)三种机器学习模型。PLSR通过潜在变量的正交分解建立光谱与浓度间关系;SVR引入径向基核函数处理非线性效应,并通过网格搜索优化惩罚系数与核参数;RF以多棵决策树集成的思想增强模型鲁棒性。所有模型均在相同的校正与预测集上训练评估,以校正决定系数R²c、预测决定系数R²p、校正均方根误差RMSEC和预测均方根误差RMSEP作为主要判据。

研究结果

原始光谱显示,椰枣糖浆在970 nm附近呈现显著的O-H吸收峰,在740–760 nm区域因C-H键相关倍频和糖类物质的内部分子振动产生较宽泛的吸收特征。经SNV-一阶导数组合预处理后,光谱的基线漂移基本消除,特征峰更加锐利,模型的信噪比明显提高。

对于TSS含量(平均为74.2 °Brix,范围67.3–80.1 °Brix),CARS筛选出包括960 nm、840 nm、750 nm等共18个敏感波长。基于这些波长建立的PLSR模型表现最优,其预测集R²p达到0.963,RMSEP仅为0.35 °Brix,预测偏差比超过5.2,表明模型具有出色的精确度和可重复性。相比之下,全波段PLSR模型的R²p为0.949,RMSEP为0.47 °Brix,特征波长选择显著降低了模型复杂度而未明显损失精度。

pH值(范围4.2–5.7)的预测则对非线性模型更为敏感。基于SPA选择的9个波长构建的SVR模型取得最佳效果,R²p为0.931,RMSEP为0.08,有效捕捉了有机酸与糖分协同作用导致的光谱细微非线性变化。RF模型对水分含量(范围22.4–30.5%)的预测结果略胜一筹,R²p达到0.918,RMSEP为0.44%;这可能归因于RF对输入异常值和无关变量的强容忍性,使来自不同品种的变异被有效整合进集成学习体系中。

在单糖组分的预测方面,果糖含量(平均36.8%)可采用PLSR和SVR均获得良好效果,R²p分别为0.912和0.903,而葡萄糖含量(平均34.2%)因与果糖光谱信息高度重叠,SVR通过核函数映射表现出更强的解析能力,R²p为0.898,RMSEP为0.67%。上述结果表明,可见-近红外敏感波段虽不能达到中红外光谱的指纹区精细度,但联合恰当的机器学习算法仍可解析椰枣糖浆中具有高度共线性的糖类大分子组成。进一步,利用最优模型将每个像素点的预测值映射回原图像,生成了糖度、pH等指标的化学分布图。图像清晰反映出搅拌不均导致的局部浓度差异,这在传统整体化学检测中完全无法识别,充分体现了高光谱化学成像的独特优势。

讨论与展望

该研究系统证实了可见-近红外高光谱成像与CARS/SPA变量选择、PLSR/SVR/RF多元校正相结合,能够实现椰枣糖浆多种化学指标的高精度、非破坏性同步预估。与传统取样化验相比,单次测量时间压缩至秒级,且无需任何试剂或前处理,极大地提升了检测通量和环境友好性。尤其对于高粘度和深色本底的样品,高光谱成像依然保持了良好的适应性和重复性,揭示了该技术在液态半固态特色食品领域大规模推广的可行性。

尽管结果令人振奋,仍有一些方面值得深化研究。首先,当前模型基于特定地域商业样品构建,当面对世界不同产区的椰枣品种和加工条件时,模型的迁移性和鲁棒性仍需验证;可通过全局更新或迁移学习算法来吸纳新的变异源,减少模型重校准成本。其次,选出的敏感波长集中在近红外短波区域,部分关键吸收可能被水和碳水化合物的强信号掩盖,未来可尝试扩展光谱范围至短波红外(1000–2500 nm),以获取更多分子指纹信息。再次,深度学习框架如卷积神经网络或Transformer有望从光谱-空间双重维度自动挖掘高阶特征,进一步提升多指标协同预测精度,并实现掺假鉴别与品质分级的多任务一体化。在硬件层面,有望基于筛选出的特征波长开发低成本、便携式多光谱成像仪,将其嵌入到生产管道或手持设备中,赋能椰枣产业的实时过程分析与反馈控制。

从更广的合成生物学与食品制造交叉视角看,此类快速无损的感知技术是“感知-决策-执行”闭环的关键节点。当高光谱传感器实时捕获原料和中间产物的化学指纹,结合云端部署的强大机器学习

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 基于染色质可及性的酿酒酵母基因表达水平多机器学习模型预测 09-12