来源:Artificial intelligence-guided engineering of a thermostable cellulase cocktail enables efficient biomass hydrolysis at elevated temperatures(Bioresource Technology)| 编译:DNA Lab Space | 原文许可:elsevier-subscription
导读
木质纤维素生物质的高温高效转化长期受限于商业纤维素酶的热不稳定性,以及缺乏具有协同效应的系统级耐热复合酶体系。本研究构建了由内切葡聚糖酶TpEG、纤维二糖水解酶HmCel6A和β-葡萄糖苷酶TnBglB组成的耐热纤维素酶复合体系,并借助人工智能框架进行精准组分优化:通过VenusMine管道挖掘出超耐热内切葡聚糖酶EG5,经PRIME模型改造HmCel6A获得活性提升1.8倍的S347P变体。在90 °C下,工程化复合体系的滤纸水解活性约为商业酶CTec3的七倍,并从玉米秸秆中释放出显著更多的葡萄糖。
研究背景
木质纤维素生物质是地球上最丰富的可再生碳资源,被视为可持续生物燃料和生物化学品生产的重要原料。其组成主要包括纤维素(约占植物生物质的35–50%)、半纤维素(20–35%)和木质素(10–25%)。高效降解需要多类酶的协同作用——纤维素酶负责纤维素水解,半纤维素酶和酯酶参与半纤维素降解,漆酶等木质素修饰酶以及裂解性多糖单加氧酶(LPMOs)等辅助氧化酶也参与其中。纤维素转化依赖纤维素酶系,通常由内切葡聚糖酶(EGs)、纤维二糖水解酶(CBHs)和β-葡萄糖苷酶(BGLs)组成协同体系,催化纤维素中β-1,4-糖苷键的水解。商业纤维素酶制剂已广泛应用于洗涤剂、第二代生物乙醇生产和纺织加工等领域。然而,许多工业应用涉及高温条件,对纤维素酶体系的热稳定性和催化性能构成挑战。目前可用的商业纤维素酶在高温下往往难以维持足够的活性与稳定性,这限制了其在工业规模高温糖化过程中的应用。
研究方法
2.1 材料
Cellic® CTec3(Novonesis,丹麦)用作商业纤维素酶制剂。稀释后的CTec3制剂蛋白浓度为17.4 g L⁻¹,滤纸活性为15.5 FPU mL⁻¹。Whatman No. 1滤纸(90 mm,Cytiva)和碱预处理玉米秸秆用作底物。玉米秸秆采用0.25 mol L⁻¹ NaOH在60 °C处理1 h(固液比1:10,w/v),随后洗涤并干燥备用。
【数据】试剂:Cellic® CTec3;蛋白浓度:17.4 g L⁻¹;滤纸活性:15.5 FPU mL⁻¹;底物:Whatman No. 1滤纸(90 mm);预处理试剂:0.25 mol L⁻¹ NaOH;预处理温度:60 °C;预处理时间:1 h;固液比:1:10(w/v)
2.2 碱预处理玉米秸秆的组分分析
碱预处理玉米秸秆的主要碳水化合物组分采用两步酸水解法分析(Sluiter et al., 2010)。水解产物通过高效液相色谱(HPLC)分析,使用Aminex HPX-87H色谱柱,柱温维持在60 °C,以2.5 mM H₂SO₄为流动相,流速0.6 mL min⁻¹。葡萄糖作为纤维素衍生的主要单糖进行定量,转化为相应的脱水糖形式后用于估算葡聚糖含量。由于木糖、甘露糖和半乳糖在HPX-87H柱上无法完全分离,主要半纤维素衍生糖峰以木糖当量进行定量,此处理方式与禾本科木质纤维素水解产物的先前报道一致(Garlock et al., 2011; 图5A)。因此,葡萄糖和木糖当量糖分别用于估算纤维素衍生的葡聚糖和富含木聚糖的半纤维素糖含量。该处理方式与玉米秸秆半纤维素的富木聚糖组成一致(Cheng et al., 2017)。
【数据】色谱柱:Aminex HPX-87H;柱温:60 °C;流动相:2.5 mM H₂SO₄;流速:0.6 mL min⁻¹;定量方式:葡萄糖为纤维素衍生主要单糖,木糖当量表示半纤维素衍生糖
2.3 基因合成与质粒构建
所有基因均经过密码子优化、合成(生工生物,中国),并克隆至pET-28a (+)载体中,用于在大肠杆菌中进行异源表达。蛋白序列见补充材料。
【数据】载体:pET-28a (+);表达宿主:大肠杆菌;基因合成商:生工生物(中国);原文未详述密码子优化具体参数
2.4 蛋白表达与纯化
重组蛋白在大肠杆菌Shuffle T7 Express细胞中表达,并通过Ni-NTA亲和层析纯化。
【数据】表达菌株:E. coli Shuffle T7 Express;纯化方法:Ni-NTA亲和层析;原文未详述培养温度、诱导剂浓度及纯化缓冲液具体参数
2.5 差示扫描荧光法(DSF)
蛋白熔解温度(Tm)通过DSF使用SYPRO Orange染料测定。测量在LightCycler 480 Instrument II(Roche,美国)上进行,温度梯度为35至99 °C。Tm值由荧光跃迁曲线计算得出。
【数据】仪器:LightCycler 480 Instrument II(Roche,美国);染料:SYPRO Orange;温度范围:35–99 °C;原文未详述升温速率及蛋白浓度
2.6 酶活性测定
内切葡聚糖酶活性及野生型HmCel6A及其变体的表观水解活性采用3,5-二硝基水杨酸(DNS)法测定,以羧甲基纤维素钠(CMC-Na)为底物,在80 °C下进行。β-葡萄糖苷酶(BGL)活性使用对硝基苯基-β-D-吡喃葡萄糖苷(pNPG)测定(Zhang et al., 2017)。还原糖和对硝基苯酚的释放通过分光光度法使用适当的标准曲线定量。所有测定均设三个平行。
【数据】方法:DNS法;底物:CMC-Na(内切葡聚糖酶)、pNPG(BGL);温度:80 °C;平行数:3;原文未详述缓冲液组成、pH及反应时间
2.7 野生型耐热纤维素酶复合体系的构建
从文献中收集了一组先前报道的纤维素酶,涵盖EG、CBH和BGL活性。候选酶经表达、纯化后评估其热稳定性和高温催化活性。基于这些结果,选择TpEG、HmCel6A和TnBglB分别作为EG、CBH和BGL组分,构建野生型耐热纤维素酶复合体系,随后用于协同水解和比例优化。
【数据】复合体系组分:TpEG(EG)、HmCel6A(CBH)、TnBglB(BGL);筛选依据:热稳定性和高温催化活性
2.8 耐热纤维素酶复合体系的评价与优化
TpEG、HmCel6A和TnBglB的协同水解在1 mL 50 mM磷酸缓冲液(pH 7.5)中使用10 mg Whatman No. 1滤纸进行,温度80 °C,固定总蛋白加载量100 μg。比较单酶、双酶和三酶体系,还原糖释放采用DNS法定量。协同度(DS)按先前报道方法(Henrissat et al., 1985)基于各单酶及其组合的糖产量计算。在80 °C、固定总蛋白加载量条件下,通过滤纸水解进一步优化酶比例。评估不同的EG:CBH:BGL比例,选择还原糖释放最高的比例用于后续实验。
【数据】底物:10 mg Whatman No. 1滤纸;缓冲液:1 mL 50 mM磷酸缓冲液(pH 7.5);温度:80 °C;总蛋白加载量:100 μg;评估比例:不同EG:CBH:BGL比;原文未详述具体评估的比例值
2.9 人工智能引导的耐热内切葡聚糖酶挖掘
使用VenusMine管道鉴定耐热内切葡聚糖酶(EGs),该管道整合了基于结构的同源搜索与蛋白语言模型(PLM)引导的聚类和评分。以TpEG为查询序列检索同源物,随后进行序列扩展和冗余减少以构建候选文库。序列使用ProstT5进行嵌入,基于潜在表示进行聚类,选择富集EG活性的簇。候选序列进一步通过热稳定性预测(PRIME)和进化适应度评分(ESM-1b)进行优先级排序,随后进行结构过滤。排名靠前的酶进行实验验证。
【数据】管道:VenusMine;查询序列:TpEG;嵌入模型:ProstT5;热稳定性预测:PRIME;适应度评分:ESM-1b;原文未详述聚类阈值及候选序列数量
2.10 挖掘获得的内切葡聚糖酶的生化表征
在标准测定条件下测定挖掘获得酶的生化特性,包括pH和温度曲线、热稳定性、对金属离子和有机溶剂的耐受性、底物特异性及动力学参数。
【数据】表征指标:pH曲线、温度曲线、热稳定性、金属离子耐受性、有机溶剂耐受性、底物特异性、动力学参数;原文未详述具体测定条件
2.11 人工智能引导的CBH HmCel6A工程化改造
使用蛋白语言模型PRIME通过两轮迭代策略对HmCel6A进行功能优化。第一轮中,基于UniRef90同源序列进行域自适应微调,以实现突变扫描和候选选择。第二轮中,采用少样本主动学习框架结合元学习(Zhou et al., 2024)整合实验数据,辅以ProteinGym和GEMME数据集衍生的辅助任务。选择排名靠前的变体进行实验验证。
【数据】模型:PRIME;策略:两轮迭代;第一轮:UniRef90域自适应微调;第二轮:少样本主动学习+元学习;辅助数据集:ProteinGym、GEMME;原文未详述突变位点数量及筛选阈值
2.12 分子动力学模拟
进行分子动力学(MD)模拟以研究TpEG和EG5、HmCel6A和HmCel6A-S347P变体的结构稳定性和动态行为。初始蛋白结构使用AlphaFold3预测(Abramson et al., 2024),S347P突变基于野生型模型引入。MD模拟使用GROMACS 2025.1(Abraham et al., 2015)在周期性边界条件下显式溶剂中进行。经过标准能量最小化和平衡程序后,在353.15 K、NPT条件下进行500 ns的生产模拟。
【数据】结构预测:AlphaFold3;模拟软件:GROMACS 2025.1;系综:NPT;温度:353.15 K;模拟时长:500 ns;溶剂:显式溶剂;边界条件:周期性边界
2.13 CTec3、野生型耐热复合体系和工程化耐热复合体系的高温水解性能
CTec3、野生型复合体系和工程化复合体系的水解性能使用Whatman No.1滤纸(90 mm,约0.55 g)和2%碱预处理玉米秸秆(w/v)在20 mL 50 mM磷酸钠缓冲液(pH 7.5)中评估。野生型和工程化复合体系以EG:CBH:BGL比例2:6:2施加,总蛋白加载量为每反应10 mg,CTec3使用等量加载。滤纸水解监测长达72 h。对于碱预处理玉米秸秆,还原糖释放通过DNS法在24 h后定量(Miller, 1959; Ghose, 1987)。在选定的玉米秸秆水解产物中,90 °C下72 h后的葡萄糖释放通过HPLC按2.2节所述进一步定量。所有实验均设三个平行。
【数据】底物:Whatman No.1滤纸(90 mm,约0.55 g)、2%碱预处理玉米秸秆(w/v);缓冲液:20 mL 50 mM磷酸钠缓冲液(pH 7.5);酶比例:EG:CBH:BGL = 2:6:2;总蛋白加载量:10 mg/反应;水解时间:滤纸72 h,玉米秸秆还原糖24 h、葡萄糖72 h;温度:90 °C(葡萄糖定量);平行数:3
2.14 工程化耐热酶补充CTec3用于高温生物质水解
通过将EG5和HmCel6A-S347P添加至CTec3中,评估工程化酶的补充效果,用于碱预处理玉米秸秆(2% w/v)在50 mM磷酸钠缓冲液(pH 7.5)中的水解。CTec3每反应使用1 mg,EG5和HmCel6A-S347P在适用时各添加1 mg。反应在80 °C下进行72 h,还原糖使用DNS法定量。所有实验均设三个平行。
【数据】底物:2%碱预处理玉米秸秆(w/v);缓冲液:50 mM磷酸钠缓冲液(pH 7.5);CTec3用量:1 mg/反应;EG5和HmCel6A-S347P用量:各1 mg;温度:80 °C;时间:72 h;平行数:3
研究结果
3.1 耐热纤维素酶的选择用于构建野生型耐热纤维素酶复合体系
为建立适用于高温生物质转化的耐热纤维素酶体系,从文献中收集了一组来自嗜热或中度嗜热生物的先前报道的纤维素酶,汇总于补充表S3。这些酶涵盖了高效纤维素水解所需的三大功能组分,包括EGs、CBHs和BGLs。为系统比较其热稳定性,在相同条件下通过DSF测定了这些酶的熔解温度(Tm)。所测纤维素酶的Tm表现出明显差异,从而能够为每种催化角色选择合适候选酶(图1A)。在评估的酶中,来自Thermotoga petrophila的TpEG表现出最高的熔解温度。其实际Tm可能已超出仪器测量范围的上限,进一步支持其卓越的热稳定性。对于CBH组分,HmCel6A和Clocl_4158表现出可比的热稳定性。然而,Clocl_4158在纯化过程中倾向于沉淀,限制了其用于后续复合体系构建的适用性。因此选择HmCel6A作为CBH组分,因为它兼具高热稳定性和更好的实际适用性。在BGLs中,TnBglB和Dturβglu表现出可比的熔解温度,但TnBglB在高温下表现出更高的催化活性,因此被选为纤维素酶复合体系的BGL组分。

【数据】筛选方法:DSF测定Tm;最高Tm酶:TpEG(Thermotoga petrophila),可能超出仪器测量上限;CBH候选:HmCel6A和Clocl_4158热稳定性可比,Clocl_4158纯化时沉淀;BGL候选:TnBglB和Dturβglu Tm可比,TnBglB高温催化活性更高;最终选择:TpEG(EG)、HmCel6A(CBH)、TnBglB(BGL)
3.2 TpEG、HmCel6A和TnBglB之间的协同相互作用
为评估所选耐热纤维素酶在高温纤维素水解中是否能协同作用,在80 °C下使用Whatman No. 1滤纸为底物、DNS法、相同总蛋白加载量(100 μg)比较了单酶、双酶和三酶体系。酶以等比例组合以消除剂量偏差。TpEG和HmCel6A在高温条件下单独均表现出可测量的纤维素水解活性(图1B)。当酶组合使用时,观察到还原糖释放的显著增强。特别是,由TpEG和HmCel6A组成的双酶体系表现出远高于任一单酶的水解活性,表明EG和CBH在纤维素解聚过程中存在强协同相互作用。DS的定量分析证实了这一观察结果,TpEG + HmCel6A组合的DS值为3.56 ± 0.84。重要的是,当引入TnBglB形成三酶混合物(TpEG + HmCel6A + TnBglB)时,计算的DS值达到5.13 ± 1.29,高于双酶TpEG-HmCel6A体系,表明三种纤维素酶组分之间存在增强的协同效应。这些结果表明,所选的耐热EG、CBH和BGL能在高温条件下协同作用。因此,三酶体系(TpEG + HmCel6A + TnBglB)被选为野生型耐热纤维素酶复合体系用于后续水解实验。
【数据】温度:80 °C;底物:Whatman No. 1滤纸;总蛋白加载量:100 μg;酶比例:等比例;DS值(TpEG + HmCel6A):3.56 ± 0.84;DS值(TpEG + HmCel6A + TnBglB):5.13 ± 1.29;单酶活性:TpEG和HmCel6A均有可测量活性
3.3 EG:CBH:BGL比例的优化以实现持续水解
为进一步优化耐热纤维素酶复合体系的水解性能,在80 °C下使用Whatman No. 1滤纸为底物,评估了四种EG:CBH:BGL比例(3:5:2、2:6:2、2:5:3和4:4:2),水解时间长达72 h(图1C–E)。在纤维素酶介导的水解中,EG和CBH主要负责将不溶性纤维素解聚为可溶性还原糖和纤维寡糖,而BGL在下游通过水解可溶性β-葡萄糖苷发挥作用。基于EG–CBH模块在初始协同测定中的显著贡献,选择了四种EG:CBH比例用于三酶复合体系优化。这些比例在系统中保持BGL的同时调整EG和CBH的相对比例,从而评估不同组分平衡对水解性能的影响。DNS法用于比较不同比例在80 °C连续水解过程中的总还原糖释放和整体水解性能。该测定提供了纤维素解聚的总体指标,尽管不能区分单个可溶性糖产物。在四种测试配方中,2:6:2比例在72 h水解期间一致表现出最高的还原糖释放,其次是3:5:2和4:4:2比例,而2:5:3比例表现出最低活性。这一趋势可能与CBHs在持续纤维素解聚中的重要作用有关,特别是在结晶纤维素上,CBH相关的动力学步骤可强烈影响整体水解速率(Christensen et al., 2018)。因此,选择EG:CBH:BGL比例2:6:2用于后续应用实验。
【数据】温度:80 °C;底物:Whatman No. 1滤纸;水解时间:72 h;评估比例:3:5:2、2:6:2、2:5:3、4:4:2;最高还原糖释放比例:2:6:2;活性排序:2:6:2 > 3:5:2 ≈ 4:4:2 > 2:5:3
3.4 使用VenusMine发现耐热内切葡聚糖酶
在建立野生型耐热纤维素酶复合体系后,对EG组分进行优化以进一步提升复合体系性能。作为负责启动纤维素解聚并为协同水解产生新链末端的酶,内切葡聚糖酶是整体复合体系效率的关键决定因素(Lynd et al., 2002)。首先,以AlphaFold预测的TpEG结构为查询,通过Foldseek对多个蛋白结构数据库搜索,鉴定了超过1000个高置信度结构同源物。这些结构同源序列随后作为种子,对NCBI NR数据库进行迭代MMseqs2搜索,将候选序列空间扩展至数十万条序列。为在保留序列多样性的同时减少计算冗余,扩展序列集以50%序列一致性阈值进行聚类,产生了一个紧凑的代表性集合,保留了同源序列空间的拓扑特征。为解析这一大型候选文库的功能景观,代表性序列使用ProstT5模型嵌入高维空间,随后构建层次聚类树(图2B)。所得树揭示了序列空间清晰的模块化组织,不同分支对应显著的结构和功能异质性。通过将已知EGs(EC 3.2.1.4)和实验验证序列映射到树上,发现功能表征序列在特定分支中强烈富集,表明这些簇含有EG活性酶的概率较高。这一观察得到嵌入空间t-SNE可视化的进一步支持,二维空间中显示出多个良好分离的簇。注释序列显示出清晰的空间富集模式,与层次聚类树中识别的富集区域一致。这些结果表明,PLM衍生的表示空间能够捕获深层进化和结构特征,并以无监督方式自然地将功能相关序列分组,从而为候选优先级排序提供可靠基础。基于注释序列的富集,最终选择簇1、2、3、5、12、14、15和23作为核心优先簇。对于这些优先簇内的序列,进一步应用基于双PLM的评估策略进行计算筛选。PRIME模型用于预测候选序列的热稳定性(Tm),而ESM-1b衍生的伪对数似然评分用于评估进化合理性和序列适应度。基于综合评分,选择排名前1000的候选序列进行结构验证。其三维结构……

【数据】查询结构:AlphaFold预测的TpEG;结构同源物:>1000个;序列扩展:数十万条;聚类阈值:50%序列一致性;嵌入模型:ProstT5;优先簇:1、2、3、5、12、14、15、23;热稳定性预测:PRIME;适应度评分:ESM-1b;结构验证候选:排名前1000
3.5 工程化HmCel6A变体的筛选与表征
(注:原文结果部分节选至此结束,后续结果内容未在提供的原文中出现。)
【数据】原文未详述
讨论与解读
先前研究表明,单个纤维素酶的补充或工程化改造可改善生物质水解(Qiao et al., 2023; Tiwari et al., 2017),但能够在80 °C以上高效运行的耐热纤维素酶复合体系的开发仍然有限。本研究通过理性选择、人工智能辅助酶挖掘和蛋白质工程建立并优化了耐热纤维素酶复合体系。这些发现共同强调了整合酶发现、定向工程化和复合体系级优化在开发用于高温生物质转化的稳健耐热纤维素酶系统中的重要性。与依赖可培养嗜热菌的传统策略相比,人工智能引导的蛋白挖掘通过利用从大规模未标记蛋白序列中学习进化、结构和功能信息的PLMs,能够探索更广阔的序列空间(Rives et al., 2021)。这种扩展的搜索空间促进了耐热酶的发现(Jiang et al., 2024; Reeves and Kalyaanamoorthy, 2024)。本研究中,VenusMine管道从大规模蛋白序列资源中鉴定并实验验证了多个候选内切葡聚糖酶,凸显了PLM引导挖掘在酶发现中的实用价值。特别是EG5的鉴定支持了该策略的实用性。
编译者解读:该研究展示了一条清晰的"理性筛选—AI挖掘—定向进化—系统优化"技术路线,其核心价值在于将蛋白语言模型从单纯的序列分析工具推进为可指导复合酶体系设计的工程平台。VenusMine管道通过结构同源搜索与PLM聚类相结合,在数十万序列空间中高效锁定耐热EG候选,而PRIME引导的HmCel6A两轮工程化则证明少样本主动学习可在有限实验数据下实现1.8倍活性提升。值得注意的是,该研究并未止步于单酶性能优化,而是将复合体系比例优化(2:6:2)与高温协同效应(DS值5.13)纳入统一框架,这种系统级思维对工业酶制剂开发具有直接参考意义。局限在于,工程化酶对CTec3的补充效果仅在有限条件下评估,且EG5的生化表征细节及S347P变体的分子机制阐释在节选中尚不完整,其工业放大潜力仍需更多工艺验证。
参考来源
期刊:Bioresource Technology, 2026
DOI: 10.1016/j.biortech.2026.135430
DOI: 10.1016/j.biortech.2026.135430