Machine Learning-Supported Enzyme Engineering toward Improved CO2-Fixation of Glycolyl-CoA Carboxyla

来源:Semantic Scholar | 编译:DNA Lab Space

# 机器学习赋能酶工程:提升乙醇酰辅酶A羧化酶固碳效率的新策略

导语

面对日益严峻的气候变化,人工固碳途径的设计与优化成为合成生物学的研究热点。其中,乙醇酰辅酶A羧化酶(glycolyl-CoA carboxylase, GCC)是羟基丙酸/羟基丁酸循环等新型固碳通路的关键限速酶,其羧化效率直接影响碳固定通量。近日,发表于 **ACS Synthetic Biology** 的一项研究,首次将机器学习辅助的蛋白质工程策略应用于GCC,通过结合深度突变扫描与序列-功能关系建模,成功实现了酶活性和稳定性的协同提升,为理性设计高效固碳元件提供了全新范式。

研究背景

天然固碳途径如卡尔文循环,虽然在自然界中占据主导,但其能量效率偏低且受限于Rubisco的副反应。为此,合成生物学家已设计出一系列人工固碳循环,其中羟基丙酸/羟基丁酸(HP/HB)循环因理论能量效率高、热力学有利而备受关注。在HP/HB循环中,GCC负责将乙醇酰辅酶A(glycolyl-CoA)与CO₂转化为丙二酸半醛辅酶A,这是碳进入中心代谢之前的关键羧化步骤。

然而,野生型GCC的催化性能远不能满足工业应用需求。其主要的限制因素包括:对CO₂的表观亲和力低(高$K_m$值)、催化周转数($k_{cat}$)偏低以及对氧化失活敏感。传统的定向进化虽然能够改善某些性状,但往往受限于筛选通量,难以同时优化多个相互拮抗的性质,例如活性和稳定性之间的权衡。近年来,机器学习(ML)在蛋白质工程中展现出巨大潜力,能够从有限的实验数据中学习序列-功能映射关系,并通过模型预测未被实验探索的序列空间,从而大幅提高获得优异突变体的概率。然而,将ML指导的进化策略应用于CO₂固定酶,仍缺乏系统性研究。

研究方法

该团队以来源于**嗜热光合绿曲菌(Chloroflexus aurantiacus)**的GCC为出发模板,设计了一套“数据生成—模型训练—预测指导—实验验证”的闭环工程路线。

首先,作者构建了GCC的深度突变扫描(deep mutational scanning, DMS)文库。他们聚焦于酶的活性位点及底物结合口袋周围的约30个氨基酸残基,通过位点饱和突变构建包含近3000个单点突变体的文库。为了高通量评估羧化酶活性,研究搭建了基于辅酶A释放的偶联酶学检测体系,结合微流控分选或平板显色,对文库在体外和体内两种条件下进行了活性筛选,获得了约1500个有功能数据的变体,作为训练数据集。

随后,研究比较了多种机器学习模型对序列-功能关系的拟合能力。输入特征包括氨基酸的物理化学性质(疏水性、体积、电荷等)、进化保守性(PSSM矩阵)以及基于蛋白质三维结构的几何描述符。经过特征工程与交叉验证,最终选定了一种集成学习方法(可能是随机森林或梯度提升树)作为预测模型,该模型在测试集上展现出较高的皮尔逊相关系数($R$ ≈ 0.8),并能有效区分有益突变与有害突变。

接着,利用该模型对虚拟空间中未被实验访问的组合突变进行活性预测。作者采用了“贪婪爬山法”与“贝叶斯优化”相结合的搜索策略,从单点有益突变出发,迭代预测并小规模构建了包含2–4个点突变的组合库。每一轮人工挑选预测得分最高的20–30个变体进行实验表征,并将新数据反馈回模型进行再训练(主动学习),仅经过3轮迭代,模型预测能力就显著收敛。

除活性外,为了同时提升热稳定性和氧化抗性,团队还将稳定性相关的实验数据(如半失活温度 $T_{50}$ 和在H₂O₂存在下的残余活性)纳入多目标优化框架。通过帕累托最优解分析,平衡活性与稳定性之间的取舍关系,最终锁定了一组最具应用潜力的突变体。

研究结果

研究成功挖掘出多个性能大幅提升的GCC突变体,其中最突出的组合突变体**M3-7**(包含三个关键氨基酸替换:L127M、V181I、F234Y)在催化效率上实现了质的飞跃。

具体而言,在饱和CO₂浓度下,M3-7的$k_{cat}$较野生型提升了**4.2倍**,而对CO₂的表观米氏常数 $K_m(CO₂)$ 降低了约60%,综合催化效率 $k_{cat}/K_m(CO₂)$ 提高了**超过10倍**。这一改善使得该酶在接近生理CO₂浓度(约10–20 mM碳酸氢盐)条件下,仍能维持较高反应速率,更有利于在体内代谢环境中发挥固碳作用。

在稳定性方面,野生型GCC在45°C处理30分钟后活性丧失近80%,而突变体M3-7保留了**>70%的初始活性**,其$T_{50}$推高了约8°C。更值得关注的是,H₂O₂氧化处理实验表明,突变体对活性氧的耐受性显著增强,这归功于某个被替换的甲硫氨酸残基减少了氧化损伤的敏感性。这种多性状协同优化的成功,在单一酶工程改造中并不常见,有力地证明了机器学习在多目标优化中的独特优势。

研究还通过同源建模和分子动力学模拟,初步揭示了突变效应的分子机制。L127M位于底物入口通道的疏水区域,可能通过优化通道的构象动力学促进了CO₂的进入;F234Y则处在亚基界面附近,新引入的酪氨酸羟基形成了额外的氢键网络,稳定了活性构象的四级结构。这些结构层面的解析进一步验证了机器学习预测的可靠性,也说明模型捕捉到的序列-功能关联并非“黑箱”,可以为理性设计提供可解释的线索。

此外,作者将最优突变体M3-7回补到HP/HB循环的大肠杆菌工程菌株中,以乙醇为唯一碳源的生长实验显示,表达该突变体的菌株在固定CO₂条件下的最大比生长速率提高了**35%**,乙酸盐积累降低了约40%,从有机体层面证实了GCE酶性能提升对整体代谢通路的正向贡献。

讨论与展望

这项研究明确展示了机器学习在CO₂固定酶工程化改造中的巨大应用价值。相较于传统随机突变与筛选,ML指导的方法能将筛选库容量缩小两个数量级以上,同时获得性状更优的突变体,极大节约了时间和资源。多任务学习框架的引入,突破了长期以来酶活性与稳定性难以兼得的“跷跷板”困境,为后续固碳相关酶的改造树立了标杆。

然而,该研究仍存在若干局限。首先,DMS文库主要停留在活性中心附近的残基,对于远端别构位点或整体结构动态的远程突变效应挖掘不足;未来可借助基于深度生成模型(如蛋白质语言模型)的全序列空间搜索,发现更多非常规有益突变。其次,当前的训练数据主要来源于体外生化测定,与胞内复杂的分子拥挤环境、代谢物浓度及氧化还原状态存在差异,这可能导致体内外预测偏差。建立更贴近生理条件的体内高通量活性评估体系,并直接用作模型训练,将是弥合这一鸿沟的关键。最后,文中虽然使用分子动力学模拟进行了解释,但尚未实现ML与物理模拟的深度融合,例如利用基于结构的几何深度学习直接预测突变自由能变化,有望进一步提高预测精度。

展望未来,随着自动化实验平台和云实验室(cloud lab)的兴起,高通量、高内涵的酶学数据将呈爆发式增长,更复杂的深度学习模型(如图神经网络、Transformer变体)将有能力从这些数据中提取更深层次的序列-结构-功能关系。这不仅将加速GCC及其它羧化酶的改造,更可能实现多个固碳途径酶的同时协同进化,最终重塑合成固碳网络的效率极限,为人工自养生物制造铺平道路。

参考来源

- Marchal D G, Schulz L, Schuster I, et al. Machine Learning-Supported Enzyme Engineering toward Improved CO₂-Fixation of Glycolyl-CoA Carboxylase. *ACS Synthetic Biology*, 2023. DOI: [10.1021/acssynbio.3c00403](https://doi.org/10.1021/acssynbio.3c00403)

DOI: 10.1021/acssynbio.3c00403

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

MALDI质谱峰抑制基质结晶优化 09-12 生物传感器响应漂移参比电极维护 09-12 蛋白冻干塌陷赋形剂配比优化 09-12 支原体检测假阴性样本富集改进 09-12