来源:Semantic Scholar | 编译:DNA Lab Space
**导语**
酶作为绿色生物催化的核心元件,其性能改造一直是合成生物学与生物制造的关键瓶颈。近期,吕菲菲等人在《Biotechnology Advances》发表综述,系统梳理了酶工程从传统定向进化、理性设计向计算驱动范式转变的完整轨迹。该文不仅将机器学习和深度学习在酶改造中的应用归纳为“计算酶工程”新阶段,更前瞻性地提出“自驱动实验室”与生成式计算深度融合的终极愿景。本文基于该综述,深度解读这一演进过程的技术脉络、突破性成果与未来挑战。
研究背景
生物催化凭借其高选择性、温和反应条件和环境友好等优势,已成为医药、精细化工、食品和生物能源等领域绿色制造的核心技术。然而,天然酶往往难以满足工业场景对活性、稳定性、底物谱及立体选择性的严苛要求,酶的改造因此成为蛋白质工程领域永恒的主题。过去三十年,酶工程经历了以定点突变和理性设计为代表的知识驱动阶段,以及以易错PCR和DNA改组为代表的随机突变与高通量筛选相结合的定向进化阶段。定向进化策略虽然取得了巨大成功(其开创者Frances Arnold于2018年获得诺贝尔化学奖),但仍然面临着文库庞大、筛选通量受限、序列空间探索效率低下等本质困难。一个由200个氨基酸组成的蛋白质,其理论序列空间高达$20^{200}$,远超宇宙原子总数,随机突变策略犹如盲人摸象。
与此同时,计算技术在过去十年实现了跨越式发展。以深度学习为代表的数据驱动方法,在蛋白质结构预测(如AlphaFold2)、蛋白质设计(如ProteinMPNN)等领域接连取得革命性突破,彻底改变了人们对蛋白质序列 - 结构 - 功能关系的认知模式。酶工程作为一种典型的序列 - 功能映射问题,天然适合作为计算算法的应用场景。正是在这一背景下,传统的酶工程范式开始加速向“计算酶工程”演进。吕菲菲等人的综述恰逢其时地捕捉了这一历史性转折,对从传统策略到计算驱动策略的技术谱系进行了全景式剖析,为该领域勾勒出一个清晰的概念框架。
研究方法
这篇综述并非报道一项独立的实验研究成果,而是系统性地构建了计算酶工程的方法论谱系。作者团队从技术演进的内在逻辑出发,将酶工程策略划分为五个递进层次。
第一层次为**传统理性设计与半理性设计**。理性设计依赖对酶结构 - 功能关系的深刻理解,通过定点突变精准改造活性中心或底物结合口袋内的关键残基。半理性设计则基于结构或同源序列比对,构建小而精的突变文库(如CASTing/ISM策略),在有限筛选压力下实现多残基协同优化。
第二层次为**定向进化与高通量筛选**。作者梳理了易错PCR、DNA改组等随机诱变方法,以及基于微流控、荧光激活细胞分选的高通量筛选平台。该部分着重讨论了文库多样性与筛选通量之间的根本矛盾,以及近年来涌现的超高通量筛选技术(如基于微液滴的荧光激活筛选)对缓解这一矛盾的贡献。
第三层次为**机器学习辅助的序列 - 功能映射**。这是计算酶工程的开端。作者系统介绍了多种机器学习模型——从偏最小二乘回归、支持向量机到高斯过程回归——如何在有限的实验数据上建立起酶序列与功能特性之间的统计代理模型。关键步骤包括:蛋白质序列的特征表示(如one-hot编码、AAindex理化性质、进化信息PSSM等),模型训练与验证,以及基于模型预测引导的迭代进化。综述特别强调了不确定性量化在指导下一轮实验设计中的重要性,贝叶斯优化因此成为连接计算预测与湿实验验证的桥梁。
第四层次为**深度学习驱动的表征学习与预测**。当训练数据量突破瓶颈,深度神经网络开始展现巨大威力。作者深入分析了卷积神经网络、图神经网络和Transformer架构在酶性质预测中的优势。图神经网络将酶结构表示为原子或残基级别的图,通过消息传递机制捕获空间邻接关系,尤其适用于活性中心和别构效应的建模。基于Transformer的蛋白质语言模型(如ESM、ProtBERT)则能够从数十亿条天然蛋白质序列中无监督地学习到蕴涵结构、功能和进化语义的深层特征表示,极大提升了小样本条件下的预测性能。
第五层次为**生成式计算与全新酶设计**。这是计算酶工程的最前沿。综述详细介绍了三种主流生成模型框架:变分自编码器(VAE)通过潜在空间插值与优化生成具有特定性质倾向的新序列;生成对抗网络(GAN)通过生成器与判别器的对抗训练,提升生成序列的逼真度;扩散模型作为最新兴起的范式,通过逐步去噪过程生成高度可调的蛋白质序列与结构。此外,基于结构约束的固定骨架设计(如ProteinMPNN)和从零设计的hallucination方法也被纳入讨论。作者还勾勒出“设计 - 构建 - 测试 - 学习”全闭环的自驱动实验室概念,将计算生成设计、自动化基因合成、无细胞表达系统与高通量表征平台融为一体,实现零人工干预的酶定向进化。
研究结果
通过跨尺度的系统比较,该综述揭示了一系列标志性的演进规律与核心发现。
**其一,设计策略从“依赖知识”迈向“数据驱动”。** 传统理性设计受限于结构解析的瓶颈和对催化机理的深度依赖,而机器学习和深度学习方法能够从日益增长的蛋白质序列与功能数据库中自动提取关键特征,大幅降低对先验知识的门槛。例如,蛋白质语言模型仅利用序列信息便可预测突变体的热稳定性与催化活性,其预测能力已在多个酶家族中得到实验验证。
**其二,序列空间的探索效率实现了跨越式提升。** 传统定向进化需要构建$10^5$–$10^7$的突变库并借助强大筛选压力才有可能发现有益突变,而计算引导的迭代进化通常仅需数十到数百个变体就能锁定性能显著提升的优势突变体。多项案例研究表明,基于高斯过程回归和贝叶斯优化的策略,经过3–5轮迭代即可将酶活性提高数十倍,筛选效率相比传统随机突变提高了2–3个数量级。深度生成模型的应用更将探索范围从“单点或几点突变”扩展到“全局序列重设计”。一篇纳入综述分析的案例中,研究者利用VAE对卤代烷脱卤酶的序列空间进行全局优化,成功获得了与野生型序列同一性低于70%但催化活性提升5倍以上的全新变体。
**其三,三维结构信息与无监督语言表征的融合成为性能突破的关键。** 综述对比了单纯基于序列的模型与引入结构约束的模型。结果表明,在底物选择性和立体选择性等需要精确结构认知的任务中,图神经网络和几何深度学习模型显著优于仅依赖序列的模型。而将蛋白质语言模型提取的进化信息作为特征输入结构预测网络,则实现了对远端突变效应的更准确捕捉,部分解释了多位点协同突变的非叠加性效应。
**其四,生成式计算初步展现出“从无到有”的新酶创造能力。** 传统酶工程受限于天然骨架,只能在已有结构旁边进行局部改造。扩散模型和基于结构的hallucination方法则跳出了这一窠臼。综述展示了一项标志性工作:利用扩散模型从零生成了功能可比的荧光素酶变体,其核心骨架与任何天然结构均存在显著差异。虽然这些新酶的催化效率目前还无法与天然进化数亿年的酶相媲美,但其展现的全新折叠与功能组合为开发非天然生化反应打开了大门。
**其五,自驱动实验室闭环验证的初步实现,确立了通往“无人酶工程”的可行性。** 综述介绍了几套集成系统,将设计、自动化液体处理、高通量检测和实时数据反馈整合为一个自动迭代循环。这些系统在针对酯酶和转氨酶的改造实验中,成功在数周内实现了需数人年人工劳动的进化成果,并且整个过程无需人工干预,仅靠算法自主决策序列优化方向。
讨论与展望
尽管计算酶工程取得了一系列激动人心的成果,但吕菲菲等在综述中也清醒地指出了当前面临的瓶颈与未来发展方向。
**数据稀缺与偏差问题亟待解决。** 目前公开可用的蛋白质功能数据集规模远小于自然语言和图像领域,且存在严重的同源偏差和实验条件异质性。这使得监督学习模型容易过拟合,泛化能力不足。未来需要构建标准化、大规模、多属性标注的酶功能数据库,并结合主动学习和少样本学习技术,最大限度发挥有限数据的价值。
**复杂催化功能的准确预测仍十分困难。** 当前的计算模型对热稳定性和可溶性等较宏观的性质预测相对成熟,但对转换数($k_{cat}$)、米氏常数($K_m$)和立体选择性等机制敏感的催化参数预测仍存在较大误差。这要求算法能更好地模拟过渡态的量子化学特征和酶动态构象变化。物理启发的神经网络和量子力学/分子力学(QM/MM)多尺度模拟与深度学习的融合,有望突破这一瓶颈。
**生成序列的实验可表达性与功能可重现性存在挑战。** 深度生成模型产出的序列往往包含大量预测的“迷惑性”变体,可能面临表达包涵体或失活的风险。发展可解释的生成模型,使设计者不仅得到序列本身,还能理解决定功能的关键残基相互作用网络,将是增强生成结果鲁棒性的重要方向。
**自主进化的通用性平台建设仍处于初级阶段。** 当前自驱动实验室多局限于少数模式菌株和简单筛选指标,对于需要复杂底物合成、特殊辅因子再生或多酶级联的系统,还需要突破自动化合成与自动化工艺决策的多重技术壁垒。
展望未来,计算酶工程将朝着“精准设计 - 高效生成 - 自主进化”三位一体的终极形态加速演进。随着蛋白质结构预测和全原子蛋白质模拟精度的持续提升,以及多模态统一大模型(整合序列、结构、动力学与功能)的出现,人类对酶序列 - 功能映射规律的认知将达到全新的高度。届时,为特定工业反应定制化“编写”酶蛋白,将如同现今编写计算机代码一般,真正迈入生物催化的新时代。
参考来源
> Lv F, Zhang J, You S, Qi W. From traditional to 计算-driven: The evolution of intelligent enzyme engineering for biocatalysis. *Biotechnology Advances*, 2025, DOI: 10.1016/j.biotechadv.2025.108788.
DOI: 10.1016/j.biotechadv.2025.108788