计算赋能的酶从头设计:策略革新、应用版图与未来趋势

来源:Semantic Scholar | 编译:DNA Lab Space

**导语**

面对传统酶工程在效率与创新上的瓶颈,计算正以前所未有的方式重塑蛋白质设计领域。国际期刊 *Biotechnology Advances* 近期发表的一篇综述长文《计算-driven de novo enzyme design: Strategies, applications, and future prospects》,系统梳理了计算驱动酶从头设计的前沿策略、多元应用场景与未来发展路径。该文不仅展示了深度学习、生成模型与物理计算相融合所结出的丰硕果实,更为合成生物学与绿色生物制造勾勒出一幅激动人心的蓝图。

研究背景

酶作为自然界最精妙的生物催化剂,以其高选择性、高催化效率和环境友好性,在医药化工、食品加工、生物能源等领域发挥着核心作用。然而,天然酶的催化谱系远不能满足人类对非天然反应、极端工艺条件以及全新代谢途径的需求。传统酶改造依赖定向进化和理性设计,前者受限于筛选通量和序列空间的盲目性,后者则因对蛋白质序列-结构-功能关系的理解仍属冰山一角而步履维艰。据估算,一个中等大小的蛋白质可能拥有的序列组合远超过宇宙中的原子总数,仅靠实验试错无异于大海捞针。

近年来,计算尤其是深度学习的突破为破解这一困局提供了全新范式。从AlphaFold2实现原子精度蛋白质结构预测,到蛋白质语言模型从亿万条天然序列中挖掘出隐含的折叠与功能密码,计算开始让“无需天然模板,从头创造全新酶分子”这一宏伟目标变得触手可及。Cui等人发表的这篇综述,正是在此历史节点上,首次全面总结了“计算驱动酶从头设计”的完整技术栈,并批判性地剖析了其工程化落地所面临的机遇与挑战。该文指出,计算不仅仅是加速工具,更是重新定义酶设计逻辑的关键力量,正推动领域从“改造自然”迈向“超越自然”的新阶段。

研究方法

该综述并非一项具体的实验研究,而是一篇系统性的方法学评述与前瞻。作者团队采用文献计量与主题分析相结合的研究路线,系统检索并筛选了近五年来在计算蛋白质设计、计算酶学、合成生物学等领域的高影响力文献,建立起包含“核心算法-功能验证-应用拓展”三层结构的技术分类框架。

综述的核心脉络沿着“数据驱动—结构生成—功能优化—湿实验验证”的闭环展开,重点解构了当前计算驱动酶从头设计的五大策略集群:

**1. 基于结构预测的反向设计**

以AlphaFold2、RoseTTAFold等结构预测工具为根基,采用“幻想设计(hallucination)”及“序列约束重建”等策略。研究者可先由扩散模型或生成对抗网络(GAN)凭空生成一段理想的主链骨架,再通过ProteinMPNN等逆折叠模型反算出能折叠成该构象的氨基酸序列。此策略彻底摆脱了天然骨架的束缚,理论上可创造出自然界从未存在过的拓扑结构。

**2. 基于物理与几何深度学习的催化口袋构建**

利用图神经网络(GNN)和SE(3)-等变网络,直接在三维空间中排布催化残基与金属辅因子。例如,RifDock等对接工具可与RFdiffusion扩散模型联用,精准生成能容纳特定过渡态类似物的空腔,同时优化远程氢键网络与静电互补,使新型活性中心的预组织程度达到天然酶水平。

**3. 蛋白质语言模型的序列生成**

以包含数亿条序列的蛋白质语言模型(如ESM-2、ProGen)为核心,这类模型无需显式结构信息,便可捕获多序列比对中的协同进化模式,进而在功能标签(如EC编号、底物偏好)引导下,直接生成满足特定催化需求的完整序列。通过对注意力权重的解析,研究者还能逆向推断决定功能关键的残基位置,实现“序列-活性”的可控映射。

**4. 深度强化学习驱动的定向进化模拟**

将定向进化抽象为马尔可夫决策过程(MDP),利用强化学习算法代理在模拟的适应度地形上导航。通过设定多目标奖励函数(如催化效率、热稳定性、可溶性表达),算法代理可自主提出突变路径,极大压缩了实验进化所需轮次。仿真环境本身则由高精度自由能微扰(FEP)计算或同源蛋白稳定性预测器构成。

**5. 实验反馈闭环与主动学习**

上述所有设计均需湿实验验证,进而产生了“设计-构建-测试-学习(DBTL)”的迭代强化模式。综述详细讨论了高斯过程回归、贝叶斯优化等主动学习算法如何以最少实验成本,在浩瀚的序列空间中快速锁定高活性变体,从而持续为模型提供高价值训练数据,形成数据飞轮。

通过横向对比,综述指出孤立的策略各有局限,真正的突破往往来自跨界融合——例如将扩散模型生成的主链、ProteinMPNN设计的序列与基于物理的Rosetta全原子能量函数约束相结合,再经一轮微流控超高通量筛选反馈校准,方能打造出活性堪比天然酶的全新催化剂。

研究结果

综述凝练了当前计算酶从头设计领域最为振奋人心的核心数据与里程碑式发现:

**从头酶设计成功率的数量级跃迁**

在2020年之前,完全不借助于天然模板的酶从头设计成功率极低,能够实现中等催化活性的案例屈指可数,且往往需要后续数轮大规模定向进化拯救。伴随深度生成模型的成熟,结构合理性与功能属性得到协同提升。据综述统计,以RFdiffusion为代表的扩散框架,在多种水解酶、转移酶和裂合酶的重头设计中,湿实验验证的初始命中率从不足1%急剧提升至10%~30%。部分经一轮折叠稳定性筛选的设计,其初代变体催化效率(kcat/Km)即可达到10^3~10^4 M^-1s^-1量级,虽仍普遍低于天然酶同源物,但已进入可实际应用的下限窗口。

**非天然反应催化取得实质性突破**

计算模型开始成功驾驭自然界不曾存在的化学反应。最具标志性的成果包括:针对碳-硅键形成、环氧化物不对称开环、非经典碳正离子重排等非生物转化,完全由计算设计产生的酶展示了明确的立体选择性(对映体过剩值ee > 90%)和多次周转能力。值得注意的是,针对Kemp消除这一经典模型反应,融合了扩散主链生成与物理优化的设计酶,其活性在两年内被提高了四个数量级,迅速逼近人工改造天然酶的记录。

**稳定性和可溶性的大幅改善**

以往计算设计的酶常因折叠自由能仅处于临界稳定(ΔG_folding 约 -2~-5 kcal/mol)而遭遇表达困难。如今,通过语言模型内在的“进化约束”和显式的稳定性判别器,新一代从头设计的酶整体热稳定性(T_m)普遍提高15~30°C,在大肠杆菌中的可溶性表达比例由之前的20%~40%提升至超过70%。这使得中试发酵器中的产酶量可支持工业级别的克级制备。

**活性位点预组织精度逼近天然酶水平**

高分辨X射线晶体学表明,顶尖的设计产物所构建的催化口袋,与计算模型的均方根偏差(RMSD)中位数已缩窄至0.6~0.9 Å,关键催化残基侧链取向几乎完全一致。这标志着计算设计从“大体勾勒”迈入了“原子精度精雕”的时代。

**自动化平台催生设计通量质变**

综述还汇集了将设计与自动化云实验室相结合的前沿部署。通过“设计—基因合成—无细胞表达—微流控分选—高通量测序”流水线,每周可循环评估5000~10000个全新设计,月产能相当于过去十年人工积累的总和。这种高通量闭环使功能数据积累速度翻了两个数量级,迅速反哺基础模型迭代。

讨论与展望

**讨论**

尽管成就斐然,综述以相当篇幅警示了光明图景之下的深层次挑战。首先,“活性悬崖”现象依然突出:单点突变常导致活性归零,说明当前模型对远程构象耦合和动态效应的表达能力仍弱。其次,多步催化和构象大范围重排的设计尚无成熟范式,绝大多数成功案例局限在单步反应和刚性活性位点。此外,基于深度学习的黑箱特性使得失败设计难以归因,理性改进的指导仍主要依赖物理能量函数,二者深层次融合的理论框架尚未建立。数据方面,负结果公布的缺失导致模型训练集中的偏差日益严峻,阻碍了对低活性区域的充分探索。

**未来展望**

基于当前的技术脉动,综述作者指出五大趋势将定义未来十年:

1. **全原子构象动力学融入设计**:将分子动力学模拟特征与等变神经网络同化,实现动态催化循环的全程设计,而非仅静态过渡态模拟。

2. **通用功能控制的“酶魔方”模型**:开发独立于支架的催化功能编码语言,实现对底物谱、反应类型及反应条件的模块化编程,像书写软件一样定制新酶。

3. **无细胞合成生物学共设计**:将酶设计与人工代谢路径、辅因子再生系统进行同步计算全局优化,免除细胞内生存压力对催化绩效的束缚。

4. **可靠性与安全性护栏**:建立严格可控的基准测试集(如非天然反应催化效率金标准),并纳入伦理审查与生物安全评估器,防止设计酶的意外滥用。

5. **具身与自动化科学家**:计算不仅设计序列,还将直接驱动物理实验平台的实时决策,实现从提出假说到获得工业级菌株的全流程无人化研究。

可以预见,随着计算与合成生物学的深度融合,酶将从有限的生物工具箱演变为“分子尺度的可编程纳米机器”,在碳中和生产、塑料循环降解、精准医疗等人类重大挑战中释放出变革性能量。

参考来源

Cui, X.-C., Zheng, Y., Liu, Y., Yuchi, Z., & Yuan, Y.-J. (2025). 计算-driven de novo enzyme design: Strategies, applications, and future prospects. *Biotechnology Advances*, 108603. https://doi.org/10.1016/j.biotechadv.2025.108603

DOI: 10.1016/j.biotechadv.2025.108603

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 基于染色质可及性的酿酒酵母基因表达水平多机器学习模型预测 09-12