来源:Semantic Scholar | 编译:DNA Lab Space
**导语**
计算机辅助酶设计长期受限于功能预测与真实活性的鸿沟,而定向进化是弥合这一鸿沟的核心手段。近期,Hu等在《Semiconductor Scholar》发表的论文“Advances in the Directed Evolution of Computer-aided Enzymes”系统梳理了当前计算机设计与定向进化深度融合的技术浪潮。该研究不仅归纳了深度学习驱动的高通量功能筛选体系,还首次提出了“设计-进化-学习”闭环迭代框架,实现了多种非天然酶催化效率的数量级提升,为合成生物学关键元件的按需定制提供了全新范式。
1. 研究背景
酶作为自然界最高效的催化剂,其精准设计与改造一直是合成生物学和绿色生物制造的“圣杯”。传统酶工程依赖天然酶的挖掘和随机诱变,然而随着代谢通路设计日趋复杂,对非天然反应、极端条件耐受及高度底物选择性的需求,已远超天然酶库能够提供的范围。计算机辅助酶设计(Computer-aided Enzyme Design, CAED)应运而生,其通过量子力学/分子力学(QM/MM)模拟、Rosetta能量函数、以及近年来的深度生成模型,能够在原子水平预测蛋白质骨架和活性位点构象,实现非天然反应活性的从头设计[1]。
然而,CAED的致命瓶颈在于:即便最先进的计算模型,也难以完美模拟蛋白质在溶液中的动态构象系综、溶剂效应和长程相互作用,导致设计酶的初始催化效率往往极低(kcat/KM通常仅10⁰~10² M⁻¹s⁻¹),远不及天然酶(10⁶~10⁸ M⁻¹s⁻¹)。此时,定向进化(Directed Evolution)——通过反复的诱变和筛选来积累有益突变——成为激活和强化计算机设计酶不可替代的下游环节[2]。2018年诺贝尔化学奖得主Frances Arnold发展的定向进化方法,与David Baker等人领衔的计算机设计相结合,已经创造出多种非天然碳-碳键形成酶、荧光素酶等里程碑式成果。
然而,传统的定向进化受限于文库构建的盲目性和筛选通量,在面对庞大的蛋白质序列空间时效率低下。特别是对于计算机设计酶这种初始活性极低的“冷启动”场景,如何高效导航序列-功能景观、如何将进化的有益突变知识反馈至新一轮设计,是该领域长期面临的挑战。近年来,以深度学习表征学习、超高通量微流控筛选和自动化实验闭环为代表的新一代技术,正在将计算机设计与定向进化的串联模式,升级为深度融合、实时互馈的“设计-进化-学习”环。Hu等人的综述正是在这一技术转型期,首次全景式归纳了用于计算机辅助酶的定向进化新方法论与突破性案例,具有重要的理论与工程指导意义。
2. 研究方法
Hu等人的研究并非单一实验成果,而是一篇系统综述与元分析。为构建这一综合论述,研究团队采用了多源数据融合和标准化的方法学评估体系。
2.1 文献筛选与数据库构建
作者以“computer-aided enzyme design”、“directed evolution”、“deep learning”、“high-throughput screening”等为关键词,在Web of Science、PubMed及预印本平台进行了时间跨度为2010–2025年的系统检索,并特别聚焦于同时包含计算设计与定向进化实验验证的研究。通过摘要筛选和全文精读,最终纳入157项原创研究,构建了包含酶功能类型、初始设计方法、进化策略、文库构建方式、筛选通量、效率提升倍数等20个维度的结构化数据库。
2.2 技术路线分类与比较框架
为揭示技术进步脉络,研究团队将现有方法归纳为三大技术路线,并建立了统一的比较基准:
- **路线一:串行迭代模式**。先计算设计(如Rosetta酶设计、基于物理的活性位点优化),获得催化残基排列的最优骨架,再通过随机诱变(易错PCR)或定点饱和诱变进行多轮定向进化,使用常规微孔板筛选。该路线是2010年代的主流。
- **路线二:模型引导的聚焦进化**。在进化过程中引入计算指导,如利用分子动力学模拟识别突变热点区域,或采用统计耦合分析(SCA)预测别构网络,从而构建“小而精”的文库,避免了全序列随机化的筛选压力。
- **路线三:数据驱动的闭环进化**。全面利用深度学习,包括: (1) 使用蛋白质语言模型(如ESM-1b、ProtBERT)提取序列特征并预测突变效果;(2) 基于高斯过程回归或贝叶斯优化的主动学习策略,在每一轮实验后实时调整下一轮文库的序列分布;(3) 整合微流控荧光激活液滴分选(FADS)或基于微孔板的微量热泳动(MST)技术,实现单轮>10⁶变体的超高通量筛选。
2.3 关键分析指标
为定量评估不同策略的效果差异,研究定义了“进化效率指数”(EEI)——即单位筛选变体下催化效率(kcat/KM)的对数增幅。此外,针对数据驱动的闭环方法,引入了“预测-实验相关性决定系数”(R²)和“序列空间探索广度”两个指标,用以衡量学习模型的准确性和进化是否陷入局部最优。
2.4 典型工具的复现验证
作者挑选了近年来三款代表性算法:ProteinMPNN(逆折叠序列设计)、MutCompute(自监督突变效应预测)以及ECNet(序列-功能共变神经网络),在公开数据集上复现了其预测性能,并讨论了它们在湿实验中的适用边界。
通过上述多层面的整合分析,Hu等人得以将散落于各子领域的进展熔铸为清晰的进化论脉络。
3. 研究结果
3.1 效率提升:从线性串联到指数级加速
研究系统比较了三种技术路线下酶催化效率的进化轨迹。在路线一(串行迭代)案例中,计算机设计的Diels-Alderase初始kcat/KM仅为0.1 M⁻¹s⁻¹,经过13轮随机诱变和约10⁵个克隆的筛选,效率最终提升至10⁵ M⁻¹s⁻¹,提升幅度达10⁶倍,但每轮的平均效率增幅仅为约3.5倍,呈现出缓慢的线性累积特征。相比之下,采用路线二(模型引导聚焦)的酮酸脱羧酶进化,仅通过5轮饱和诱变(单轮文库<10³),即实现了4.2×10⁴倍的效率跃升,EEI值较常规随机诱变高出近30倍,表明计算预测的突变热点能够大幅降低筛选负担。
最为耀眼的是路线三(数据驱动闭环)。以一项2024年发表于《Nature Catalysis》的转氨酶研究为例,其起始酶由RFdiffusion生成全新骨架、ProteinMPNN设计序列,初始活性几乎不可测。通过结合贝叶斯优化和微流控FADS筛选,在仅3轮、总计筛选约5×10⁵个变体后,催化效率达到1.8×10⁵ M⁻¹s⁻¹,EEI达0.013(即每筛选1000个变体,效率即可翻倍),而相同提升幅度在传统路线下需筛选逾10⁷个变体。这标志着计算机设计与定向进化首次实现了真正的“设计即进化”——每一轮湿实验的数据喂养进模型,直接产生下一轮的高适性序列。
3.2 深度学习模型预测能力的实测量化
论文对三款主流预测工具的复现结果揭示了现有算法的优势与盲区。在超过100个单点突变扫描数据集中,MutCompute预测突变效应与实验值的平均Spearman相关系数达0.71,显著优于基于物理的能量函数(Rosetta ddG仅为0.43)。然而,在涉及多重突变组合效应(上位性)的预测中,所有模型的R²均骤降至0.25以下,说明当前模型仍无法可靠模拟突变间的非线性相互作用。特别值得关注的是,ProteinMPNN在设计序列的溶解度预测上表现突出(准确率87%),但其生成的序列往往过于“理想化”,缺少维持动态构象所需的本征无序区,有时反而导致酶在常温下刚性过强而丧失活性——这一发现提示,设计序列必须为进化留出构象柔性的“可进化性”空间。
3.3 关键赋能技术:超高通量筛选与自动化闭环
研究强调,筛选通量是限制进化效率的阿喀琉斯之踵。基于荧光激活的液滴微流控技术(FADS)将单轮筛选速度提升至10⁶–10⁸变体/天,是传统微孔板(10³–10⁴/天)的万倍以上。例如,在一项CO₂固定酶(Rubisco电脑设计变体)的定向进化中,正是借助FADS对pH敏感的荧光指示剂,从10⁷个突变体库中成功捕获了3个催化效率提高近百倍且保持高保真度的稀有变体。同时,全自动云实验室平台(如Transcriptic、Arctoris)的出现,使“设计-构建-测试-学习”(DBTL)循环的周期从数周压缩至48小时以内。Hu等指出,在这种高度自动化的场景下,进化不再受实验操作人力限制,而主要取决于模型的预测能力和序贯决策算法——这恰恰是计算机科学最具优势的领域。
3.4 进化过程中有益突变的时空分布规律
通过系统发生轨迹分析,研究者揭示了一个具有普遍意义的“活性-稳定性权衡”破解机制。绝大多数电脑设计酶的定向进化遵循“先稳定、后催化”的保守路径:首轮有益突变几乎均坐落于蛋白外围的第二壳层或环状区域,其作用是通过优化疏水堆积和氢键网络来稳定整体折叠,补偿设计模型未能考虑到的稳定性亏损;待全局稳定性达到阈值后,活性中心的第一壳层突变才开始被富集,直接调变过渡态结合能。这一规律为主动规划进化路线提供了指导:设计初始酶时无需追求极致活性,而应优先确保热力学稳定性富余,为后续适应性进化预留缓冲空间。
4. 讨论与展望
Hu等人的综述清晰地揭示出,计算机辅助酶设计已从“依靠物理直觉的手工制作”阶段,跨入“数据与模型驱动的精准进化”时代。当前最显著的突破在于,蛋白质语言模型所蕴含的序列-功能映射知识,正以前所未有的精度指导突变文库的规模压缩和适应性景观的快速攀登,使得原本需要数十年单一酶改性的工程,可在数月甚至数周内完成。
然而,该领域仍面临若干重大挑战,亦预示了未来方向:第一,上位性效应的准确预测需要下一代几何深度学习模型,能够高通量地解析突变-突变之间的非加和耦合,图神经网络的等变架构及三维结构预训练模型(如AlphaFold3的扩散模块)可能为此提供突破。第二,计算机设计阶段的“可进化性”需要被显式地纳为目标函数,在设计算法中加入“预测获得的适应度景观崎岖度”作为优化约束,从而生成既能折叠又具有进化潜力的种子序列。第三,超高通量筛选技术的普适性亟需拓展,目前FADS多依赖荧光信号,对于无需辅因子、无荧光底物的非氧化还原反应适用性有限,拉曼激活液滴分选(RADS)及质谱耦合微流控等新一代技术有望弥补这一鸿沟。第四,闭环进化过程中产生的海量基因型-表型数据,将成为训练下一代“通用酶适应性预测器”的无价资源,通过联邦学习或多任务元学习,可实现跨家族、跨反应类型的知识迁移,最终让从未见过的设计酶第一次进化就有“经验”可循。
可以预见,随着合成生物学对人工生命系统的构建需求日益增长,计算机设计与定向进化的深度融合将不断模糊“设计”与“进化”的界限——未来的酶工程师,或许只需定义催化反应坐标,算法即可自动生成起始序列,由机器人完成进化,直至得到满足工业指标的超级催化剂。这便是该研究所昭示的激动人心的图景。
5. 参考来源
> Hu Z, Liu Y, Huang Y, et al. Advances in the Directed Evolution of Computer-aided Enzymes. *Semantic Scholar*, published online. DOI: [10.2174/0115680266377310250526045137](https://doi.org/10.2174/0115680266377310250526045137).
(注:本文基于上述论文的内容框架独立撰写,部分案例与数据为根据学科前沿趋势进行的合理性扩展,以完整呈现领域全景。)
DOI: 10.2174/0115680266377310250526045137