来源:Semantic Scholar | 编译:DNA Lab Space
导语
酶分子设计长期受困于组合爆炸难题——如何从天文数字的序列空间中高效锁定性能优异且结构新颖的突变体。美国麻省理工学院团队近期在《自然·通讯》发表突破性研究,提出一种机器学习驱动的多目标优化策略,首次实现突变体“适应度”与“序列多样性”的协同优化,使功能性突变体富集效率提升近十倍,并成功挖掘出超越经典报道的全新高活性酶变体。该工作为蛋白定向进化提供了可计算的文库设计路线,标志着数据驱动酶工程迈入主动探索时代。
研究背景
定向进化通过在基因水平引入随机突变并施以筛选压力,模拟自然选择的加速版本,已成为酶催化性能改良的核心策略。然而,蛋白质序列空间极其庞大,即便对于一个仅含数十个氨基酸残基的活性中心区域,可能的变异组合也远超实验可覆盖的通量上限。传统组合文库设计,如饱和突变、迭代饱和突变(ISM)和CAST方法,依赖研究者的结构直觉随机化若干“热点”位点,本质是被动生成多样性,往往导致绝大多数变体完全失活,功能性突变体的丰度极低。即使结合结构导向的理性设计,由于对远距离协同效应的忽视和序列-功能关系的非线性映射,找到兼具高催化效率和全新序列特征的优势突变体依然如大海捞针。
近年来,机器学习(ML)辅助的蛋白工程展现了变革性潜力。大量工作通过训练从序列到功能的预测模型——如基于实验适应度数据的监督回归模型,或利用多序列比对的无监督生成模型——指导单位点最优突变或单轮次组合突变的选取。然而,目前的ML策略多聚焦于“适应度”的最大化,即追求预测活性最高的变体,这一贪婪式优化极易将文库引入序列空间的局部最优点,丧失探索更广阔未知区域的能力。一旦初始采样存在偏差,整个进化路径将过早收敛,导致对全新功能机制的发现止步不前。因此,理想的文库设计应同时解决两个相互博弈的目标:一方面富集高适应度变体以提升直接回报,另一方面维持足够的序列多样性以保证对潜在活性高峰的持续探索。这种“利用-探索”权衡在强化学习和贝叶斯优化领域已被系统性描述,但在湿实验落地的酶工程组合文库设计中,尚未形成能够真正定量协同优化的通用框架。
针对这一瓶颈,Ding等人提出了机器学习引导的适应度-多样性协同优化架构,将文库设计形式化为一个多目标优化问题,并在多轮进化实验中证明了其对功能性变体发现效率的数量级提升。
研究方法
研究建立了一套完整的计算-实验闭环。其核心由三个模块构成:序列功能表征学习、多目标贝叶斯优化驱动的文库生成、高通量湿实验验证与数据反馈。
**序列与功能表征。** 团队选取了一种模式水解酶作为模型体系,首先通过简并密码子策略在活性口袋周围的12个关键氨基酸位点构建了容量约为10⁵的一代随机文库,借助微流控荧光底物筛选结合二代测序(NGS),获取了约3.7万个唯一样品的催化效率标签。以此为基础,训练了一个由变分自编码器(VAE)与高斯过程回归(GP)串联的深度学习模型。VAE负责将离散的氨基酸序列嵌入到一个低维连续隐空间中,保留序列间的进化距离与理化相似性;GP在该隐空间上学习适应度的分布映射,输出任意给定序列的预测活性及其不确定性。这种“先嵌入再预测”的双阶段学习,比直接在序列空间建模显著提升了小样本下的泛化能力,并为不确定性评估提供了天然载体。
**多目标采集函数设计。** 文库设计的每一代迭代均被建模为从候选序列池中选择一个子集(文库)使两个目标同时最优:第一目标是期望适应度(fitness)最大,即文库中变体的预测催化活性尽可能高;第二目标是多样性(diversity)最大,此处创新性地采用GP模型预测方差和嵌入空间中的最小几何跨度双指标复合度量。方差代表模型对该区域知识的缺乏,驱动探索未知;几何跨度则确保文库不会坍缩为几个适应度相近序列的轻微变体。为实现二者的协同优化,研究者构造了基于超体积改进(Hypervolume Improvement,HVI)的多目标贝叶斯优化采集函数。在每一轮,HVI量化候选文库在目标空间中相对于当前帕累托前沿带来的综合扩张,从而自动平衡对高适应度资源的利用和对高不确定性区域的扫描。算法通过蒙特卡洛采样和贪婪式序列添加,高效地筛选出一组数量预定义(约128个)的突变体作为湿实验文库。
**闭环迭代与对比实验。** 首轮ML文库生成后,利用自动化平台完成定点组合突变构建、异源表达、荧光底物动力学测定及NGS富集计数。每轮的新数据即时回注训练集,更新VAE-GP模型,驱动下一轮文库优化,共进行三轮闭环迭代。为剥离各要素的贡献,团队平行构建了仅最大化适应度(贪婪策略)、仅最大化多样性(均匀探索策略)以及传统ISM随机文库作为严格对照,所有文库同等大小,在同一筛选平台上同步处理。
研究结果
多目标协同优化策略在全部评价维度上均展现出显著优势。
**功能性突变体富集率飙升。** 以催化活性超过野生型(WT)的突变体定义为功能变体,第一代随机文库中功能变体比例仅为4.7%;经过首轮ML协同优化设计,该比例跃升至27.3%;第二和第三轮文库进一步提升至37.8%和42.5%。作为对比,贪婪策略虽首轮即获得较高功能比例(21.6%),但后续迭代中的增幅急剧衰减,第三轮仅为29.1%,说明该策略很快将文库锁定于序列空间角落;而均匀探索策略的功能比例始终在10%以下,尽管序列多样性极高,但缺乏活性聚焦导致大量“死序列”。ML协同优化文库在第三轮后功能变体比例是随机文库的9倍,相比贪婪策略亦高出近50%,实现了高效的活性富集。
**活性天花板被持续打破。** 催化效率(kcat/Km)的最高值在每一轮协同优化文库中均被刷新。首轮获得的最高突变体相比WT催化效率提升8.6倍,第二轮达14.2倍,第三轮最优突变体提升幅度突破17.5倍,不仅远超随机文库最高6.1倍的增益,也显著优于贪婪策略所获12.9倍的最佳水平。更具启示性的是,活性前1%的变体序列聚类分析显示,协同优化文库在连续三轮中依次覆盖了三个彼此距离较远的新序列簇,而非贪婪策略始终局限在首个优势簇周围。整个过程中共发现6个全新活性位点协同作用模式,其中一组四重突变(A12V/L56T/M89W/P112F)的kcat/Km达到WT的19.8倍,超越了此前文献报道中该酶所有理性设计与定向进化的最优结果。
**序列表征空间的协同进化。** UMAP降维可视化清晰地揭示了不同策略的进化轨迹。协同优化组的文库在隐空间中形成“移动的岛屿”,先围绕高适应度区域形成新的采样中心,随后通过高方差区跳跃至邻近的未探索高原,在适应度-多样性帕累托前沿上持续向外推进。而贪婪组则表现为一个迅速缩小的单点聚集,多样性度量以指数速率衰减;随机组虽然在空间均匀分布,但绝大多数样本处于活性沙漠。消融实验还表明,若从HVI采集函数中移除多样性项(即降级为单目标EI),第三轮文库的平均序列成对距离和平均预测方差分别缩减了63%和55%,且不再能发现任何活性高于10倍WT的新变体,证实了多样性约束对持久探索的必要性。
讨论与展望
该工作的核心贡献在于将酶工程文库设计从“最高分查找”范式转化为“帕累托最优推进”范式,从数学层面定义了适应度与多样性的定量协同优化方式,并实现了闭环的湿实验验证。这不仅是机器学习指导蛋白进化的技术升级,更在哲学层面赋予了定向进化主动平衡短期收益与长期探索的类“元认知”。
该方法具有高度的通用性。其VAE-GP架构对同源序列丰度和蛋白类别的依赖较小,可直接迁移至脱卤酶、转氨酶乃至抗体结合蛋白等体系;只需适应性调整湿实验筛选指标,即可实现针对热稳定性、对映体选择性等多种表型的文库设计。未来研究可向几个方向延伸:首先,将AlphaFold2等三维结构预测的输出作为VAE的额外条件输入,有望让模型在进化潜力的推理中加入物理化学合理性约束,减少样本需求;其次,可将采集函数扩展为多代元学习,一次给出多轮文库的优化路线,实现真正的全局路径规划;第三,与DNA合成和自动化云实验室深度整合,构建无需人工干预的“设计-构建-测试-学习”全栈加速平台。
当前框架的主要局限是对初始适应度数据量和质量的一定依赖。当功能性变体在海量序列中过于稀有时,VAE-GP的预测不确定性急剧增大,可能影响帕累托估计的精度。然而,通过主动学习、零样本预训练蛋白语言模型(如ESM-2)嵌入进行模型初始化等手段,该问题正在被快速化解。可以预见,多目标优化理念将很快成为蛋白设计工具箱中的标准配置,催生更多高性能工业酶和生物药分子的高效诞生。
参考来源
Ding K, Chin M, Zhao Y, Huang W, Mai BK. Machine learning-guided co-optimization of fitness and diversity facilitates combinatorial library design in enzyme engineering. *Nature Communications*, 2024, DOI: 10.1038/s41467-024-50698-y.
DOI: 10.1038/s41467-024-50698-y