来源:Engineering highly active nuclease enzymes with machine learning and high-throughput screening(Cell Systems)| 编译:DNA Lab Space | 原文许可:elsevier-subscription
导读
酶工程优化常受制于崎岖的适应度景观和高昂的实验成本。本研究提出TeleProt——一种融合进化数据与实验数据的机器学习框架,用于设计多样化的蛋白文库,并成功提升了可降解慢性伤口生物膜的核酸酶催化活性。经多轮高通量实验,TeleProt发现的最优酶性能显著优于定向进化,命中率更高,甚至无需任何先验实验数据即可设计出高性能初始文库。研究同时发布了包含55,000个核酸酶变体的基因型-表型数据集。
研究背景
蛋白质工程能力已在工业和治疗领域引发革命。一般而言,蛋白质工程活动可分为两个阶段:发现阶段寻找具有非零活性水平的目标功能候选蛋白,优化阶段则改善其属性,如抗体的结合强度、酶的催化活性、热稳定性或立体选择性。定向进化是蛋白质优化的标准技术,通过体外选择和诱变迭代改进基因型池。尽管经定向进化优化的蛋白质已在众多工业和治疗场景中部署,但该技术可能无法跨越蛋白质适应度景观中的谷地,且当池中多样性崩溃时可能过早收敛。
为应对这些局限,机器学习引导的定向进化应运而生。该方法涉及数据收集、建模和模型引导的序列生成循环,已在多种蛋白质工程任务中展现出强劲成果。随着自动化、微流控、展示系统、多重化和连续进化技术的进步,MLDE正成为日益常见的工程策略。
研究方法
关键资源
菌株:枯草芽孢杆菌SCK6(Bacillus Genetic Stock Center, 1A976);地衣芽孢杆菌DSM 13(Bacillus Genetic Stock Center, ATCC 14580);E. cloni 10G SUPREME电转感受态细胞(Lucigen, 60080-2)。
化学品与重组蛋白:地衣芽孢杆菌NucB(UniprotKB F1BV52);5' Alexa Fluor® 488标记(Integrated DNA Technologies, 1712);3' Iowa Black® FQ淬灭基团(Integrated DNA Technologies, 3463)。
关键试剂盒:NEBridge® Golden Gate Assembly Kit(BsaI-HF® v2)(New England Biolabs, E1601);NEBuilder® HiFi DNA Assembly Master Mix(New England Biolabs, E2621);GeneMorph II Random Mutagenesis Kit(Agilent, 233115);KAPA HiFi HotStart ReadyMix(Roche, 07958927001)。
寡核苷酸:G651/5Alex488N/TCCGAGTGATTTAGCGTGACG537GTCACGCTAAATCACTCGGA/3IABkFQ/(本文);G24TCCGAGTGATTTAGCGTGACG25GTCACGCTAAATCACTCGGA(本文);可变序列正向引物TATTCTCCTCAGCATGCCGAAGGCG(本文);可变序列反向引物AGATTACTACTGATAACCACTGTTGATTG(本文)。
重组DNA:T7启动子(Castillo-Hair等,121);核酸酶抑制剂基因nin(comJ)(RCSB PDB 4MQD)。
软件与算法:高通量筛选数据分析代码(https://github.com/google-deepmind/nuclease_design, Zenodo: 10.5281/zenodo.14162071);HHblits(Remmert等,122);Fastp(Chen等,123);Bowtie2(Langmead和Salzberg,124)。
TeleProt框架的ML引导蛋白优化
概述:每轮实验组合多个子文库,这些子文库采用图1所示的TeleProt框架方法设计。TeleProt遵循Belanger等人所述的结构,适用于轮次少、每轮实验通量大、高通量实验目标函数与下游应用相关性不完美的优化场景。在此情况下,发现多样化的高性能命中变体至关重要,以提高至少一个候选满足下游标准的概率。表S1提供了各子文库的文库规模和命中率的完整细分,补充表S10提供了子文库的额外细节,图S20–S23提供了混合文库构建和筛选的示意图。
搜索空间:文库设计包含WT的替换突变,不允许插入或缺失。组装方案进一步将设计限定在指定78个氨基酸设计区域内包含突变。在G3和G4中采用了两个重叠设计区域。
采集函数:采集函数最初用于贝叶斯优化,是一种计算成本低廉的软件函数,用于量化在优化问题搜索空间中收集特定点数据的效用。采集函数基于自然NucB同源物或实验适应度测量拟合的模型。原则上,采集函数可对整个提议批次联合定义,因为批次对后续建模的效用取决于批次的多样性。然而,优化这种高维组合采集函数极具挑战性。因此,采用替代程序来平衡批次中模型预测质量与多样性:首先发现大量具有高模型分数的点(候选生成),然后选择多样化的子集(批次选择)。
候选生成:寻找具有高采集函数分数的点,同时确保这些点出现在采集函数的信任区域内——即模型预期可靠运行的区域。采用两种通用方法:局部搜索方法可视为定向进化的计算机模拟版本;第二种方法从提议分布中采样候选,该分布设计为对既出现在信任区域又具有高采集函数分数的点赋予高概率。
批次选择:沿两个轴确保批次高多样性。第一,控制变体外推分数的分布,作为文库探索与利用权衡的启发式指标。外推分数高的变体位于远离训练数据的区域,发现命中变体价值高,因为使用DE技术难以到达这些区域。但模型可能在此类区域表现不可靠。第二,选择与WT相比具有广泛独特突变集合的批次。实践中发现,简单地按采集函数分数取排名最高的候选会导致某些突变出现在批次的大部分中。为增加后续轮次训练模型所用数据的多样性,手动确保批次使用更广泛的突变足迹。
模型
使用三类模型。卷积神经网络模型基于实验数据拟合,用作采集函数。变分自编码器模型基于实验和进化数据组合拟合,可用作提议分布或采集函数。岭回归模型基于实验数据拟合,用于推导提议分布。
CNN活性分类器:以标准方式开发序列-功能模型。首先将实验数据转换为带对应离散酶适应度标签的序列集。虽然酶活性是适合回归模型的连续值,但使用离散标签和分类模型以反映高通量平台可达到的分辨率水平。由于在多个活性水平离散化,模型为多类分类器。采用CNN分类模型,基于先前研究证明CNN在适应度数据集上的有效性。为调整模型超参数,将数据分为训练集和测试集,选择对应最高测试集性能的超参数。用于提出新设计的最终模型使用最优超参数在完整数据集上重新训练。所有含2个或更少突变的变体用于训练,其余保留用于测试集,从而选择能外推到训练数据之外更多突变变体的模型。超参数网格细节见表S4(G4模型),与基线模型比较见表S5。CNN优于逻辑回归和梯度提升树基线。G2和G3模型的流程类似。G4模型使用3个宽度为5的卷积层,每层32个滤波器,展平操作产生序列的单一嵌入,随后是全连接层(64个隐藏单元)和最终线性输出层,总计约250K参数。所有非线性均为ReLU。所有神经网络模型在keras和tensorflow中实现。
NucB同源物VAE模型:VAE是潜变量模型,具有潜变量z、先验分布P(z)、由"解码器"神经网络参数化的氨基酸序列x的条件分布P(x|z),以及由"编码器"神经网络参数化的近似后验分布P(z|x)。

研究结果
ML引导活动概览
ML引导活动采用了TeleProt框架的不同实例组合(图1;STAR Methods),用于融合进化数据和实验数据。每种方法采用相同的总体策略。首先,在自然NucB同源物、实验数据或两者上拟合模型(图1A)。这提供了采集函数(酶质量的计算机模拟预测器)或新型NucB变体(即训练集中未出现的变体)的采样分布。随后,识别大量高评分候选变体,并采用突变距离限制等保障措施避免超出实验和进化数据分布之外的变体——模型可能在这些区域表现不可靠(图1B)。最后,选择具有期望训练数据外推水平分布的多样化候选子集进行筛选(图1C)。每轮中,将设计预算分配给不同方法组合以增加文库多样性并研究算法选择(图1D)。
使用超高通量微流控平台在pH 7下同时测量大型NucB变体文库的催化活性(图2A)。变体被转化至枯草芽孢杆菌并单独封装在液滴中。生长和蛋白表达后,将核酸酶底物——携带染料和淬灭基团的20-mer双链DNA——注入液滴。核酸酶切割导致染料与淬灭基团分离,增加液滴荧光(见图S28)。由于核酸酶活性与荧光相关,液滴可分选(图2A)以(1)分离表现最佳的变体(图2B)或(2)创建氨基酸序列与对应功能活性的基因型-表型数据集(图2C)。随后使用较低通量测定进一步纯化和验证顶级命中变体。
开展了三个额外活动以提供性质不同的基线(图3A)。独立运行的DE活动包括两轮命中选择和体外诱变,使用相同的超高通量平台(见STAR Methods和图S19)。为更精细评估ML文库的整体组成,还运行了命中重组活动,与ML在所有实验中混合。HR变体在计算机中设计以模拟体外命中堆叠,即对上一轮数据集中排名最高的变体进行重组采样。最后,使用自然NucB同源物模型设计了零样本文库,以研究是否无需先验实验数据即可改善NucB活性。
DE、ML和HR活动均基于相同的初始文库构建,该文库通过对地衣芽孢杆菌野生型NucB序列进行单点饱和突变文库的epPCR生成(见图S29)。DE可获得包含至少211,000个不同epPCR变体的初始数据集,而估算酶活性所需的更高DNA测序读取深度——基于估计变体在分选后与分选前群体中的富集——意味着用于HR和ML的初始数据集仅包含9,400个不同变体(见图S26)。ZS文库不需要初始数据集,改用4,600个同源物。ML活动每轮约含10,000个变体,而HR文库约1,000–2,000个,类似于大规模基于板的高通量酶筛选实验(表S3)。ML模型使用前几代的所有ML和HR数据训练。

ML结合超高通量筛选设计出比DE更高活性的核酸酶
为比较ML与DE的性能,对各文库进行一系列下行选择测定以分离最佳酶变体并表征其性能(见图S8)。首先在依次升高的阈值下分选液滴(图2B),并在琼脂平板上培养所选细胞。随后在液体培养板中评估这些菌落的核酸酶活性。最后,将液体培养板测定中表现最佳的菌株纯化并升级至比活性测定。比活性测定通过比较变体与WT的时间荧光轨迹来测量纯化酶动力学速率的倍数改善(见STAR Methods:核酸酶活性测定)。
图3B显示,经两轮ML引导设计发现的最佳酶(ML3,橙色)显著优于经两轮DE发现的最佳酶(DE3,蓝色;置换检验,p = 0.014)。最佳ML2和ML3变体由基于学习到的神经网络景观的模型优化提出。经过三代约23,000个变体后,ML3发现了(A63P、A73R、D74H和I84Y),其活性提高19倍,优于最佳DE3酶(A63S、D64S和A73R)在pH 7下12倍的活性改善。两者均超过将活性恢复到WT NucB在其最适pH 9下水平的目标:ML3酶显示2.4倍活性改善,而最佳DE3变体显示1.5倍改善(见图S17)。
由于ML和HR文库在每轮中混合,且严格筛选过程仅分离顶级变体,没有HR蛋白被选为纯化对象这一事实表明,HR未发现与ML3和DE3最佳变体活性相当的变体。未从DE2纯化任何变体,因为DE活动独立运行,目标是表征总体最高活性变体。
最佳ML3变体在伤口愈合相关pH下降解生物膜的能力在后续筛选中得到进一步确认。培养了自然产生生物膜的地衣芽孢杆菌,并在中性pH下将生物膜暴露于酶(见STAR Methods)。图3C显示,该变体在各种剂量下均比WT酶更有效地降解这些生物膜。在1μM酶浓度下,其降解了71% ± 2%的生物膜,而WT仅降解13% ± 3%(t检验,p < 1 × 10−15)。

ML发现数百个多样化的高活性命中变体
在三轮活动中实现了两个关键目标:将pH 7下的酶活性提升至超过WT在pH 9下的活性,并证明ML优于DE。为进一步研究ML引导活动的能力,开发了第四轮设计(ML4),目标是发现多样化、高活性的命中变体。维持超出DE的额外多样性是ML引导设计的关键承诺之一。大多数设计活动需要多目标优化,如表达、毒性、免疫原性和稳定性。在不牺牲性能的情况下增加设计多样性可提高变体满足下游筛选中附加属性要求的概率。
以多样性评估ML性能依赖于并行表征大量变体的酶活性。通过每轮混合ML和HR设计,实现了与HR(非ML基线)的头对头比较(图3A)。设计文库的比较基于"命中率"(活性超过给定活性阈值的变体比例)和"多样性"(在给定序列同一性阈值下聚类时的命中簇数量)。为高通量表征命中变体,对分选前和分选后文库进行测序(图2C),计算每个变体的富集因子,并与已知活性的参考酶的同一密码子变体的富集因子经验分布进行比较(见STAR Methods)。变体被标记为比参考酶更具活性。

模型设计的功能变体与模型训练数据存在质的差异
模型设计的变体(绿色)在距离WT的突变距离上远超训练集中所见活性变体(紫色)的距离。将训练集中命中的不同突变可视化,与模型设计的命中变体进行比较。

零样本模型在无实验筛选数据时的表现
没有任何实验筛选数据的情况下,从自然同源物零样本模型采样优于epPCR,能提供初始的多样化命中变体集合,维持并改善NucB功能。通过观察按模型分数排序epPCR文库可初步验证零样本模型。

基因型-表型景观概述
整体数据集包含设计变体和易错PCR变体,在广泛的活性水平范围内提供了许多代表性样本。易错PCR数据集更不平衡。整体数据集包含许多功能变体。


【数据】pH:7;最佳ML3变体突变:A63P、A73R、D74H、I84Y;活性提高:19倍;最佳DE3变体突变:A63S、D64S、A73R;活性提高:12倍;ML3酶pH 9活性改善:2.4倍;DE3变体:1.5倍;1μM酶浓度下生物膜降解率:ML3变体71% ± 2%,WT 13% ± 3%;统计检验:置换检验p = 0.014,t检验p < 1 × 10−15;DE初始数据集:≥211,000个epPCR变体;HR/ML初始数据集:9,400个变体;ZS文库同源物数:4,600个;ML每轮变体数:约10,000个;HR文库规模:约1,000–2,000个
讨论与解读
通过将TeleProt与超高通量微流控筛选平台相结合,成功发现了比NucB WT在pH 7下比活性提高19倍的变体,解锁了在生理pH下降解慢性伤口生物膜的关键需求。高通量数据分析表明发现了大量活性高于A73R(即比WT好8倍以上)的多样化变体。ML活动优于使用相同平台的两个DE方法:一个独立运行并使用标准体外技术进行命中选择和多样化,另一个在计算机中设计并与ML设计文库混合筛选。ZS文库的性能进一步证明,从自然序列拟合的模型采样可生成不仅富集功能变体而且包含适应度改善变体的文库。
综合结果提出了未来使用TeleProt活动的方案建议。首先建议使用ZS设计生成初始变体文库,结果显示ZS设计将产生更大、更多样化的命中变体集合。
编译者解读
本研究展示了机器学习与超高通量筛选平台协同的威力——TeleProt框架的核心优势在于融合进化与实验数据,并通过多样性批次选择规避了传统定向进化的局部最优陷阱。值得关注的是零样本设计的表现:仅凭自然同源物模型即可超越epPCR,这对缺乏先验实验数据的酶工程起步阶段具有实用价值。55,000变体的开放数据集为领域提供了宝贵资源。局限在于实验成本限制了协议方案的全面验证,且CNN分类器采用离散标签可能损失连续活性信息。总体上,该工作为ML引导酶工程设立了新标杆。
DOI: 10.1016/j.cels.2025.101236