蛋白质语言模型赋能定向进化:从零样本预测到高效突变体筛选

来源:Semantic Scholar | 编译:DNA Lab Space

**导语**

定向进化是蛋白质工程的核心策略,但传统方法受限于突变文库的庞大与筛选通量,难以高效探索序列空间。近年来,蛋白质语言模型(PLMs)凭借其对序列-功能关联的深度捕捉,为指导定向进化开辟了新路径。一项发表于 bioRxiv 的预印本研究,系统评估了多种 PLMs 在零样本与微调场景下的突变效应预测能力,并成功将其应用于 TEM-1 β-内酰胺酶的定向进化,实现了耐药性大幅提升的突变体快速发现。该工作不仅展示了计算驱动的进化加速能力,更揭示了 PLMs 在蛋白质设计中的广泛潜力。

研究背景

蛋白质定向进化通过在基因层面引入随机突变并施加选择压力,可在短时间内模拟自然界漫长的进化历程,获得性能改良的工业用酶、治疗性抗体或生物催化元件。然而,序列空间极为浩瀚——对于一个仅由 200 个氨基酸组成的蛋白质,其可能的单突变体数量已达 3800 种,双突变组合则飙升至数百万。传统的易错 PCR 或 DNA 改组所产生的突变文库通常只能覆盖其中极小部分,且需要依赖繁琐的高通量筛选或选择策略,实验成本高昂、周期漫长。

近年来,计算方法的介入显著改变了这一局面。特别是基于深度学习的蛋白质语言模型,借鉴了自然语言处理中的大规模预训练范式,仅从原始蛋白质序列数据中即可学习到氨基酸之间的进化耦合、结构约束与功能特征。ESM-1v、ProtBERT、Tranception 等模型,通过在数亿条天然蛋白质序列上进行自监督训练,具备了“读懂”蛋白质序列语言的能力,能够评估序列的进化似然性或预测突变对功能的扰动。这类零样本(zero-shot)预测无需任何湿实验数据,即可概略性地指出哪些位点对功能重要、哪些突变可能有益,为定向进化提供先验指导。

但 PLMs 在定向进化中的实际表现如何?不同模型的预测精度差异多大?是否能够通过少量实验数据微调显著提升预测能力?这些问题尚缺乏系统性比较。Maguire 等人于 2024 年发表的研究,正是针对这一空白展开,以 TEM-1 β-内酰胺酶为模型系统,检验了多种 PLMs 在筛选高耐药突变体中的效用,并提出了“计算机诱变+组合优化”的高效进化路线。

研究方法

该研究以 TEM-1 β-内酰胺酶为靶蛋白,该酶是细菌对抗 β-内酰胺类抗生素的核心武器,其耐药活性可方便地通过抗生素最小抑菌浓度(MIC)定量测定,是定向进化的经典模型。作者设计了一条整合计算预测与实验验证的闭环技术路线,主要包括以下环节:

**1. 数据收集与突变文库构建**

研究者从文献及数据库中收集了已有实验测定的 TEM-1 单点突变体的功能数据,共计覆盖 500 余个单突变体及其对应的抗生素耐药水平。同时,利用易错 PCR 生成包含约 1.5 × 10⁴ 个独立克隆的随机突变文库,用于后续模型微调与对比。

**2. 蛋白质语言模型的零样本预测**

选取了六种代表性 PLMs,包括 ESM-1v、ESM-2、ProtBERT、Tranception、ProGen2 以及 Ankh。对于 TEM-1 的每一个可能的氨基酸单点替换,分别计算每个模型给出的零样本评分。评分方式基于两种通用框架:一是“遮盖预测得分”,即计算目标位置出现突变氨基酸相对于原始氨基酸的对数几率变化;二是“序列困惑度变化”,即用模型衡量全长突变序列相较于野生型序列的似然度下降幅度。所有评分均被标准化,以利于跨模型比较。

**3. 模型微调与少样本学习**

为评估少量实验数据能否增强预测能力,作者将已有的 500 余条实测数据按照 80/20 随机划分训练与测试集,并对每个 PLM 的输出层或部分 Transformer 层进行参数微调。微调策略包括全模型微调、仅微调顶层注意力头、以及结合卷积预测头的轻量适配。此外,专门测试了在仅有 20、50 或 100 个实验数据点情况下的少样本学习性能。

**4. 高通量实验验证与组合设计**

基于计算预测结果,筛选出零样本评分最高的 100 个单点突变体,以及多模型共识评分最高的 50 个突变体进行合成与 MIC 测定。同时,研究者利用贪婪组合算法,将确认有益的单点突变逐步叠加,构建二突变及三突变组合体;再将高维组合体进行“计算机指数”预筛后,交由实验测试。所有实验均采用肉汤稀释法测定对氨苄青霉素的 MIC。

**5. 结构分析与机理解释**

为理解关键突变的作用机制,对最佳突变体进行同源建模并与野生型结构比较,分析突变导致的活性中心静电分布变化、底物结合口袋构象调整及蛋白稳定性改变。

研究结果

**零样本预测能力差异显著,ESM-1v 表现最佳**

在与 500 余条实验数据的相关性分析中,不同 PLMs 的预测性能呈现较大差异。以 Spearman 相关系数衡量,ESM-1v 取得了最高值(ρ = 0.51),其后依次为 Tranception(ρ = 0.46)、Ankh(ρ = 0.43)。值得注意的是,基于序列遮掩似然度差值的方法普遍优于基于全序列困惑度的评分,表明局部进化约束比全局序列似然更能反映突变的功能影响。零样本预测能够有效识别出强有害突变(负效应)与部分高度有益突变,但对中等效应突变的区分力不足。

**少样本微调显著提升突变效应预测精度**

当引入少量实验数据微调后,模型预测能力大幅提升。仅使用 100 个实测突变体数据微调 ESM-1v,即可将 Spearman 相关系数提升至 0.73,相当于与实验测量的真实功能高度吻合。轻量微调策略(仅微调模型最后两层注意力层+轻量预测头)在保持计算效率的同时,已可接近全模型微调的性能,说明 PLMs 已经编码了丰富且可迁移的序列模式,只需少量适配便可适配特定蛋白质功能预测任务。

**定向进化实验确认计算指南有效性**

在实验验证环节,零样本评分前 100 的突变体中,有 38 个显示出较野生型至少 2 倍的 MIC 增加,阳性率约 38%,远高于随机文库中约 5% 的有益突变比例。多模型共识策略将阳性率进一步提升至 54%。其中,单个突变体 M182T 显示出近 8 倍的耐药性增强,该突变靠近活性位点 Ω-环,推测通过稳定蛋白质构象提升催化效率。

**组合突变突破耐药极限**

通过贪婪叠加策略,研究者构建了组合突变体 M182T/G238S/E104K,其 MIC 较野生型提升了 32 倍,且未出现明显的适应性代价(如生长速率下降)。在计算机预先筛选中,采用逐步组合打分函数——对每一轮叠加的突变体,使用微调后的 ESM-1v 预测组合体得分,排除预测不良的组合,显著减少了实验测试量。从 96 个预设组合中,仅需实验测试 18 个即锁定了最优三重突变体,成功实现了实验室进化数月才能达到的效果,且实验周期缩短至数周。

**结构机制揭示突变协同性**

同源建模分析表明,M182T 位于酶的核心区域,通过引入氢键稳定活性位点附近的构象;G238S 直接作用于底物结合口袋,增加对β-内酰胺环的静电互补;E104K 则通过长程静电网络优化过渡态稳定性。三重突变体呈现正协同效应,单一突变效应在组合中被放大,而 PLM 能够部分捕获这种非线性作用,这归因于自注意力机制对氨基酸间交互的隐式建模。

讨论与展望

该研究系统验证了蛋白质语言模型在指导定向进化中的巨大价值,尤其在资源有限的场景下:仅需一台标准 GPU 服务器和少量实验数据,即可将有益突变富集率提升近 10 倍,显著降低筛选工作量。零样本预测可充当“无代价的初筛”,而少样本微调则能进一步将模型适配到特定功能表型,形成“计算预筛—实验验证—模型迭代”的闭环,逐步逼近全局最优序列。

然而,当前 PLMs 对多点突变协同效应的预测仍不够精准,模型主要捕获了加性效应,对于非加性上位效应(epistasis)的建模能力有限,这需要未来融入结构信息或多序列比对特征以增强。此外,模型的解释性仍有待提高,如何从注意力权重中提取可操作的进化规则,是推动理性蛋白质设计的关键。

展望未来,结合实验自动化平台(如液滴微流控)与主动学习策略,PLMs 有望实现全自动的“自驱动定向进化实验室”,根据预测不确定性主动选择下一批突变体进行测试,在极短周期内跨越长距离的序列空间。生物医药、绿色催化与合成生物学等领域的蛋白质优化,将因此进入高效的新纪元。

**参考来源**

R. Maguire, Kotryna Bloznelyte, Fikayo Adepoju, Matthew Armean-Jones, Shafiat Dewan. *Protein Language Models in Directed Evolution*. bioRxiv, 2024. DOI: [10.1101/2024.08.20.608752](https://doi.org/10.1101/2024.08.20.608752)

DOI: 10.1101/2024.08.20.608752

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12