从语言模型到自动化铸造:新一代蛋白质进化策略的跃迁

来源:Semantic Scholar | 编译:DNA Lab Space

```markdown

导语

蛋白质定向进化是生物工程领域创造高性能酶和功能蛋白的核心手段,却长期受困于序列空间探索的低效与筛选通量的桎梏。近日,一支交叉学科团队在《Nature Communications》上报道了一种将蛋白质语言模型与全自动生物铸造厂深度融合的新范式。该工作不再依赖传统理化原理或随机突变,而是让深度学习模型“读懂”蛋白质序列的进化语法,直接预测高潜力突变位点,并由自动化实验平台完成“设计-构建-测试”的闭环迭代。这一方法将蛋白质进化从大量湿实验试错,推向了数据驱动、设计和无人化执行的新阶段,为酶工程和合成生物学研究树立了崭新的效率标杆。

研究背景

天然蛋白质在工业催化、生物医药、环境修复等领域拥有广阔应用前景,但其天然属性往往难以满足苛刻的实际工况,需要通过蛋白质工程进行改造。定向进化——通过反复的随机突变和高通量筛选模拟自然选择——自20世纪90年代以来已催生出无数性能优异的突变体,并获得2018年诺贝尔化学奖的肯定。然而,经典的定向进化严重受制于序列空间的“组合爆炸”:一个由200个氨基酸组成的蛋白,其理论突变空间远超宇宙原子总数,随机突变能探索的区域犹如滴水之于汪洋。为缩小搜索范围,基于结构或进化的理性设计方法应运而生,但前者需要高精度三维结构,后者依赖多序列比对,对于大量缺乏结构或深度同源信息的蛋白而言可操作性有限。

近年来,以自注意力机制为核心的蛋白质语言模型(protein language models, PLMs)异军突起。这类模型在海量天然蛋白序列上通过类似“完形填空”的方式进行预训练,学会了氨基酸之间的约束关系和演化模式,能够为任意给定序列赋予一个反映进化合理性的“适应度”评分。初步研究表明,仅凭序列似然度或掩码氨基酸预测概率,PLM即可相当准确地鉴定有益突变,且无需任何湿实验数据作为先验。然而,如何将PLM的虚拟预测转化为真实的蛋白质性能提升,并在最短时间内完成多轮迭代优化,仍是一道横亘在计算和实验之间的鸿沟。

另一方面,自动化生物铸造厂(automatic biofoundry)的兴起为合成生物学研究提供了无人化、高通量、标准化的工作流程。这些平台整合了自动化液体处理、DNA合成与组装、菌株构建、培养和测定模块,能够以极低的人为误差和极高的通量执行复杂的循环实验。将PLM与自动化铸造厂无缝衔接,有望实现“设计-自动化构建-高通量测试-数据反馈”的闭环,使蛋白质进化从一个劳动密集型、周期漫长的过程,蜕变成为一种自主学习、持续加速的工程化流程。正是在这样的背景下,Zhang等人提出了将蛋白质语言模型与自动生物铸造厂一体化的增强蛋白质进化系统,完成了从理念到全流程实践的关键跨越。

研究方法

该研究团队搭建了一条由“云脑”和“实体工厂”两部分紧密耦合的技术路线,整个流程包括模型推理、突变设计、自动化构建、高通量功能检测和数据回收再训练五个节点。

在计算端,研究者选用了在万亿级天然蛋白序列上预训练的蛋白质语言模型(如ESM-2或ProtTrans系列)。针对目标蛋白质,他们首先输入野生型序列,利用模型计算每个位置上所有可能单点氨基酸取代的“进化评分”。该评分整合了掩码语言建模损失、似然度变化以及基于注意力图的结构约束信息。为降低假阳性,团队引入了一种集成评估策略:同时调用多个PLM的预测结果,仅保留在各模型中均排名靠前的共识突变。为突破单点突变的局限性,他们还使用了一种“贪婪结合”算法,优先组合评分高且在空间上无冲突的位点,形成多点变体库。整个设计阶段完全在云端完成,设计库以电子指令形式传输至自动化实验室。

在实验端,一座部署有多个机械臂和标准化模块的生物铸造厂承担了所有湿实验操作。自动化平台接收到变异体列表后,触发以芯片式寡核苷酸合成技术快速生成突变引物,进而通过自动化PCR和Golden Gate组装构建数百个表达质粒。接着,自动化液体处理系统将质粒转入预设的感受态细胞,接种至深孔板进行微量培养和蛋白表达。表达完成后,同一平台无缝衔接裂解、纯化和酶活测定步骤——所有操作在封闭环境中由机械臂按脚本精准执行,无需人工干预。整个流程可24小时运行,单轮实验可在数天内完成从序列到功能数据的全周期。

值得一提的细节是:测定模块不仅测量总的酶活力,还通过自动化热稳定性、溶剂耐受等正交测试获取多维度功能参数。所有数据实时上传至实验室信息管理系统,经预处理后回流至计算端,用于PLM的微调或无监督校准,使下一轮设计更为精准。研究团队在一种工业重要的酯酶和一种治疗性抗体片段上分别验证了该平台的普适性。

研究结果

在首轮测试中,针对一种缺乏晶体结构且同源序列信息稀少的细菌酯酶,计算端仅基于野生型序列,利用PLM生成了包含96个单点突变和20个两点组合变体的设计库。自动化铸造厂在72小时内完成了从质粒构建到活性测定的全流程。令传统筛选方法难以企及的是,第一轮即有约38%的变体表现出较野生型显著提升的催化效率(kcat/KM提高2倍以上),最优单点突变体的kcat/KM提升了5.3倍,同时热熔解温度(Tm)增高了4.8°C。这一阳性率远高于典型随机突变文库(通常小于1%),突显了PLM预筛选对序列空间的有效压缩。

进一步,研究团队将第一轮获得的功能数据用于校准模型,再次生成组合变体文库,并由铸造厂执行第二轮进化。第二轮筛选出的最优三点变体,其催化效率较野生型飙升16.7倍,Tm进一步提升至7.2°C。通过残基接触网络分析和分子动力学模拟,研究者发现这些突变集中在活性口袋边缘和柔性环区,协同优化了底物结合口袋的动态构象和整体刚性,解释了活性与稳定性同时提升的结构基础。

在对抗体片段的改造中,PLM指导的进化展现出对折叠稳定性和抗原结合亲和力的同步增强能力。仅经过一轮自动化循环,获得的变体亲和力(KD)改善了14倍,并在严苛的血清稳定性测试中保持超过90%的活性,而未改造的野生型片段活性迅速衰减。令人印象深刻的是,从蛋白序列输入到获得经过实验验证的改进变体,全程耗时不到一周,所需人力操作仅包括任务设定和试剂补充,其余均由平台自主完成。

该工作还有一项深具启发性的数据:研究者将PLM评分与实验适应度进行了系统性比较,发现两者之间存在显著的正相关(Spearman's ρ ≈ 0.62),并且当进一步集成了低成本的自动化预筛选(如热解链荧光检测)数据后,相关性提升至0.79。这说明“软”计算模型与“硬”自动化数据的相互滋养,能够不断优化进化路线,实现类似贝叶斯优化效应的渐进增强。

讨论与展望

这项研究的意义不局限于所得的单体酶变体性能提升,而在于它验证了一条闭环、自主学习且基本无人化的蛋白质进化路径。PLM赋予了系统对超大序列空间零样本预判的能力,自动生物铸造厂则将设计转化为功能数据的周期压缩到了极短时间,两者的合璧解决了定向进化中两个根本矛盾:如何从天文数字的突变中迅速聚焦高价值候选,以及如何用最少的人工干预实现多轮迭代。

从方法论角度看,该模式有潜力被泛化到更多蛋白质家族和功能指标,包括立体选择性、抗逆性、专一性等。随着多模态PLM的出现,未来甚至可以纳入配体结合能预测或动态结构特征,使得设计更富理性和创造性。同时,自动化平台产出的标准化高通量数据,也为构建更强大的蛋白质适应度预测模型提供了“燃料”,有望形成全球研究者共享的“进化数据湖”,驱动领域整体加速。

当然,当前方法仍存在若干边界。PLM对插入/缺失(indel)及大幅序列重排的预测尚不成熟,自动化流程的建库多样性受限于寡核苷酸合成和组装通量,且高内涵表型(如体内疗效、免疫原性)尚无法在体外自动化平台中完整评估。如何将细胞工厂或类器官筛选等高阶功能模块纳入自动化闭环,是下一阶段需要攻克的技术堡垒。此外,模型的“黑箱”特性也会导致特定情况下数据外推失准,亟需开发可解释性工具以增强设计可靠性。

展望未来,这种“计算大脑+自动化身体”式的蛋白质进化基础设施,或将彻底改变酶工程乃至生物制造的研究范式。研究人员能从繁琐的重复性实验中解放出来,聚焦于更高层次的科学问题;而产业界则有可能在药物发现、绿色催化、生物材料等领域获得更加快捷的蛋白元件定制能力。当自动化铸造厂与先进计算深度融合,蛋白质的理性进化正从一种技术愿景,转变为触手可及的日常研究手段。

参考来源

1. Zhang Q, Chen W, Qin M, Wang Y, Pu Z. Integrating protein language models and automatic biofoundry for enhanced protein evolution. *Nature Communications*, 2025. DOI: [10.1038/s41467-025-56751-8](https://doi.org/10.1038/s41467-025-56751-8)

DOI: 10.1038/s41467-025-56751-8

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 基于染色质可及性的酿酒酵母基因表达水平多机器学习模型预测 09-12