SPASE服务器实现蛋白质工程智能序列筛选

来源:Protein Sci | 编译:DNA Lab Space

📎 相关工具:质粒载体构建校验

蛋白质设计正从“手工改造”走向“计算驱动”。但一个尴尬的问题摆在研究者面前——深度学习模型生成的海量序列,未必个个都“好用”。有的能折叠,却容易聚成一团;有的溶解度不错,结构却一塌糊涂。如何从成千上万个候选序列中挑出真正值得进实验室的那几个?加拿大研究者给出的答案是:把多个AI工具串成一条自动化流水线。

研究背景

设计具有理想理化性质(如高溶解度、低聚集倾向)的蛋白质,是生物技术和生物医学应用的关键前提。传统的理性设计和定向进化耗时费力,而基于深度学习的方法为蛋白质序列设计带来了范式转变。其中,ProteinMPNN作为一款优秀的序列设计工具,能够根据蛋白质骨架结构反向生成氨基酸序列,在近年来的研究中表现抢眼。

然而,ProteinMPNN的直接输出并不总是令人满意。它生成的部分序列可能在溶解度或聚集性质上表现欠佳。换句话说,模型擅长“设计出能折叠的序列”,却未必擅长“设计出好用的蛋白质”。溶解度低、容易聚集的候选蛋白,即使结构预测得分很高,也往往在实验阶段就宣告失败——表达不出来、纯化不了、储存不稳定。

针对这一痛点,加拿大蒙特利尔大学的研究团队开发了SPASE(Soluble Protein Analog Selection Engine,可溶性蛋白类似物筛选引擎)。这是一个自动化网络服务器,将ProteinMPNN与两个专业预测工具——Protein-Sol(溶解度预测)和Aggrescan3D(聚集倾向预测)——整合为一条完整的工作流程。相关成果发表于《Protein Science》期刊(PMID: 42560022)。

SPASE的定位很明确:不是替代ProteinMPNN,而是给它加一道“质检关”。该服务器自动生成大量蛋白变体,预测每个候选的溶解度,用ESMFold建模三维结构,再综合溶解度、聚集倾向和折叠置信度进行打分排序。计算基准测试表明,SPASE筛选出的蛋白类似物,其预测溶解度和聚集倾向均优于soluble ProteinMPNN的平均输出。

研究方法

SPASE的工作流程可分为六个关键步骤,每一步都有明确的技术工具和参数设定。服务器公开访问地址为 https://proteinengineering.ca/。

第一步:结构标准化处理

用户提交蛋白质结构文件(PDB格式)后,SPASE首先调用PDBFixer工具对结构进行标准化处理。这一步骤包含三个核心操作:将非标准残基替换为标准氨基酸残基、补全缺失残基、添加缺失氢原子。值得注意的是,氢原子的添加基于pH 7.4条件下的质子化状态赋值。这一标准化过程为后续的序列设计准备了干净、完整的输入文件。

第二步:大规模序列变体生成

标准化后的结构被送入ProteinMPNN的可溶性模型(soluble model)。该模型基于深度学习方法,能够根据蛋白质骨架结构反向设计氨基酸序列。SPASE在此步骤中生成一个包含10,000个序列变体的大规模文库。用户可以根据实验需求,选择在设计中保守特定的残基位置,确保关键的结构或功能位点不被改变。

这一参数设置值得关注——10,000个变体并非随意选择的数字。数量太少,序列多样性不足;数量太多,后续计算成本急剧上升。这一文库规模在多样性和计算开销之间取得了平衡。

第三步:溶解度预测

每个生成的变体序列都被送入Protein-Sol工具进行溶解度预测。Protein-Sol分析35种基于序列的理化性质,并将这些性质与实验验证过的溶解度数据进行相关性分析,从而识别具有增强溶解度的序列。这35种性质涵盖了氨基酸组成、电荷分布、疏水性等多个维度,为溶解度评估提供了较为全面的视角。

原文摘要未详述这35种性质的具体清单及权重分配,但该方法已在多项独立研究中得到验证。

第四步:三维结构预测

ESMFold被用于从氨基酸序列预测蛋白质变体的三维坐标。这是一个纯序列到结构的过程——只需输入氨基酸序列,无需任何模板或共进化信息。ESMFold作为当前最先进的结构预测工具之一,其预测速度远快于传统的多序列比对方法,适合处理SPASE生成的大规模变体文库。

第五步:折叠置信度评估

预测得到的结构使用pLDDT(predicted local distance difference test)分数进行评估。pLDDT是AlphaFold系列模型常用的置信度指标,用于估计每个残基位置的结构预测可靠程度。在SPASE的流程中,pLDDT分数被用作折叠置信度的代理指标——分数越高,代表该变体越可能形成稳定折叠的结构。

第六步:聚集倾向预测

最后,Aggrescan3D被整合到工作流程中,基于变体的三维结构预测其聚集倾向。Aggrescan3D能够在蛋白质结构表面识别聚集倾向氨基酸的簇(clusters of aggregation-prone amino acids),这些簇往往是蛋白质发生异常聚集的“热点区域”。通过识别这些区域,SPASE能够筛选出聚集风险较低的候选变体。

六个步骤环环相扣,构成了一条完整的自动化筛选流水线。从原始PDB结构输入,到经过溶解度、结构、聚集三重筛选的候选列表输出,整个过程无需人工干预。

Overview of the Soluble Protein Analog Selection Engine (SPASE) webserver workflow. A protein structure file (Protein Data Bank [PDB]) and a user‐curated list of critical residues, which are excluded from randomization and preserved throughout the SPASE optimization process, are provided as input. S
▲ Overview of the Soluble Protein Analog Selection Engine (SPASE) webserver workflow. A protein structure file (Protein Data Bank [PDB]) and a user‐curated list of critical residues, which are excluded from randomization and preserved throughout the SPASE optimization process, are provided as input. S

研究结果

SPASE的核心价值在于其筛选效果。计算基准测试给出了明确的答案:SPASE富集的蛋白类似物,其预测溶解度高于soluble ProteinMPNN的平均输出,预测聚集倾向则低于后者。这意味着,经过SPASE筛选的候选序列,在计算层面上比ProteinMPNN的“平均水准”更优。

具体到数据层面,原文摘要未提供SPASE筛选前后溶解度或聚集倾向的具体数值变化。但基准测试的结论方向是明确的——SPASE不是简单地“换个工具重新预测”,而是通过多工具串联的筛选策略,系统性提升了候选序列的质量。

从工作流程的合理性来看,SPASE的设计逻辑值得注意。它没有把三个工具的结果简单加权平均,而是按照“序列设计→溶解度初筛→结构预测→聚集评估”的顺序逐步筛选。这种级联式的策略有其内在合理性:溶解度预测只需序列信息,计算成本低,适合作为初筛;结构预测和聚集倾向预测需要三维结构信息,计算成本高,适合作为精细筛选。

Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN. (a) Input scaffold structures used to benchmark SPASE: Human Myoglobin Mutant K45R (Protein Data Bank [PDB] 3RGK ), Mouse Claudin‐15 (PDB 4P79 ), and Human Neutrophil Gelatinase‐As
▲ Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN. (a) Input scaffold structures used to benchmark SPASE: Human Myoglobin Mutant K45R (Protein Data Bank [PDB] 3RGK ), Mouse Claudin‐15 (PDB 4P79 ), and Human Neutrophil Gelatinase‐As

SPASE的优势还体现在其集成性和可访问性上。作为一个网络服务器,它免去了用户自行安装配置多个工具的技术门槛。研究者只需提交PDB文件,就能获得经过综合评分的候选序列列表。这种“一站式”服务模式,大大降低了计算蛋白质设计的入门门槛。

当然,SPASE也有其局限性。研究者在论文中讨论了与蛋白质新颖性、溶解度预测和聚集评估相关的挑战。蛋白质新颖性是一个关键问题——如果用户提交的蛋白质结构在训练集中有高度相似的序列,预测结果可能过于乐观;而对于全新的、训练集中没有的蛋白质折叠类型,预测可靠性会打折扣。溶解度预测方面,Protein-Sol的35种序列特征虽然覆盖面广,但实验溶解度数据本身的异质性可能影响模型训练效果。聚集评估方面,Aggrescan3D基于三维结构预测聚集倾向,而预测结构本身存在不确定性,这种误差会向后传递。

Protein‐Sol solubility, Aggrescan3D aggregation, and ESMFold pLDDT distribution of Soluble Protein Analog Selection Engine (SPASE)‐generated candidates. (a) Protein‐Sol solubility score distribution of SPASE outputs for the three scaffolds (PDB 3RGK , PDB 4P79 , and PDB 1DFV ) compared to the distri
▲ Protein‐Sol solubility, Aggrescan3D aggregation, and ESMFold pLDDT distribution of Soluble Protein Analog Selection Engine (SPASE)‐generated candidates. (a) Protein‐Sol solubility score distribution of SPASE outputs for the three scaffolds (PDB 3RGK , PDB 4P79 , and PDB 1DFV ) compared to the distri

讨论与展望

SPASE的出现在蛋白质工程工具链中填补了一个明确的空缺。目前,序列设计工具(如ProteinMPNN)、结构预测工具(如ESMFold)、性质预测工具(如Protein-Sol和Aggrescan3D)各自独立发展,但将它们整合为自动化工作流的尝试并不多见。SPASE的意义不在于发明了新算法,而在于把这些算法有机地串联起来,形成一条可复用的筛选流水线。

从实际应用角度看,SPASE的价值在于“降本增效”。实验验证一个蛋白质候选需要经历基因合成、表达、纯化、表征等多个环节,每个环节都耗时耗钱。如果能在计算阶段就过滤掉大概率“不好用”的候选,实验资源的利用效率将大幅提升。SPASE正是这样一个“计算预筛”工具,它不能替代实验验证,但能让实验验证更聚焦于有潜力的候选。

论文作者在讨论中也坦承了当前工作流程的局限。蛋白质新颖性、溶解度预测准确性、聚集评估可靠性——这三个问题本质上是计算蛋白质设计领域的共性挑战。SPASE提供了一个集成平台来应对这些挑战,但并不能彻底解决它们。未来的改进方向可能包括:引入更多维度的性质预测(如表达量预测、稳定性预测)、开发针对特定蛋白质类别的定制化筛选策略、以及利用实验反馈数据持续优化筛选标准。

SPASE目前已公开上线,任何研究者都可以通过 https://proteinengineering.ca/ 访问。对于一个旨在降低技术门槛的工具而言,这种开放性本身就是一种态度——计算蛋白质设计不应只是少数专业实验室的“特权”,而应成为整个生命科学研究社区的公共基础设施。

参考来源: Larda ST, Paré A, Doucet N. Soluble protein analog selection engine (SPASE): An automated AI-powered server to improve protein engineering workflows. Protein Science, 2025. PMID: 42560022.

PMID: 42560022

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12