SPASE服务器:AI驱动的可溶性蛋白变体自动筛选平台

来源:Protein Sci | 编译:DNA Lab Space

📎 相关工具:论文撰写

蛋白质设计正从“手工改造”迈向“计算驱动”的时代。但一个尴尬的问题摆在研究者面前——深度学习模型生成的序列,未必天生就具备良好的溶解性和抗聚集特性。加拿大研究者开发了一款名为SPASE的自动化网络服务器,把序列设计、溶解度预测、结构建模和聚集倾向评估整合进一条流水线,为蛋白质工程提供了一站式解决方案。

研究背景

具有高溶解度和低聚集倾向的蛋白质,是生物技术和生物医学应用的理想起点。然而,天然蛋白质往往并不完美——许多候选蛋白在表达过程中容易形成包涵体,或在储存和运输过程中发生聚集失活。传统的蛋白质工程改造依赖理性设计和定向进化,前者需要深入的 structural 信息,后者则需要高通量筛选体系,两者都耗时费力。

深度学习方法为蛋白质序列设计带来了革命性变化。ProteinMPNN作为其中的代表,能够基于蛋白质骨架结构反向设计氨基酸序列,在多项基准测试中表现出色。但问题在于,ProteinMPNN的“成功”标准主要是序列恢复率和结构可行性,并非直接优化生物物理性质。换句话说,模型输出的序列虽然可能在结构上合理,却未必拥有理想的溶解性和聚集特性——而这些性质恰恰是下游应用的关键考量。

SPASE(Soluble Protein Analog Selection Engine,可溶性蛋白类似物选择引擎)正是为解决这一缺口而设计。它把ProteinMPNN与两个专门工具——Protein-Sol(溶解度预测)和Aggrescan3D(聚集倾向预测)——整合在一起,再辅以ESMFold进行结构建模,构建了一个从单条输入结构到候选变体列表的自动化工作流。

研究方法

SPASE的工作流程可以拆解为五个核心步骤,每一步都承担明确的职能。

输入处理与标准化。 用户提交一个蛋白质结构文件(PDB格式)。服务器首先调用PDBFixer对结构进行标准化处理:将非标准残基替换为标准氨基酸,补齐缺失残基,并根据pH 7.4条件下的质子化状态添加缺失的氢原子。这一步的输出是适合下游ProteinMPNN序列设计的高质量输入文件。原文摘要未详述PDBFixer的具体参数设置,但标准化处理是确保后续计算一致性的必要前提。

大规模序列变体生成。 经过标准化的结构被送入ProteinMPNN的可溶性模型(soluble model)。该模型基于大规模蛋白质数据集训练,能够针对给定骨架结构生成多样化的氨基酸序列。SPASE默认生成10,000个序列变体——这是一个相当大的文库规模,足以覆盖广阔的序列空间。用户还可以指定某些残基在设计中必须保守,这对于维持蛋白质的催化活性位点或结合界面等关键功能区域至关重要。原文摘要未详述10,000个变体的生成是否涉及温度采样参数或重复次数,但这一数量级为后续筛选提供了充足的多样性基础。

溶解度预测。 每个生成的变体序列随即被提交给Protein-Sol工具。Protein-Sol分析35种基于序列的特征,并将这些特征与实验验证的溶解度数据建立相关性模型,从而为每个序列输出一个预测溶解度分数。这一步骤的意义在于,它直接针对“可溶性”这一目标性质进行筛选,而非仅仅依赖序列设计的合理性。

结构建模与置信度评估。 溶解度预测只是第一道筛选。接下来,ESMFold——一种基于蛋白质语言模型的最先进结构预测工具——被用来从每个变体的氨基酸序列出发,预测其三维坐标。ESMFold的优势在于它完全基于序列进行预测,无需进化同源信息,因此特别适合处理ProteinMPNN生成的全新序列。预测完成后,每个变体的结构质量用pLDDT(predicted local distance difference test)分数来评估,该分数反映了模型对每个残基位置折叠置信度的估计。pLDDT分数为后续筛选提供了结构可靠性的量化指标。

聚集倾向预测。 最后一道计算关卡是Aggrescan3D。该工具基于变体的三维结构,识别聚集倾向氨基酸的簇——这些区域往往是蛋白质在溶液中发生非特异性聚集的驱动因素。Aggrescan3D的输出为每个变体提供了一个聚集倾向分数,用于衡量其在溶液中的稳定性风险。原文摘要未详述Aggrescan3D的具体评分阈值或窗口参数,但该工具的整合使得SPASE能够同时从溶解度和聚集两个维度对候选变体进行排序。

Overview of the Soluble Protein Analog Selection Engine (SPASE) webserver workflow. A protein structure file (Protein Data Bank [PDB]) and a user‐curated list of critical residues, which are excluded from randomization and preserved throughout the SPASE optimization process, are provided as input. S
▲ Overview of the Soluble Protein Analog Selection Engine (SPASE) webserver workflow. A protein structure file (Protein Data Bank [PDB]) and a user‐curated list of critical residues, which are excluded from randomization and preserved throughout the SPASE optimization process, are provided as input. S

整个流程完全自动化,用户只需提交结构文件并设置少量参数(如保守残基),服务器即可完成从序列生成到多维度评分的所有步骤。最终,SPASE根据三个指标——预测溶解度、预测聚集倾向和折叠置信度——对变体进行综合排序,输出一个优先候选列表供实验验证。

研究结果

SPASE的核心价值在于其筛选能力是否真正优于直接使用ProteinMPNN的输出。研究团队通过计算基准测试对此进行了验证。

基准测试的结果清晰:SPASE筛选出的蛋白质变体,其预测溶解度高于可溶性ProteinMPNN输出的平均水平,而预测聚集倾向则低于该平均水平。这意味着SPASE的整合工作流确实起到了“富集”作用——它不仅仅是在ProteinMPNN的随机输出中挑选,而是通过多维度评分体系,系统地偏向那些在溶解性和聚集性方面表现更优的序列。

具体数值方面,原文摘要未提供SPASE与ProteinMPNN之间溶解度分数或聚集倾向分数的量化差异。但“富集”(enriches)这一表述表明,经过SPASE打分排序后,排名靠前的变体在预测性质上形成了可分辨的梯度——这正是筛选工具应有的表现。

Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN. (a) Input scaffold structures used to benchmark SPASE: Human Myoglobin Mutant K45R (Protein Data Bank [PDB] 3RGK ), Mouse Claudin‐15 (PDB 4P79 ), and Human Neutrophil Gelatinase‐As
▲ Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN. (a) Input scaffold structures used to benchmark SPASE: Human Myoglobin Mutant K45R (Protein Data Bank [PDB] 3RGK ), Mouse Claudin‐15 (PDB 4P79 ), and Human Neutrophil Gelatinase‐As

研究团队同时讨论了这一工作流的优势与局限。优势方面,SPASE把多个独立工具整合为一个无缝流程,降低了用户的操作门槛。研究者不需要分别运行序列设计、溶解度预测、结构预测和聚集预测,也不需要编写脚本在不同工具之间传递数据——SPASE自动完成了这一切。

局限方面,作者指出了三个关键挑战。第一是蛋白质新颖性问题——ProteinMPNN和ESMFold都是在已知蛋白质数据上训练的,对于与训练集差异过大的全新折叠或全新序列空间,预测可靠性可能下降。第二是溶解度预测的准确性——Protein-Sol虽然基于35种序列特征,但溶解度本身受表达宿主、温度、缓冲液条件等多种实验因素影响,计算预测与实际实验结果之间可能存在偏差。第三是聚集评估的复杂性——Aggrescan3D基于结构预测聚集倾向,但预测结构的准确性依赖于ESMFold的置信度,如果pLDDT分数较低,聚集预测的可信度也会受到影响。

Protein‐Sol solubility, Aggrescan3D aggregation, and ESMFold pLDDT distribution of Soluble Protein Analog Selection Engine (SPASE)‐generated candidates. (a) Protein‐Sol solubility score distribution of SPASE outputs for the three scaffolds (PDB 3RGK , PDB 4P79 , and PDB 1DFV ) compared to the distri
▲ Protein‐Sol solubility, Aggrescan3D aggregation, and ESMFold pLDDT distribution of Soluble Protein Analog Selection Engine (SPASE)‐generated candidates. (a) Protein‐Sol solubility score distribution of SPASE outputs for the three scaffolds (PDB 3RGK , PDB 4P79 , and PDB 1DFV ) compared to the distri

这些讨论并非否定SPASE的价值,而是为使用者提供了合理的预期管理。任何计算工具都只是优先排序的手段,最终仍需实验验证来确认候选变体的实际性能。

讨论与展望

SPASE的定位很明确:它是一个候选筛选平台,而非最终决策工具。它的价值在于把计算设计的产出从“大量序列”压缩为“优先验证清单”,让实验人员把有限的资源集中在最有希望的候选上。

这种整合思路值得关注。蛋白质工程的计算工具并不少,但单个工具解决单个问题——序列设计、溶解度预测、结构预测、聚集评估各有专门软件。SPASE的贡献在于把这些工具串联成一个自动化的决策链,让多维度评估成为标准流程而非额外负担。

当然,SPASE仍有改进空间。蛋白质新颖性问题暗示了当前深度学习方法的边界——它们擅长在已知蛋白质空间的邻近区域进行探索,但面对全新折叠时预测能力受限。未来若能整合更强大的生成模型或引入实验反馈循环,SPASE的筛选精度有望进一步提升。

SPASE服务器已在https://proteinengineering.ca/公开开放,任何研究者都可以免费使用。这种可访问性对于推动蛋白质工程的民主化具有重要意义——小型实验室无需搭建复杂的计算基础设施,也能获得与大型研究机构相当的设计筛选能力。

参考来源:Larda ST, Paré A, Doucet N. Soluble protein analog selection engine (SPASE): An automated AI-powered server to improve protein engineering workflows. Protein Science. PMID: 42560022.

PMID: 42560022

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12