SPASE服务器:当AI蛋白质设计遇上溶解度与聚集性双重筛选

来源:Protein Sci | 编译:DNA Lab Space

📎 相关工具:质粒载体构建校验

蛋白质设计正从“能折叠”走向“好用”。一个名为SPASE的自动化网络服务器,把序列生成、溶解度预测、结构建模和聚集倾向评估串成了一条流水线。

2025年,Larda等人在《Protein Science》上报道了这项工具。它的核心逻辑很直接:ProteinMPNN生成的序列不一定溶解性好,那就再加两道关卡——用Protein-Sol预测溶解度,用Aggrescan3D评估聚集倾向。研究者将这套工作流命名为Soluble Protein Analog Selection Engine,简称SPASE,并已将其部署为公开网络服务。

研究背景

设计具有理想生物物理性质的蛋白质——高溶解度、低聚集倾向——是生物技术和生物医学应用的关键前提。过去几年,以ProteinMPNN为代表的深度学习序列设计方法取得了显著成功。这类工具能从蛋白质骨架结构出发,反向设计出能折叠成目标构象的氨基酸序列。

但问题随之而来。ProteinMPNN的直接输出并不总能同时具备最优的溶解度和聚集特性。一条序列可能折叠得很好,却容易在溶液中聚成一团;另一条序列可能溶解度不错,但结构预测置信度偏低。传统上,研究人员需要手动运行多个独立的预测工具,在不同服务器之间来回切换,处理格式不兼容的文件,然后凭经验判断哪些候选序列值得进入湿实验验证。

这个流程繁琐、耗时,且高度依赖个人经验。SPASE的设计初衷,正是把这一系列步骤自动化、标准化,让非计算背景的实验科学家也能轻松完成多维度筛选。

研究方法

SPASE的工作流由五个核心步骤串联而成,每个步骤调用一个专门的工具。

结构标准化。 用户提交蛋白质结构文件(PDB格式)后,系统首先调用PDBFixer进行结构预处理。这一步会执行三项任务:将非标准残基替换为标准氨基酸,补全缺失残基,以及添加缺失的氢原子。加氢过程采用pH 7.4条件下的质子化状态赋值。处理后的结构文件被转换为适合下游ProteinMPNN序列设计的输入格式。

序列库生成。 标准化后的结构被送入ProteinMPNN的可溶性模型(soluble model)。该模型基于Dauparas等人2022年报道的方法,Sumida等人2024年的工作验证了其在可溶性设计中的实用性。系统默认生成10,000条多样化的蛋白质序列变体。用户可以选择在设计中固定特定残基,确保关键的结构或功能位点不被改动——这一选项对保留酶活性中心或结合界面至关重要。

溶解度预测。 每一条生成的变体序列都经过Protein-Sol工具进行溶解度评估。Protein-Sol分析35种基于序列的理化性质,并将这些性质与实验验证的溶解度数据建立相关性模型,从而识别具有增强溶解度潜力的序列。这一工具源自Hebditch等人2017年的工作。

结构预测与置信度评估。 通过溶解度初筛的序列,由ESMFold进行三维结构预测。ESMFold是当前最先进的结构预测工具之一,仅从氨基酸序列即可预测蛋白质的三维坐标,其方法学基础来自Lin等人2023年的报道。预测完成后,系统使用pLDDT(predicted local distance difference test)分数评估每个变体的折叠置信度。pLDDT分数越高,代表模型对该区域结构预测的把握越大。

聚集倾向预测。 最后一道关卡是Aggrescan3D。该工具基于蛋白质的三维结构预测聚集倾向,其原理是识别序列空间中聚集倾向氨基酸的簇——这些簇往往是淀粉样聚集和不可溶聚集体形成的热点区域。

可溶性蛋白类似物选择引擎(SPASE)网站服务器工作流程概述。输入文件包括一个蛋白质结构文件(Protein Data Bank [PDB])和一份用户整理的临界残基列表,这些残基在SPASE优化过程中被排除随机化并保留。提交的PDB结构首先使用PDBFixer进行标准化处理:将非标准残基替换为标准等价残基,添加缺失残基,使用在pH 7.4下分配的质子化状态添加缺失氢原子,并生成适用于下游ProteinMPNN序列设计的输入文件。Protei
▲ 可溶性蛋白类似物选择引擎(SPASE)网站服务器工作流程概述。输入文件包括一个蛋白质结构文件(Protein Data Bank [PDB])和一份用户整理的临界残基列表,这些残基在SPASE优化过程中被排除随机化并保留。提交的PDB结构首先使用PDBFixer进行标准化处理:将非标准残基替换为标准等价残基,添加缺失残基,使用在pH 7.4下分配的质子化状态添加缺失氢原子,并生成适用于下游ProteinMPNN序列设计的输入文件。Protei

整个流程由SPASE服务器自动串联,用户只需提交PDB文件并设置少量参数,即可获得经过多维筛选的候选序列列表。每个候选序列附带其预测溶解度、预测聚集倾向和折叠置信度评分,方便用户按需排序和筛选。

原文摘要未详述服务器运行的具体硬件配置、单次任务的计算耗时,以及各步骤之间的具体阈值筛选标准。这些参数可能因用户提交的蛋白质大小和复杂度而异。

研究结果

SPASE的核心性能评估采用计算基准测试(computational benchmarking)方式。研究者将SPASE的输出与可溶性ProteinMPNN的平均输出进行了系统比较。

基准测试结果显示,SPASE能够富集具有更高预测溶解度和更低预测聚集倾向的蛋白质变体。换言之,经过SPASE筛选的序列池,其整体质量优于ProteinMPNN直接输出的平均水平——在溶解度和聚集性这两个维度上都实现了正向选择。

这一结果并不令人意外,却很有实用价值。SPASE本质上是一个多目标优化框架:ProteinMPNN负责探索序列空间,Protein-Sol和Aggrescan3D分别从两个关键生物物理维度进行过滤,ESMFold和pLDDT则确保筛选出的序列仍然具备可靠的三维结构。四个工具各司其职,形成一个完整的“生成-筛选-验证”闭环。

需要指出的是,原文摘要未提供具体的富集倍数、预测分数分布或对比统计量等数值数据。基准测试的详细结果——包括SPASE筛选前后溶解度分数的具体变化、聚集倾向分数的下降幅度、以及不同蛋白质测试集上的表现差异——原文摘要均未展开。

Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN. (a) Input scaffold structures used to benchmark SPASE: Human Myoglobin Mutant K45R (Protein Data Bank [PDB] 3RGK ), Mouse Claudin‐15 (PDB 4P79 ), and Human Neutrophil Gelatinase‐As
▲ Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN. (a) Input scaffold structures used to benchmark SPASE: Human Myoglobin Mutant K45R (Protein Data Bank [PDB] 3RGK ), Mouse Claudin‐15 (PDB 4P79 ), and Human Neutrophil Gelatinase‐As

研究者同时讨论了该工作流的优势与局限性。在优势方面,SPASE将多个计算工具集成到一个自动化平台中,显著降低了多工具串联使用的技术门槛。在局限性方面,研究者提到了三个关键挑战:蛋白质新颖性问题——即设计序列与天然蛋白质序列的差异程度可能影响预测工具的可靠性;溶解度预测的准确性边界——基于序列的预测方法对某些蛋白质类别可能系统性偏差;以及聚集倾向评估的固有难度——聚集行为本质上高度依赖溶液条件和蛋白质浓度,静态结构基础上的预测难以覆盖动态聚集过程。

Protein‐Sol solubility, Aggrescan3D aggregation, and ESMFold pLDDT distribution of Soluble Protein Analog Selection Engine (SPASE)‐generated candidates. (a) Protein‐Sol solubility score distribution of SPASE outputs for the three scaffolds (PDB 3RGK , PDB 4P79 , and PDB 1DFV ) compared to the distri
▲ Protein‐Sol solubility, Aggrescan3D aggregation, and ESMFold pLDDT distribution of Soluble Protein Analog Selection Engine (SPASE)‐generated candidates. (a) Protein‐Sol solubility score distribution of SPASE outputs for the three scaffolds (PDB 3RGK , PDB 4P79 , and PDB 1DFV ) compared to the distri

这些讨论指向一个更本质的问题:计算预测终究是实验的预筛,而非替代。SPASE的价值在于帮助研究人员从数万条候选序列中优先选出最值得进入湿实验验证的少数几条,从而节省时间和成本。

讨论与展望

SPASE的定位很清晰:一个实用的、可访问的候选序列优先排序平台。它不试图替代实验验证,而是把实验资源投向最有可能成功的候选者。

从工具整合的角度看,SPASE做了一个聪明的选择。ProteinMPNN、Protein-Sol、ESMFold和Aggrescan3D都是各自领域内经过广泛验证的成熟工具,SPASE没有重新发明轮子,而是把轮子装成了一辆车。这种集成策略降低了单个工具误判的风险——如果一个预测器出现偏差,其他几个维度的评分仍然可以提供交叉验证。

局限性同样明显。溶解度预测和聚集预测都是公认的难题,目前的计算方法远未达到完美。SPASE的筛选结果应当被理解为“计算优先排序”,而非“实验保证”。此外,服务器依赖ESMFold对每条候选序列进行结构预测,对于大型蛋白质或超长序列,计算开销可能相当可观。

SPASE已公开部署在https://proteinengineering.ca/,任何研究人员都可以免费使用。随着更多用户提交不同类别的蛋白质底物,这套工作流的适用边界和失败模式将逐渐清晰。未来的改进方向可能包括引入更精确的溶解度预测模型、支持多构象输入,以及整合分子动力学模拟来评估构象动态对聚集倾向的影响。

参考来源

Larda ST, Paré A, Doucet N. Soluble protein analog selection engine (SPASE): An automated AI-powered server to improve protein engineering workflows. Protein Science, 2025. PMID: 42560022.

PMID: 42560022

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 基于染色质可及性的酿酒酵母基因表达水平多机器学习模型预测 09-12