SPASE:计算驱动的可溶性蛋白变体自动筛选平台

来源:Protein Sci | 编译:DNA Lab Space

📎 相关工具:高级引物设计工具

蛋白质工程领域迎来了一位新成员——SPASE(Soluble Protein Analog Selection Engine)。这个自动化网络服务器将ProteinMPNN序列设计与多种生物物理性质预测工具整合为一条流水线,专门解决深度学习设计产物溶解性和聚集倾向不佳的痛点。平台免费开放,访问入口为https://proteinengineering.ca/。

研究背景

设计具有理想生物物理性质的蛋白质,尤其是高溶解性和低聚集倾向,对生物技术和生物医学应用至关重要。溶解性差的蛋白质难以表达纯化,聚集倾向高的蛋白质则可能在储存、运输或体内应用中失效。这些问题长期困扰着蛋白质工程研究者。

深度学习方法的兴起为蛋白质序列设计带来了新可能。ProteinMPNN作为其中的代表,在蛋白质序列设计领域表现出色,能够根据给定的蛋白质骨架结构反向设计氨基酸序列。然而,直接输出的序列并不总能同时具备最优的溶解性和聚集特性。换句话说,序列设计成功了,但产物的"可制造性"和"稳定性"可能不过关。

一个自然的解决方案是:在设计之后增加一轮筛选。SPASE正是基于这一思路构建的——它不取代ProteinMPNN,而是为ProteinMPNN的输出加装了一道质量关卡。该工作由Larda ST、Paré A和Doucet N完成,发表于《Protein Science》期刊。

研究方法

SPASE的工作流程由多个计算工具串联而成,每个环节承担特定任务。整个流程从用户提交的蛋白质结构文件(PDB文件)开始,到输出经过筛选的候选变体列表结束。

结构标准化。 提交的蛋白质结构首先经过PDBFixer处理。这一步骤的作用是替换非标准残基为标准残基、补充缺失残基、添加缺失氢原子——氢原子的添加基于pH 7.4条件下的质子化状态。处理后的结构文件被转换为适合下游ProteinMPNN序列设计的输入格式。原文摘要未详述PDBFixer的具体参数设置。

序列库生成。 标准化后的结构被送入ProteinMPNN的可溶性模型(soluble model),生成包含10,000个多样化蛋白质序列变体的候选库。这一数量级保证了序列多样性,为后续筛选提供了足够的搜索空间。用户还可以在设计中指定需要保守的特定残基,确保关键结构位点或功能位点不被改变。这一功能对保持蛋白质原有功能至关重要——盲目全序列重设计很可能破坏活性中心。

溶解性预测。 每个生成的变体随后经过Protein-Sol工具进行溶解性预测。Protein-Sol分析35种基于序列的特征,并将这些特征与实验验证的溶解性数据进行相关性分析,从而识别具有增强溶解性的序列。这一步骤相当于给每个候选序列打了一个"溶解性预估分"。

结构预测。 ESMFold——当前最先进的结构预测工具之一——被用于仅从氨基酸序列预测蛋白质变体的三维坐标。这一步的产出是后续筛选所必需的:没有结构信息,聚集倾向预测便无从谈起。

折叠置信度评估。 预测结构使用pLDDT(predicted local distance difference test)分数进行评估。pLDDT是AlphaFold系列中常用的置信度指标,数值越高代表该区域的预测结构越可信。SPASE利用这一分数估算每个变体的折叠置信度。

聚集倾向预测。 流程的最后一步由Aggrescan3D完成。该工具基于蛋白质三维结构预测聚集倾向,识别聚集倾向氨基酸的簇。聚集倾向高的变体在这一环节会被扣分或淘汰。

综合评分与筛选。 所有变体根据预测溶解性、聚集倾向和折叠置信度三个维度进行综合评分。最终输出的候选列表是这三个指标的综合优化结果,而非单一指标的极端值。

Overview of the Soluble Protein Analog Selection Engine (SPASE) webserver workflow. A protein structure file (Protein Da
▲ Overview of the Soluble Protein Analog Selection Engine (SPASE) webserver workflow. A protein structure file (Protein Da

原文摘要未详述各工具的具体运行参数(如Protein-Sol的阈值设定、Aggrescan3D的窗口大小、pLDDT的截断分数等),也未说明综合评分的加权方式。这些细节可能涉及平台的商业或知识产权考量,也可能因版本更新而变化。

研究结果

SPASE的核心结果来自计算基准测试(computational benchmarking)。研究团队将SPASE的筛选输出与可溶性ProteinMPNN的平均输出进行了对比。

基准测试表明,SPASE富集了具有更高预测溶解性和更低预测聚集倾向的蛋白质变体。这意味着,经过SPASE筛选的候选池,其整体质量优于ProteinMPNN直接输出的平均水平。原文摘要未提供具体的富集倍数、分数提升幅度或变体数量等定量数据。

这一结果的意义在于:SPASE并非简单地"生成"更好的序列,而是通过多维度打分将已有的序列空间重新排序,把更有可能成功表达和保持稳定的候选推到前列。对于下游实验筛选而言,这意味着可以用更少的实验次数覆盖更高质量的设计空间。

Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN.
▲ Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN.

研究团队也坦诚讨论了工作流程的优势与局限。挑战之一与蛋白质新颖性有关——深度学习模型生成的序列可能偏离天然序列空间,这会影响溶解性预测和聚集倾向评估的准确性。毕竟,Protein-Sol和Aggrescan3D的训练数据来自已知蛋白质,面对全新序列时,预测的置信度可能下降。

另一个挑战涉及溶解性预测和聚集评估本身的精度。这些计算工具提供的是预测值而非实验测量值,预测误差会传导到最终评分中。SPASE的价值不在于消除这些误差,而在于将多种预测工具的误差来源整合在一起,通过多指标交叉筛选降低单一工具误判的风险。

Protein‐Sol solubility, Aggrescan3D aggregation, and ESMFold pLDDT distribution of Soluble Protein Analog Selection Engi
▲ Protein‐Sol solubility, Aggrescan3D aggregation, and ESMFold pLDDT distribution of Soluble Protein Analog Selection Engi

讨论与展望

SPASE的定位很明确:一个实用、可及的计算平台,用于在实验评估之前对蛋白质工程候选进行优先级排序。它不替代实验验证,而是让实验资源用在更有希望成功的候选上。

从工作流程设计来看,SPASE选择了"先设计、再筛选"的路线,而非端到端的生成式模型。这种模块化架构有一个好处:每个环节都可以独立更新。ProteinMPNN、ESMFold、Aggrescan3D等工具各自迭代升级时,SPASE只需替换对应模块即可整体受益。

平台以网页服务器形式公开部署,降低了使用门槛。研究者只需提供PDB文件,无需本地配置深度学习环境,即可完成从序列设计到多性质评估的全流程。这种可及性对中小实验室尤其有价值。

一个值得关注的方向是SPASE与其他蛋白质设计工具的组合使用。比如,将SPASE的输出作为起始点,再进行定点突变或定向进化,可能进一步优化候选的理化性质。原文摘要未提及此类延伸应用,但这符合模块化设计工具的通用使用逻辑。

参考来源

Larda ST, Paré A, Doucet N. Soluble protein analog selection engine (SPASE): An automated computational server to improve protein engineering workflows. Protein Science, 2025. PMID: 42560022.

PMID: 42560022

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12