SPASE:计算驱动的可溶性蛋白变体自动筛选服务器

来源:Protein Sci | 编译:DNA Lab Space

📎 相关工具:论文撰写

把一段氨基酸序列交给计算,几小时后拿到一万个候选变体——哪个溶解性好、哪个不容易聚集、哪个能稳定折叠?过去,这些问题要靠实验逐一验证,费时费力。如今,一个名为SPASE的自动化网络服务器试图把这一流程全部搬到线上。2025年,加拿大研究者Larda等人在《Protein Science》杂志报道了这一工具,它整合了序列设计、溶解度预测、结构建模和聚集倾向评估,为蛋白质工程提供了一条全自动化的筛选流水线。

研究背景

设计具有理想生物物理性质的蛋白质——高溶解度、低聚集倾向——是生物技术和生物医学应用的核心需求。无论是开发治疗性抗体、工业酶,还是设计生物传感器,蛋白质的溶解性和聚集行为往往决定了其能否在实际环境中发挥作用。聚集不仅导致蛋白质失活,还可能引发免疫原性反应,这是药物开发中的常见障碍。

深度学习方法的兴起为蛋白质序列设计带来了革命性变化。ProteinMPNN作为其中的代表,能够基于蛋白质骨架结构快速生成大量候选序列。然而,这类方法的直接输出并不总是具备最优的溶解性和聚集特性。换句话说,计算设计的序列虽然能折叠成目标结构,但“能折叠”不等于“好用”——有些变体可能一表达就沉淀,有些则在溶液中自发聚集成团。

要解决这个问题,就需要在序列设计之后增加一道筛选工序。但筛选什么、怎么筛选、依据什么标准?单靠实验试错显然效率太低。SPASE的设计思路正是把多个计算工具串联起来,形成一个自动化的流水线:设计序列→预测溶解度→预测结构→评估聚集倾向→综合打分。用户只需上传一个蛋白质结构文件,服务器就会返回一批经过多重筛选的候选变体。

研究方法

SPASE的工作流程分为五个主要步骤,每一步都调用一个专门的计算工具。研究者将这一流程设计为完全自动化的网络服务,用户交互仅限于上传文件和接收结果。

结构标准化。 用户提交的蛋白质结构首先经过PDBFixer处理。这一步的目标是让原始结构文件适合后续的序列设计计算。PDBFixer执行的操作包括:将非标准残基替换为标准氨基酸、补全缺失的残基、以pH 7.4条件下的质子化状态添加缺失的氢原子,并生成适合ProteinMPNN输入的格式文件。这一预处理步骤虽然看似琐碎,却至关重要——PDB文件中常见的缺失原子或非常规残基如果未经处理,可能导致后续计算产生错误结果。

序列变体生成。 标准化后的结构被送入ProteinMPNN的可溶性模型(soluble model)。该模型基于深度学习架构,能够根据蛋白质骨架坐标反推氨基酸序列。SPASE默认生成10,000个序列变体,这一数量级足以覆盖广阔的序列空间。用户还可以指定某些残基在设计中保持不变,这对于保留蛋白质的催化活性位点或结合界面尤为重要。原文摘要未详述具体参数设置,但这一选项的存在意味着用户可以根据自己的需求在“序列多样性”和“功能保守性”之间做出权衡。

溶解度预测。 每个生成的变体序列随后通过Protein-Sol工具进行溶解度预测。Protein-Sol分析35种基于序列的特征,并将这些特征与实验验证的溶解度数据建立相关性,从而为每条序列输出一个预测溶解度分数。这一步骤的计算成本相对较低,因为它仅基于序列信息,不涉及三维结构。

结构预测。 溶解度预测筛选出的候选序列需要进一步评估其折叠能力。SPASE调用ESMFold,这是一个端到端的深度学习结构预测工具,能够仅从氨基酸序列预测蛋白质的三维坐标。这一步骤之所以必要,是因为后续的聚集倾向评估需要三维结构信息——仅凭序列无法准确判断残基在空间上的聚集倾向。

折叠置信度与聚集倾向评估。 ESMFold预测的结构通过pLDDT分数(predicted local distance difference test)进行评估。pLDDT是AlphaFold系列工具中常用的置信度指标,数值范围从0到100,分数越高表示该区域的预测结构越可靠。与此同时,Aggrescan3D被用来预测蛋白质变体的聚集倾向。该工具基于三维结构识别聚集倾向氨基酸的簇——当多个疏水残基或β-折叠倾向残基在空间上聚集在一起时,往往预示着该蛋白质容易发生聚集。Aggrescan3D的输出是一个聚集倾向分数,分数越高意味着越容易聚集。

SPASE服务器工作流程概览:输入蛋白质结构文件(PDB)和用户指定的关键残基列表,这些残基不参与随机化并在整个优化过程中保留。提交的PDB结构先用PDBFixer标准化,以
▲ SPASE服务器工作流程概览:输入蛋白质结构文件(PDB)和用户指定的关键残基列表,这些残基不参与随机化并在整个优化过程中保留。提交的PDB结构先用PDBFixer标准化,以

综合以上各项指标,SPASE为每个变体生成一个综合评分,该评分同时考虑预测溶解度、聚集倾向和折叠置信度。用户最终获得的是一个按优先级排序的候选列表,列表顶部的变体在理论上兼具高溶解度、低聚集倾向和可靠的折叠结构。

研究结果

研究者通过计算基准测试评估了SPASE的性能。测试的核心问题是:SPASE筛选出的变体是否真的比ProteinMPNN的平均输出更好?

答案是肯定的,但需要加一个限定条件——在计算预测的层面上。

基准测试结果表明,SPASE富集的蛋白质变体在预测溶解度上高于可溶性ProteinMPNN输出的平均水平,同时预测聚集倾向低于平均水平。这意味着SPASE的筛选流程确实起到了“提纯”作用,而非仅仅是机械地传递ProteinMPNN的结果。原文摘要未提供具体数值,但这一结论在统计学意义上成立。

Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN.
▲ Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN.

研究者在论文中讨论了该工作流程的优势与局限性。优势方面,SPASE将多个独立开发的工具整合为一个无缝衔接的自动化流程,用户无需手动处理格式转换、参数调整或中间文件传递。这种集成本身就是一种价值——它降低了计算蛋白质工程的技术门槛,让没有深厚生物信息学背景的研究者也能使用这些先进工具。

Protein‐Sol solubility, Aggrescan3D aggregation, and ESMFold pLDDT distribution of Soluble Protein Analog Selection Engi
▲ Protein‐Sol solubility, Aggrescan3D aggregation, and ESMFold pLDDT distribution of Soluble Protein Analog Selection Engi

局限性方面,研究者坦率地指出了几个关键挑战。其一是蛋白质新颖性问题。SPASE的各个组件——ProteinMPNN、Protein-Sol、ESMFold、Aggrescan3D——都是基于已知蛋白质数据训练的,它们对全新折叠类型或非天然氨基酸组合的预测能力存在天然上限。其二是溶解度预测的准确性。Protein-Sol虽然能有效识别序列特征与溶解度之间的相关性,但实际溶解度还受表达系统、温度、缓冲液条件等多种实验因素影响,这些因素无法在计算预测中完全体现。其三是聚集倾向评估的局限性。Aggrescan3D基于结构特征预测聚集,但蛋白质在体内的聚集行为往往涉及部分去折叠中间态,这些动态过程难以从静态结构中完全捕捉。

讨论与展望

SPASE的定位是一个“筛选引擎”而非“设计工具”。它不直接创造新序列,而是在ProteinMPNN生成的序列空间中寻找那些最有可能在实验中表现出良好行为的候选者。这种“先广撒网、后精筛选”的策略,在计算成本可控的前提下,为下游实验验证提供了高质量的候选列表。

服务器目前通过https://proteinengineering.ca/公开访问,这一稳定入口使得全球研究者都能使用该工具。对于从事蛋白质工程但缺乏计算团队支持的实验室来说,SPASE提供了一个立即可用的解决方案。

值得指出的是,SPASE的验证目前仅限于计算基准测试。这些测试证明了筛选流程在计算预测层面的一致性,但尚未提供实验验证数据——即这些被SPASE评分为“高优先级”的变体是否真的在实验中表现出优异的溶解性和低聚集倾向。这是该工作流程未来需要面对的关键检验。如果实验数据能够与计算预测保持良好的一致性,SPASE有望成为蛋白质工程领域常用的前期筛选工具;如果两者出现偏差,则可能需要调整各组件的权重或引入额外的筛选标准。

一个有趣的方向是SPASE与实验闭环的结合。计算筛选出的候选变体经实验验证后,实验数据可以反过来用于优化预测模型——这种“计算-实验-再计算”的迭代模式,可能是该平台未来发展的自然延伸。但论文作者并未在本文中探讨这一可能性,以上仅是基于该领域通用发展趋势的观察。

PMID: 42560022

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12