来源:Protein Sci | 编译:DNA Lab Space
蛋白质设计正在经历一场由深度学习驱动的范式变革。然而,当计算模型输出的序列被送回实验室时,研究人员常常面临一个尴尬的现实:这些序列在理论上漂亮,却可能溶解度差、容易聚集,难以在实际应用中站稳脚跟。一篇发表于《Protein Science》的最新研究,描述了一个名为SPASE(Soluble Protein Analog Selection Engine,可溶性蛋白类似物筛选引擎)的自动化网络服务器,试图在计算序列生成与实验验证之间,架起一座务实的筛选桥梁。
研究背景:当计算设计遇上“可溶性”瓶颈
治疗性抗体、工业酶、生物传感器——这些生物技术产品的核心都离不开一个前提:蛋白质必须在水溶液中保持稳定、可溶、不聚集。聚集不仅会降低蛋白活性,还可能引发免疫原性等不良反应。因此,在蛋白质工程早期阶段就筛选出高溶解性、低聚集倾向的候选分子,对下游应用至关重要。
近年来,以ProteinMPNN为代表的深度学习方法在蛋白质序列设计领域表现出色。这类工具能够基于给定的蛋白质骨架结构,反向设计出能折叠成目标构象的氨基酸序列。但问题在于,ProteinMPNN的“直接输出”并不总是具备最优的溶解性和聚集特性。换句话说,计算擅长解决“如何折叠”的问题,却未必擅长解决“如何不沉淀”的问题。
这一痛点构成了SPASE开发的直接动因。来自加拿大魁北克的研究团队(Larda ST, Paré A, Doucet N)意识到,与其让实验人员拿着ProteinMPNN的输出序列去逐一试错,不如构建一个自动化的计算流水线,在设计阶段就同步评估溶解性、聚集倾向和折叠置信度,从源头上过滤掉那些“理论上可行、实际上麻烦”的候选序列。
研究方法:四步流水线,从PDB文件到打分排序
SPASE的工作流程可概括为“标准化—序列生成—性质预测—结构评估”四个环节。整个流程围绕用户提交的一个蛋白质结构文件(PDB格式)展开。
第一步:结构标准化处理。 用户提交的原始PDB文件往往包含非标准残基、缺失原子或缺失残基等不理想情况。SPASE首先调用PDBFixer工具对这些结构进行“清理”:将非标准残基替换为标准氨基酸等效物,补全缺失残基,并根据pH 7.4条件下的质子化状态添加缺失氢原子。这一步的目的在于生成干净、标准的输入文件,为后续ProteinMPNN序列设计扫清障碍。原文摘要未详述PDBFixer的具体参数配置,但明确了pH 7.4这一关键质子化条件。
第二步:大规模序列变体生成。 经过标准化处理的结构被提交给ProteinMPNN的可溶性模型(soluble model)。该模型会在用户提供的蛋白质骨架基础上,生成一个包含10,000个不同序列变体的大型文库。这一数量级的设计抽样,旨在充分探索序列空间,确保后续筛选有足够的多样性。用户还可以自定义指定某些残基在设计中保持不变——这对于保护蛋白质的关键结构位点或功能位点至关重要。例如,一个酶的催化三联体残基,显然不应该在序列重设计中被随意替换。
第三步:溶解性与结构预测并行。 针对生成的每个序列变体,SPASE同时启动两个预测任务。其一是利用Protein-Sol工具预测溶解性。Protein-Sol通过分析35种基于序列的理论性质,并将其与实验验证过的溶解性数据库进行相关性比对,从而给出每个变体的溶解性评分。其二是利用ESMFold——一个基于AlphaFold架构的先进蛋白质结构预测工具——仅从氨基酸序列出发,预测每个变体的三维坐标。这一步之所以必要,是因为后续的聚集倾向评估需要结构信息作为输入。
第四步:折叠置信度与聚集倾向评估。 ESMFold预测出的结构并非全部可信。SPASE使用pLDDT(predicted local distance difference test,预测局部距离差异检验)分数来评估每个变体的折叠置信度。pLDDT值越高,说明该变体越有可能可靠地折叠成预测构象。最后,Aggrescan3D工具被整合进流水线,基于变体的三维结构预测其聚集倾向——它能够识别出聚集倾向氨基酸簇,这些簇往往是蛋白“抱团沉淀”的结构基础。

综合以上四项指标——溶解性预测值、聚集倾向预测值、折叠置信度(pLDDT)以及序列多样性——SPASE对每个变体进行综合打分排序。整个流程完全自动化,用户只需提交PDB文件并等待结果输出即可。
研究结果:计算基准测试显示“富集”效应
SPASE的价值需要通过实际测试来验证。研究团队进行了计算基准测试,将SPASE的输出与“可溶性ProteinMPNN的平均输出”进行对比。结果清晰显示:SPASE能够富集出具有更高预测溶解性和更低预测聚集倾向的蛋白质类似物。
原文摘要未提供具体的富集倍数或数值差异,但明确指出了这一趋势的方向性。换言之,如果研究人员直接使用ProteinMPNN的可溶性模型生成一批序列,这批序列的平均性质可能并不理想;而经过SPASE筛选后,排名靠前的候选序列在溶解性和聚集性两个维度上均显著优于随机抽样的平均水平。
这一结果的意义在于,SPASE并非重新发明了一种新的序列设计算法,而是通过“集成+筛选”的策略,让现有工具各司其职:ProteinMPNN负责探索序列空间,Protein-Sol和Aggrescan3D负责把关生物物理性质,ESMFold负责提供结构依据。这种模块化整合的思路,使得SPASE能够在不改变底层算法的情况下,大幅提升候选序列的整体质量。

值得强调的是,SPASE的筛选逻辑是“多属性联合优化”。仅关注溶解性而忽视聚集倾向,可能导致选出高溶解但极易聚集的变体;仅关注折叠置信度而忽视溶解性,则可能选出结构完美但无法在溶液中稳定存在的序列。SPASE将三者统一纳入评分体系,这种综合视角更贴近实验筛选的真实需求。

讨论与展望:计算设计落地实验的“中间层”
SPASE的出现,折射出蛋白质工程领域一个日益明显的趋势:深度学习模型正在从“单点突破”走向“流水线整合”。ProteinMPNN解决了序列设计的核心难题,但设计只是起点,后续的筛选、验证、优化同样消耗大量实验资源。SPASE试图在计算阶段就完成一轮“预筛选”,让进入实验室的候选序列从一开始就具备较高的可溶性潜力。
当然,研究团队也坦诚讨论了该工作流的局限性。蛋白质新颖性是一个关键挑战——SPASE生成的变体虽然基于真实蛋白质结构,但序列本身是全新的,这些新序列能否在细胞内正确折叠、能否保持原有功能,计算预测无法给出绝对保证。此外,溶解性预测和聚集评估工具本身也存在各自的误差边界。Protein-Sol的预测基于35种序列性质与实验数据的相关性,但实验数据本身的覆盖面有限;Aggrescan3D的聚集预测依赖于三维结构,而ESMFold预测的结构与真实构象之间可能存在偏差。
这些局限并非SPASE独有,而是当前计算蛋白质设计领域的共性瓶颈。但SPASE的价值恰恰在于,它将这些问题显性化、流程化——研究人员可以在实验前就知道候选序列在哪些指标上存在风险,从而更有针对性地设计实验验证方案。原文摘要未提供SPASE在具体蛋白靶点上的实验验证数据,但明确指出该服务器的定位是“为下游实验评估优先排序蛋白质工程候选物”。
SPASE目前已公开上线,稳定访问入口为https://proteinengineering.ca/。这一开放获取的模式,意味着全球任何研究团队都可以将自家的蛋白质结构提交到服务器上,获得经过多指标筛选的候选序列列表。对于缺乏强大计算团队的中小型实验室而言,这无疑降低了计算辅助蛋白质设计的准入门槛。
从更宏观的视角看,SPASE代表了蛋白质工程工作流的一个新方向:不再追求单一指标的极致优化,而是通过多指标联合评估,寻找“综合最优解”。这种思路在实验资源有限的情况下尤其务实——毕竟,实验室的96孔板容量有限,与其让计算生成一万个序列然后随机挑选,不如让计算服务器先替我们完成一轮“优中选优”。
未来的改进方向或许包括:引入更多维度的预测指标(如表达量预测、热稳定性预测),支持更复杂的序列约束条件,甚至与自动化实验平台对接,形成“计算筛选—实验验证—数据反馈”的闭环迭代。但就目前而言,SPASE已经为蛋白质工程社区提供了一个实用、易得的计算工具。正如研究团队所言,将多种预测生物物理属性整合进一个平台,对于蛋白质设计的优先级排序具有明确价值——而这一步,或许正是计算设计走向实验应用的必经之路。
参考来源
Larda ST, Paré A, Doucet N. Soluble protein analog selection engine (SPASE): An automated computational server to improve protein engineering workflows. Protein Science. PMID: 42560022.
PMID: 42560022