来源:Protein Sci | 编译:DNA Lab Space
蛋白质设计正在经历一场范式转移。深度学习工具能在一夜之间生成成千上万个候选序列,但其中有多少真正可溶、稳定、不聚集?答案往往令人失望。一篇发表于 Protein Science 的最新工作给出了一个务实的解决方案——把序列生成、溶解度预测、结构建模和聚集倾向评估串联成一条自动化流水线,并打包成公开的网页服务器。这就是SPASE,Soluble Protein Analog Selection Engine。
研究背景
设计具有理想生物物理性质的蛋白质——高溶解度、低聚集倾向——是生物技术和生物医学应用的基石。酶制剂需要稳定储存,抗体药物需要高浓度制剂,融合蛋白需要避免包涵体。传统上,这些性质依赖实验筛选:表达、纯化、表征,一轮又一轮。成本高,周期长。
深度学习方法改变了序列设计的游戏规则。ProteinMPNN等工具能基于骨架结构反向设计氨基酸序列,成功率令人瞩目。但问题在于,ProteinMPNN直接输出的序列并不天然具备最优的溶解性和聚集特性。换句话说,AI擅长“设计出能折叠的序列”,却未必擅长“设计出好用的蛋白”。
SPASE的出发点正是这个痛点:与其让实验人员逐一测试AI生成的候选蛋白,不如在计算阶段就把“可溶性差”“易聚集”的候选淘汰掉。该研究由Larda、Paré和Doucet完成,服务器已公开部署,任何人都可以通过浏览器访问并使用。
研究方法
SPASE的工作流由五个计算模块串联而成,每一步都承担特定功能。
![可溶性蛋白类似物选择引擎(SPASE)网络服务器工作流程概览。输入包括蛋白质结构文件(蛋白质数据银行 [PDB])和用户精选的关键残基列表,这些残基在随机化中被排除,并在整个SPASE优化过程中得以保留。提交的PDB结构首先使用PDBFixer进行标准化,以非标准残基替换为标准等效物,添加缺失残基,使用在pH 7.4下分配的质子化状态添加缺失氢原子,并生成适合下游ProteinMPNN序列设计的输入文件。蛋白质](/d/file/research/202608/art_9_1786420450_0.webp)
第一步:结构标准化。 用户提交的蛋白质结构文件首先经过PDBFixer处理。这一步骤完成三项任务:将非标准残基替换为标准等价物、补全缺失残基、依据pH 7.4下的质子化状态添加缺失氢原子。处理后的结构文件才能作为后续序列设计的输入。原文摘要未详述PDBFixer的具体参数设置,但pH 7.4的质子化条件已明确给出。
第二步:大规模序列变体生成。 标准化结构被送入ProteinMPNN的可溶模型(soluble model)。该模型基于用户提供的PDB结构文件,生成多达10,000个多样化的蛋白质序列变体。值得注意的是,用户可以选择性地指定设计过程中必须保守的特定残基——这一功能确保关键结构位点或功能位点不被序列设计破坏。10,000这个数字直接来自论文全文,是SPASE默认的序列库规模。
第三步:溶解度预测。 每个生成的变体都经过Protein-Sol工具评估。Protein-Sol分析35种基于序列的特性,并将这些特性与实验验证的溶解度数据建立相关性,从而识别出具有增强溶解度潜力的序列。35种序列特性这一参数来自论文全文,体现了该工具的特征维度。
第四步:结构预测与折叠置信度评估。 对于通过溶解度筛选的候选序列,ESMFold被用来仅从氨基酸序列预测其三维坐标。ESMFold是目前最先进的结构预测工具之一,其预测速度远快于AlphaFold2,适合批量处理大规模序列库。预测得到的结构随后通过pLDDT分数(predicted local distance difference test)进行评估,pLDDT为每个残基的折叠置信度提供估计值。这一步的关键在于:后续的聚集倾向预测需要三维结构信息,而ESMFold恰好提供了这一输入。
第五步:聚集倾向预测。 最后,Aggrescan3D基于预测的三维结构计算每个蛋白变体的聚集倾向。该工具能够识别聚集倾向氨基酸的簇——这些簇是蛋白质在溶液中发生非特异性聚集的结构基础。最终,SPASE根据三个维度的得分对每个变体进行排序:预测溶解度、预测聚集倾向、折叠置信度。
![Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN. (a) Input scaffold structures used to benchmark SPASE: Human Myoglobin Mutant K45R (Protein Data Bank [PDB] 3RGK ), Mouse Claudin‐15 (PDB 4P79 ), and Human Neutrophil Gelatinase‐As](/d/file/research/202608/art_9_1786420450_1.webp)
整个工作流被封装为一个自动化网页服务器,用户只需提交蛋白质结构文件并设置参数,即可获得排序后的候选蛋白列表。服务器地址为https://proteinengineering.ca/,这是论文中明确给出的稳定公共访问入口。
研究结果
SPASE的核心价值在于其筛选能力。论文通过计算基准测试(computational benchmarking)验证了这一点。
基准测试的结果明确:SPASE富集了具有更高预测溶解度和更低预测聚集倾向的蛋白质类似物——相比soluble ProteinMPNN的平均输出。这句话需要拆解来看。soluble ProteinMPNN是序列生成工具,它的输出是一个庞大的序列库,其中包含各种溶解性特征的变体。SPASE的工作不是生成更好的序列,而是从这批序列中挑出更好的那些。论文用“enriches for”一词描述这一行为,说明SPASE的系统性筛选显著提高了候选池中高质量蛋白的比例。
具体的数据指标方面,论文全文并未给出富集倍率、pLDDT阈值或溶解度得分的具体数值。原文摘要未提供具体数据。但基准测试的定性结论是明确的:经过SPASE筛选的候选蛋白群体,其预测溶解度和聚集倾向分布优于未经筛选的ProteinMPNN平均输出。

论文还讨论了工作流的优势与局限性。优势方面,SPASE将多个独立工具整合为一个无缝流程,用户无需分别运行ProteinMPNN、Protein-Sol、ESMFold和Aggrescan3D,也无需编写脚本处理中间文件格式转换。这种集成降低了计算蛋白质设计的技术门槛。
局限性方面,作者明确指出了三类挑战。第一是蛋白质新颖性(protein novelty)——AI生成的序列可能过于偏离天然序列,导致实验表达时出现意料之外的问题。第二是溶解度预测的准确性——Protein-Sol虽然基于35种序列特性,但溶解度本身受表达宿主、温度、缓冲液等多种实验条件影响,计算预测存在固有误差。第三是聚集倾向评估的局限性——Aggrescan3D基于结构预测,而结构预测本身带有不确定性,误差会逐级传递。
这些讨论并非泛泛而谈。作者将SPASE定位为“用于优先级排序的平台”——它不替代实验验证,而是帮助实验人员决定“先试哪个蛋白”。在候选蛋白数量庞大、实验通量有限的现实约束下,这种计算预筛选策略具有直接的实用价值。
讨论与展望
SPASE的出现在蛋白质工程工具链中填补了一个明确空白:它不是又一个序列生成器,而是一个序列筛选器。生成与筛选的分离是计算蛋白质设计走向成熟的标志——前者解决“能设计出什么”,后者解决“该实验什么”。
从架构选择来看,该研究选用ESMFold而非AlphaFold2进行结构预测,与其大规模筛选的应用场景直接相关。ESMFold的推理速度远快于AlphaFold2,在10,000个候选序列的结构预测任务中,计算时间差异可能达到数量级。论文未给出具体运行时间数据,但这一选择逻辑清晰。
一个值得关注的细节是pH 7.4的质子化处理。这一条件接近生理pH,暗示SPASE的设计目标偏向生物医学应用场景——例如抗体工程、酶治疗制剂或疫苗抗原设计。对于需要极端pH条件工作的工业酶,用户可能需要调整这一参数。
SPASE的公开部署方式也值得肯定。网页服务器降低了使用门槛,实验科学家无需掌握命令行操作或深度学习框架即可完成计算筛选。当然,服务器模式也有代价——大规模序列库的处理可能受限于计算资源,用户可能需要排队等待。
未来方向不难设想:将实验反馈数据回传至服务器以优化筛选阈值,或整合更多生物物理预测工具如热稳定性预测。这些内容论文未提及,属于合理的延伸思考。但就当前版本而言,SPASE已经提供了一个完整、可用、公开的计算筛选方案。对于正在为“AI设计出的蛋白不溶”而头疼的研究者,这个服务器值得一试。
参考来源
Larda ST, Paré A, Doucet N. Soluble protein analog selection engine (SPASE): An automated AI-powered server to improve protein engineering workflows. Protein Science, 2025. PMID: 42560022.
PMID: 42560022