来源:Protein Sci | 编译:DNA Lab Space
蛋白质设计的目标不仅是获得新颖序列,更要求这些序列具备实际应用所需的物理化学性质。深度学习序列设计工具如ProteinMPNN已能快速生成大量候选序列,但其直接输出的溶解性和聚集倾向并不总是理想。一篇在线发表于《Protein Science》的研究带来一个新工具——SPASE(Soluble Protein Analog Selection Engine),一个把序列设计、溶解度预测、结构预测和聚集倾向评估整合进自动化工作流的公共网络服务器。该服务器免费向学术界开放,为蛋白质工程候选变体的优先级排序提供了基于多指标综合评分的计算解决方案。
研究背景
高溶解度和低聚集倾向是蛋白质用于生物技术和生物医学应用的关键前提。无论是治疗性抗体、工业酶还是生物传感器,蛋白质一旦发生聚集或沉淀,轻则降低活性,重则引发免疫原性问题。近年来,基于深度学习的蛋白质序列设计方法取得了突破性进展,其中ProteinMPNN作为代表性工具,能够在给定蛋白质骨架结构的前提下反向设计氨基酸序列,且实验验证成功率令人瞩目。然而,这类生成模型的直接输出往往只优化了序列与骨架的匹配度,并未内建对溶解性和聚集行为的显式优化。折叠后的候选蛋白可能因表面疏水残基暴露而倾向于聚集,或因静电互补不佳而溶解度低下。传统做法是研究者将设计序列逐一送检实验表征,周期长、成本高、通量受限。SPASE的设计初衷,就是在湿实验之前先完成一轮计算筛选——更大规模、更快捷、基于多维度预测指标完成初筛。
研究方法
SPASE平台是一个完全自动化的计算工作流,用户只需提交蛋白质结构文件(PDB格式),服务器即启动一系列串联分析步骤。
整个流程的第一步是结构标准化处理。用户提交的PDB文件往往存在非标准残基、缺失原子、缺失氢原子等问题,这些都会干扰后续计算。SPASE调用PDBFixer工具,将非标准残基替换为标准氨基酸,补齐缺失残基,并在pH 7.4条件下根据质子化状态添加缺失的氢原子。pH 7.4是生理条件的常用近似值,这一设定使后续设计更贴近生物体内应用环境。处理完毕的结构文件被转化为适合ProteinMPNN读取的输入格式。
第二步是序列生成。SPASE调用ProteinMPNN的可溶性模型(soluble ProteinMPNN),基于用户提供的蛋白质结构,生成规模达10,000条的多样化序列变体库。这个数量级意味着服务器会为一个蛋白骨架探索上万种可能的序列解空间,覆盖不同的疏水核心堆积方式和表面极性分布模式。系统允许用户指定特定残基在设计中保持不变,这一功能对保留催化活性位点、配体结合口袋或蛋白质相互作用界面至关重要。功能关键位点被锁定后,设计产生的变异集中在非关键区域,从而提高候选序列保留原始功能的概率。
第三步是溶解度预测。每个生成的变体序列被提交给Protein-Sol工具。Protein-Sol是一种基于序列的溶解度预测器,它分析35种与序列相关的理化特征,并将这些特征与实验验证的溶解度数据关联比对,输出每个变体的预测溶解度分数。这一步骤不依赖结构信息,速度快,适合对万级序列库进行批量处理。
第四步是三维结构预测。仅知道序列无法评估聚集风险,聚集倾向是三维层面上的性质。SPASE调用ESMFold,一种端到端的深度学习结构预测工具,仅从氨基酸序列出发预测每个变体的三维坐标。ESMFold的优势在于推理速度快,能够在一分钟内处理单个序列的结构预测,使大规模并行成为可能。预测结构随后用pLDDT(predicted local distance difference test)分数进行质量评估。pLDDT是AlphaFold系列和ESMFold共同使用的置信度指标,数值越高代表该区域的预测结构越可靠。SPASE利用pLDDT对每个变体的折叠置信度进行估计,为后续筛选提供结构可信度的判据。
第五步是聚集倾向预测。SPASE集成Aggrescan3D,基于已预测的三维结构识别序列中聚集倾向氨基酸的簇。Aggrescan3D的工作原理是分析结构表面暴露的聚集热点区域——当多个聚集倾向残基在空间上聚集形成疏水补丁时,蛋白质更容易发生错误折叠和聚集。该工具将三维结构信息与氨基酸聚集倾向性经验参数结合,输出每个变体的聚集倾向分数。
最终,SPASE汇总每个变体的三类预测指标——溶解度分数、聚集倾向分数和pLDDT折叠置信度——对10,000个候选序列进行综合打分排序,输出经优先级排序的变体列表。

需要说明的是,原文摘要和关键段未详述服务器计算资源消耗、单次任务运行时间、打分权重分配方式及排序算法的具体细节。上述流程中涉及的pH 7.4、变体数量10,000、35种序列特征等均为原文明确提供的参数。
研究结果
SPASE的核心结论来自计算基准测试。研究团队将SPASE的筛选输出与soluble ProteinMPNN的平均输出进行对比,结果显示SPASE系统性地富集了预测溶解度更高、预测聚集倾向更低的蛋白质变体。换句话说,经过SPASE排序后排在列表前端的候选序列,其预测性质明显优于未经筛选的随机变体。
原文摘要未提供富集幅度的具体数值,例如溶解度分数的提升倍数或聚集倾向分数的降低百分比均未给出。基准测试所采用的测试蛋白集合、序列数量及与实验验证数据的一致性程度,原文摘要亦未详述。因此,关于富集强度的量化描述只能止步于“优于平均输出”这一定性结论。
评分逻辑的三元组合是这一工作流的技术特征。溶解度预测基于序列层面,聚集预测基于结构层面,而pLDDT则衡量结构预测本身的可靠性。低pLDDT的变体即使溶解度分数高,也可能因预测结构不可靠而被降权。这种多维互校的打分机制,不同于单纯依赖序列特征的筛选管线。论文明确指出,结构信息对于最终过滤步骤至关重要——需要三维坐标才能评估聚集热点区域的空间分布。
SPASE服务器已经公开部署,访问入口为https://proteinengineering.ca/。这是该平台向全球研究社区开放使用的稳定门户。


围绕平台性能,作者还在讨论部分阐述了这一工作流体系面临的三类挑战。第一是蛋白质新颖性问题——计算设计倾向于生成与训练集相似的序列,高度新颖的设计可能超出预测工具的适用域。第二是溶解度预测本身的准确度限制——基于序列的溶解度预测体现了序列编码层面的可溶性趋势,但实际溶解度受到表达系统、缓冲液条件、浓度等多重因素影响,计算预测难以覆盖全部变量。第三是聚集评估的复杂性——Aggrescan3D虽然能识别聚集热点,但体内聚集行为还涉及分子伴侣、蛋白质浓度、翻译后修饰等动态因素。
讨论与展望
SPASE的价值在于它把多个独立存在的工具连接成一条自动化的决策链。单独使用ProteinMPNN、ESMFold或Aggrescan3D的研究者大有人在,但整合成一个面向非计算专家的公开服务器,才是这篇论文的真正贡献——它降低的是整个蛋白质工程筛选流程的准入门槛。10,000个变体的人工逐一评估是令人却步的工作量,SPASE在数小时甚至更短时间内给每个候选序列打上多维预测标签,让研究者把有限的实验资源集中在排名靠前的少数候选项上。
值得强调的是,作者对该工具的局限性持坦诚态度。他们讨论了蛋白新颖性给预测工具带来的外推风险、溶解度预测的固有误差、聚集评估的简化假设。这些讨论不是缺陷的掩饰,而是指向一个事实:计算筛选只能缩小实验空间,不能替代实验验证。SPASE的意义在于让实验前的决策更理性——用最低成本过滤掉最不可能成功的候选序列,将实验资源投向最有希望的方向。
未来该平台的升级方向可能涉及更精确的打分融合算法、引入超出平均输出富集度的实验验证数据、扩展至更多生物物理性质预测等,但原文摘要未涉及这些内容,本文不加以推测。
参考来源
Larda ST, Paré A, Doucet N. Soluble protein analog selection engine (SPASE): An automated computational server to improve protein engineering workflows. Protein Science. PMID: 42560022.
PMID: 42560022