来源:Protein Sci | 编译:DNA Lab Space
蛋白质工程研究长期受限于目标蛋白可溶性差、表达量低和筛选周期长等瓶颈。传统依赖随机突变与高通量实验筛选的策略不仅耗时耗力,且成功率高度依赖研究者的经验。为突破这一局面,Larda等研究者开发了SPASE(Soluble Protein Analog Selection Engine)——一款基于计算的自动化服务器平台。SPASE将结构预测、序列分析与候选筛选集成于一体,旨在以标准化、可重复的方式加速可溶性蛋白类似物的设计。该平台有望显著缩短蛋白质工程中的“设计—构建—测试—学习”循环,为工业酶改造、生物药物开发以及功能蛋白定制提供全新的自动化解决方案。
研究背景
蛋白质的错误折叠和聚集是重组蛋白生产中最常见的问题之一。即使在原核或真核表达系统中成功转录翻译,许多蛋白仍因溶解度不足而难以进入后续功能研究。传统蛋白质工程通常采用定向进化或理性设计策略:前者依赖大规模随机突变和高通量筛选,需要大量实验资源和设备支持;后者则需要高分辨率结构信息和深度机理理解,难以推广到缺乏结构数据的靶标蛋白。近年来,以AlphaFold2为代表的深度学习结构预测方法极大改变了这一领域的面貌,使研究者能够从氨基酸序列出发快速获取可信三维模型。然而,仅仅获取结构模型并不足以直接判断突变对可溶性的影响,更缺乏一套自动化流程来连续执行序列生成、结构评估和候选排序。SPASE正是在这一背景下应运而生,它尝试将多种计算工具整合到一个用户友好的、计算驱动的服务器中,让蛋白质工程研究者无需深厚的生物信息学背景即可获得高质量的可溶变体候选。
研究方法
SPASE的核心技术路线遵循模块化、自动化和可迭代的设计原则,其整体工作流程可分为输入处理、序列分析、结构建模、候选筛选和反馈输出五个层次。用户只需提交目标蛋白的氨基酸序列或对应基因的质粒信息,服务器便会启动全套自动分析流程。
首先,在输入处理模块,SPASE借助多序列比对工具搜索同源蛋白,构建序列谱,随后利用共进化分析识别残基间的协同耦合信号。这些信号既能辅助预测蛋白三级结构,也能标注功能敏感位点,避免后续设计破坏核心结构域。接着,系统调用AlphaFold2或等价深度学习结构预测算法生成候选结构模型,并对模型进行能量最小化和评估,以排除低置信度、结构异常的预测结果。
在候选生成与筛选环节,SPASE引入了一种“类似物选择”策略——它并不盲目设计全序列突变,而是在天然蛋白的序列框架内系统性地搜索那些可能提高表面亲水性、减小疏水核心暴露或增强分子内极性相互作用的氨基酸替换。多种机器学习评分模型并行工作,分别预测候选变体的可溶性、表达水平、热稳定性和聚集倾向,然后通过加权投票与排序算法输出推荐列表。每个输出候选均附带对应的结构文件、突变位置、预期功能效应和综合评分,便于实验人员直接选择高优先级变体进行合成。此外,SPASE支持反馈循环:将实验验证结果重新输入服务器,系统便可根据新的标签数据微调评分权重,实现“主动学习”式的迭代优化。

技术实现上,SPASE采用前后端分离的Web服务器架构,后端任务采用队列调度和容器化部署,支持高并发计算;前端则提供简洁方便的交互接口,能够以图形化方式展示突变位点、结构比对和评分分布。整个流程从输入序列到输出最终候选通常仅需数小时,且无需用户进行任何命令行操作或本地计算资源部署。
研究结果
作者在多种模式蛋白体系上对SPASE进行了系统验证,结果显示该平台在预测可溶突变体方面表现出优异的准确性和实用性。在基准测试中,SPASE输出的高评分候选变体经实验表达后,其可溶性蛋白产量普遍高于随机突变库来源的克隆子,阳性率提升数倍。尤其对于原本易于聚集的蛋白结构域,SPASE推荐的前十名候选中有较高比例能够在常规表达条件下获得可检测的单体可溶性蛋白,而野生型蛋白在同等条件下则主要出现在包涵体中。

进一步分析表明,SPASE所选择的类似物并非简单引入大量极性残基,而是倾向于在结构表面非关键区域进行点突变,以改善分子表面电荷分布和亲水性界面。这些突变通常不会改变蛋白的二级结构框架,却能够有效减少暴露的疏水残基簇,从而降低非特异性聚集趋势。与已报道的定向进化结果对比,SPASE推荐位点有相当比例与实验筛选出的有利突变高度重合,说明其计算策略与自然选择压力具有一定一致性。

除了单点突变模式,SPASE还支持组合突变库设计。研究者成功利用该平台生成多突变体组合,在保持原有催化活性或配体结合能力的同时,显著提升了蛋白的可溶性表达水平。在优化项目周期上,传统工作流通常需要连续数月重复克隆、表达、纯化和分析工作,而SPASE将前期突变设计压缩到几天内完成,并且允许用户根据实验数据动态调整指令,完成下一轮优化。这种“人类设定目标—算法推荐候选—实验验证反馈”的闭环模式大幅提升了蛋白质工程的整体效率,减少了无效克隆和无效实验时间。
值得注意的是,SPASE并非仅仅提供静态预测结果,它还能生成多种可视化报告。通过交互式结构图谱,研究者可以直接查看突变位点在三维结构中的空间分布,理解突变对分子表面属性的影响。这些功能极大降低了计算生物学方法的使用门槛,使普通实验团队也能快速开展理性的蛋白改造,而不需要额外配备计算生物学家。
讨论与展望
SPASE作为一款面向蛋白质工程的计算驱动服务器,展示了计算设计与自动化流程在解决可溶性难题方面的巨大潜力。其核心优势在于将繁琐的生物信息学操作封装为一体化服务,让研究者能够专注于实验验证与功能评价。然而,该平台仍存在一定局限性:预测模型的性能高度依赖训练数据范围,对于全新的折叠类型或极端环境下工作的蛋白,其可靠性可能会下降;同时,目前主要针对可溶性相关特性进行优化,对于复杂功能属性(如酶学动力学、配体选择性)的联合优化仍有待扩展。
未来,SPASE这类平台有望与自动化液体处理系统、高通量表达分析设备深度融合,形成“计算+机器人+云计算”的无人值守蛋白质工程实验室。随着更多实验数据被实时反馈到模型中,算法将变得越来越,不仅能够预测可溶性,还能同时优化稳定性、活性和免疫原性等多个维度。可以预见,以SPASE为代表的技术路径将推动蛋白质工程从经验驱动向数据驱动的范式转变,使可溶性蛋白类似物的设计与筛选真正步入“按需定制”的新时代。
参考来源
Protein Science, DOI: 10.1002/pro.XXXX(原文DOI以期刊官网为准)