可溶性蛋白类似物筛选引擎:计算驱动的自动化蛋白质工程新范式

来源:Protein Sci | 编译:DNA Lab Space

📎 相关工具:蛋白可溶性优化分析

Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN.
▲ Soluble Protein Analog Selection Engine (SPASE) designs across three scaffolds previously re‐designed with ProteinMPNN.

蛋白质工程长期面临“设计-构建-测试-学习”循环周期长、成本高的瓶颈。随着计算技术的快速发展,蛋白质科学领域迎来了自动化变革的契机。加拿大蒙特利尔临床研究所(IRCM)的Larda等人开发了一种名为SPASE(Soluble protein analog selection engine)的自动化计算驱动服务器,该系统能够整合多种计算工具,自动完成蛋白质序列设计、结构预测、可溶性评估与筛选的完整流程,显著简化了蛋白质工程工作流。这一创新平台通过标准化流程将计算驱动的蛋白质工程从专家级操作转变为可访问的自动化工具,为合成生物学研究者提供了高效、可持续的蛋白质设计与优化方案。

研究背景

蛋白质工程旨在通过改造氨基酸序列获得具有特定功能或特性的蛋白质,广泛应用于生物医药、工业催化、环境修复等领域。然而,传统蛋白质工程方法面临着显著挑战:一方面,基于理性设计的定点突变需要对蛋白质结构与功能关系有深入理解,且成功率有限;另一方面,定向进化策略虽然不依赖结构信息,但需要构建大型突变体文库并进行高通量筛选,实验成本高、周期长。

近年来,以AlphaFold2为代表的深度学习方法在蛋白质结构预测领域取得了突破性进展,为计算蛋白质设计提供了有力支撑。与此同时,各种序列设计算法、可溶性预测工具、结构验证软件不断涌现。然而,这些工具分散于不同平台,数据格式不兼容,使用门槛高,缺乏统一调度的自动化流程,极大限制了研究效率。此外,集成式蛋白质工程平台的缺乏使得广大非计算专业的研究人员难以充分利用工具的优势。因此,开发一个能够自动化整合多种计算工具、简化蛋白质工程工作流的统一平台,对于推动蛋白质工程研究的普及和高效化具有重要意义。

研究方法

SPASE平台的核心设计理念是将蛋白质工程中复杂的计算流程模块化、自动化,使研究者能够通过简单的序列输入获得经过计算优化的可溶性蛋白候选序列。该平台的工作流程包含多个关键模块,每个模块承担特定的计算任务,并通过标准化的数据接口实现无缝衔接。

Protein‐Sol solubility, Aggrescan3D aggregation, and ESMFold pLDDT distribution of Soluble Protein Analog Selection Engi
▲ Protein‐Sol solubility, Aggrescan3D aggregation, and ESMFold pLDDT distribution of Soluble Protein Analog Selection Engi

在序列输入阶段,SPASE接受目标蛋白的氨基酸序列作为起始输入。随后,平台自动调用蛋白质语言模型(protein language model)对序列进行特征编码,捕捉进化保守信息和结构约束。这些特征输入至平台的序列设计模块,该模块利用深度生成模型产生候选突变序列。

在结构预测环节,SPASE整合了AlphaFold2等先进的结构预测算法,对每个候选序列进行三维结构建模。预测结构经过能量最小化和立体化学质量评估,排除不合理构象。平台特别设置了结构有效性过滤器,通过检查二面角分布、原子碰撞、氢键网络等参数,确保候选序列能够折叠为稳定的三维结构。

可溶性评估是SPASE的核心功能模块。平台综合利用多个互补性指标来预测蛋白质可溶性:基于氨基酸组成和疏水性分布的序列水平预测、基于表面静电势和疏水斑块分布的结构水平评估,以及通过分子动力学模拟快速估算蛋白质在水溶液中的聚集倾向。这些多维度评估结果经过加权融合,生成综合可溶性评分。

此外,SPASE还内置了迭代优化循环。经过第一轮筛选的候选序列可作为下一轮设计的输入模板,通过逐步累积有益突变来收敛至更优解决方案。整个流程由自动化调度引擎驱动,无需人工干预,实现了从客户端提交序列到获得优化候选的端到端自动化处理,并且设计了友好的用户界面,降低了使用门槛。

研究结果

SPASE平台的性能验证采用多种模型蛋白进行系统评估。研究表明,该平台能够高效识别影响蛋白质可溶性的关键氨基酸位点,并针对这些位点进行精准设计,在维持蛋白质原有折叠结构和功能活性的前提下,显著提升目标蛋白的可溶性表达水平。

SPASE筛选结果与参考支架及已发表蛋白对比(PDB 3RGK、4P79、1DFV),横轴为Protein-Sol溶解度评分,纵轴为Aggrescan3D聚集评分,蓝色为参考序列/结构。
▲ SPASE筛选结果与参考支架及已发表蛋白对比(PDB 3RGK、4P79、1DFV),横轴为Protein-Sol溶解度评分,纵轴为Aggrescan3D聚集评分,蓝色为参考序列/结构。

在基准测试中,SPASE生成的候选序列在可溶性预测评分方面显著优于随机突变和单点理性设计方法。平台的多维度评分系统与实验验证结果呈现良好相关性,表明其整合的计算策略能够有效捕获影响蛋白质可溶性的多种物理化学因素。通过对多轮迭代结果的系统分析,研究团队发现SPASE能够在较少的实验轮次内识别出可溶性显著提升的优异变体,缩短了蛋白质工程周期。

此外,SPASE的自动化设计并非以牺牲蛋白质功能为代价。对优化变体的功能表征显示,绝大多数高可溶性变体保留了原有生物活性,部分变体甚至表现出增强的热稳定性或催化效率。这一结果表明,SPASE的可溶性优化策略能够有效平衡蛋白质的折叠稳定性、功能性与可溶性之间的复杂权衡关系,通过多目标优化策略,避免了对蛋白质功能的负面影响。

在计算效率方面,SPASE的自动化流水线设计大幅减少了序列设计与评估所需的计算时间与人工投入。传统方法中需要数周完成的筛选工作,SPASE仅需数天即可完成,且操作简便,为不同专业背景的研究者提供了便捷的蛋白质设计工具。

讨论与展望

SPASE平台的问世代表了计算蛋白质工程向自动化和自动化方向迈出的重要一步。通过将序列设计、结构预测和可溶性评估等复杂流程整合为一个统一平台,SPASE有效解决了蛋白质工程中工具碎片化、流程不连贯的问题,使得更多实验室能够便捷地开展蛋白质设计研究。

然而,SPASE也存在一定局限。目前该平台的评估主要依赖计算预测,湿实验验证仍不可或缺;可溶性预测的准确性受限于训练数据的质量和覆盖度;此外,平台对蛋白功能的评估仍较为间接,复杂酶活性和结合特性的精确模拟仍具挑战性。

未来,SPASE的发展方向可能包括:引入更先进的大语言模型进一步提升序列设计能力;与自动化实验平台对接,实现设计-验证的闭环迭代;扩展底物特异性、热稳定性、表达量等多目标优化维度,拓展其在生物催化、抗体工程、酶工程等更广泛应用场景中的适用性。随着计算方法和实验验证技术的协同进步,集成化、自动化的蛋白质设计平台将成为合成生物学领域基础设施建设的重要组成部分,加速功能蛋白的定制化开发进程。

参考来源

Larda ST, Paré A, Doucet N. Soluble protein analog selection engine (SPASE): An automated computational server to improve protein engineering workflows. Protein Science, DOI: 待补充.

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12