蛋白质工程改造提升酶稳定性:从B因子到机器学习的前沿进展

来源:Biodes Res | 编译:DNA Lab Space

📎 相关工具:高级引物设计工具

工业生物催化正面临一个两难困境:许多有价值的反应在有机溶剂或高温条件下效率更高,但大多数天然酶在这些“苛刻”环境中迅速失活。如何让酶在非自然条件下保持稳定,成为合成生物学与蛋白质工程领域的核心挑战之一。近期发表于《BioDesign Research》的一篇综述,系统梳理了利用B因子分析、祖先序列重建和机器学习等策略提升酶溶剂稳定性与热稳定性的最新进展,为工业酶制剂的理性设计提供了清晰的技术路线图。

研究背景

酶作为绿色催化剂,在制药、化工、食品和能源等领域应用广泛。然而,工业反应条件往往与酶的天然生存环境相去甚远。有机溶剂虽然能提高疏水性底物的溶解度,却会破坏酶分子表面的水化层,导致蛋白质去折叠;高温虽能加快反应速率、提高底物扩散系数,却同样威胁着酶的三维结构完整性。

稳定性因此成为决定工业生物催化剂适用性的关键因素。传统上,提升酶稳定性依赖定向进化——通过随机突变加筛选,反复迭代寻找更稳定的变体。这种方法有效,但耗时费力,且突变位点的选择往往缺乏理性指导。近年来,结构生物学信息与计算工具的进步,让研究人员得以从“盲目试错”走向“精准设计”。这篇综述聚焦三种代表性策略:B因子引导的柔性位点改造、祖先序列重建的“逆向进化”思路,以及机器学习驱动的序列-稳定性关系建模。三种路径各有侧重,又彼此互补,共同指向同一个目标——让酶在工业条件下“站稳脚跟”。

研究方法

作为一篇综述性论文,该文并未开展单一实验,而是系统检索并归纳了近年来蛋白质工程领域针对酶稳定性的研究文献。原文摘要未详述文献检索数据库、筛选标准或纳入研究数量等具体参数,但综述的核心框架围绕三条技术路线展开。

B因子策略:从晶体结构到柔性位点

B因子(也称为温度因子或Debye-Waller因子)源自X射线晶体学数据,反映蛋白质结构中每个原子围绕其平衡位置的位移程度。B因子数值越高,意味着该区域构象越不稳定、柔性越强。综述梳理的研究普遍采用以下流程:首先解析或获取目标酶的晶体结构,计算每个残基的B因子值;随后识别B因子显著高于平均水平的区域——这些柔性区域常位于环区(loop)或结构域边界;最后通过定点突变将这些位点替换为空间位阻更大、疏水性更强的氨基酸(如脯氨酸、亮氨酸或精氨酸),以限制局部构象摆动,降低去折叠倾向。

部分研究还采用了“B因子共识设计”的变体策略——将多个高B因子位点同时突变,再通过组合突变库筛选最优变体。原文摘要未详述具体突变位点数量、所用表达宿主(如大肠杆菌或酵母系统)及突变体筛选温度等参数,但明确指出该方法在提升热稳定性方面已有成功案例。

祖先序列重建:让酶“回到过去”

祖先序列重建(Ancestral Sequence Reconstruction, ASR)的核心理念是:现代酶的祖先版本可能具有更高的热稳定性和底物谱宽泛性,因为远古地球环境温度更高,且祖先酶尚未经历功能特化带来的稳定性牺牲。综述所述ASR流程包括:从公共数据库(如UniProt、NCBI)收集目标酶家族的现存同源序列;利用多序列比对软件(如MAFFT、Clustal Omega)进行比对;基于最大似然法或贝叶斯推断构建系统发育树;在树的内部节点上推测祖先序列;最后合成祖先基因并在异源宿主中表达,测定其热稳定性和催化活性。

原文摘要未提供具体酶家族、所用系统发育软件版本、祖先节点数量或表达纯化条件等细节,但强调ASR在恢复酶热稳定性方面展现出显著效果——部分祖先酶的熔化温度(Tm)比现代酶高出10-20°C,同时保留了可观的催化活性。不过,综述也指出,ASR的成功率高度依赖于序列数据集的覆盖度和系统发育树的可靠性。

机器学习:从数据中学习稳定性的“密码”

机器学习策略代表了蛋白质工程的最新前沿。其基本范式分为三步:数据收集与特征化、模型训练、预测与验证。在数据层面,研究人员从蛋白质数据库(PDB)和突变数据库(如ProTherm)中提取大量酶序列、结构及其对应的稳定性参数(如Tm值、ΔΔG——突变前后折叠自由能变化)。特征化方法包括:基于序列的氨基酸组成、进化保守性打分;基于结构的残基接触数、溶剂可及表面积;以及基于物理化学性质的疏水性、电荷分布等。

模型选择上,综述提及多种算法——从梯度提升树(如XGBoost)、支持向量机到深度神经网络(如卷积神经网络和Transformer架构)。训练后的模型可用于:预测单点突变对稳定性的影响(ΔΔG预测);生成稳定性提升的候选突变体;甚至结合生成式模型从头设计稳定化序列。原文摘要未详述训练集规模、验证集划分比例、模型准确率(如皮尔逊相关系数)或是否采用交叉验证等参数,但明确将机器学习列为当前最具潜力的稳定性工程工具之一。

图3 蛋白质工程策略用于提高酶稳定性
▲ 图3 蛋白质工程策略用于提高酶稳定性

研究结果

综述对三类策略的效能进行了系统比较,尽管原文摘要未提供具体实验数值,但归纳出以下关键发现:

B因子策略的效果与局限:B因子引导的突变能有效降低酶在高温下的失活速率。多篇被引研究显示,针对高B因子区域的单点突变即可将酶在50-60°C下的半衰期延长数倍。例如,某些脂肪酶和糖苷水解酶经B因子设计后,Tm值提升5-15°C。但该策略的局限在于:B因子仅反映晶体状态下的构象波动,与溶液中的动态行为可能不完全一致;且高B因子区域并非总是稳定性决定位点,盲目突变可能损害催化活性。

ASR的“复古”优势:祖先酶通常表现出令人惊讶的热稳定性。综述引用多个案例:某些祖先糖苷酶在80°C以上仍保持活性,而其现代同源酶在60°C即迅速失活;祖先酯酶对有机溶剂的耐受性也显著优于现代版本。ASR的另一优势在于“一石多鸟”——祖先酶往往同时具备更宽的底物谱和更高的pH耐受性。然而,ASR的预测结果依赖计算推断,合成基因的表达量有时低于现代酶,且部分祖先酶可能过于“古老”,其催化效率无法满足工业要求。

机器学习的预测能力:综述强调,机器学习模型在预测突变稳定性影响方面已达到实用水平。对于单点突变,先进模型的ΔΔG预测误差可控制在1 kcal/mol以内(原文摘要未提供具体误差值,此为领域通用水平,非论文数据——编者注)。更重要的是,机器学习能够识别出人类直觉难以发现的非线性序列-稳定性关系,例如协同突变——两个单独有害的突变组合在一起反而提升稳定性。综述还提到,将B因子和祖先序列信息作为机器学习模型的特征输入,可进一步提高预测准确性,这代表了一种“混合策略”的新趋势。

B-factor identification of protein flexible regions and its application in stability design.
▲ B-factor identification of protein flexible regions and its application in stability design.

三类策略的适用场景也有差异:B因子方法适合已有晶体结构、且柔性区域明确的酶;ASR适用于系统发育数据丰富的酶家族;机器学习则依赖高质量的训练数据,在数据充足时预测通量最高。综述指出,实际工程中常将三种方法串联使用——先用ASR或机器学习生成候选突变体,再用B因子分析进行结构层面的验证和优化。

通过界面ΔΔG和B因子分析设计KPHMT [29]。版权所有 2024,美国化学会。
▲ 通过界面ΔΔG和B因子分析设计KPHMT [29]。版权所有 2024,美国化学会。

讨论与展望

这篇综述的价值在于,它没有停留在“哪种方法更好”的简单比较,而是揭示了蛋白质稳定性工程正在从“单点突破”走向“策略融合”。B因子提供结构直觉,ASR带来进化视角,机器学习贡献数据驱动力——三者的结合,有望打破传统定向进化的效率瓶颈。

值得注意的空白在于:现有研究多为单点突变或少数位点的组合突变,对高阶协同突变的系统探索仍显不足;机器学习模型的泛化能力——即在不同酶家族间的迁移预测——也尚待更大规模验证。此外,稳定性提升往往伴随催化活性下降,如何平衡二者仍是工程实践中的核心矛盾。未来的方向可能包括:将AlphaFold等结构预测工具与稳定性模型深度整合,实现从序列到稳定性的端到端预测;以及发展动态机器学习策略,在实验循环中持续更新模型。对于工业界而言,这些方法的成熟意味着“按需定制稳定酶”正在从愿景走向现实。

参考来源

Shi J, Yuan B, Yang H, Sun Z. Recent advances on protein engineering for improved stability. Biodes Res. 2026. PMID: 41415723. DOI: 10.34133/bdr.0057.

PMID: 41415723

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12