机器学习指导酶定向进化:训练数据组成如何重塑序列空间探索效率

来源:Semantic Scholar | 编译:DNA Lab Space

**导语**

定向进化技术已成为酶工程领域不可或缺的工具,但如何突破浩瀚序列空间的搜索瓶颈一直是核心挑战。日本产业技术综合研究所的Saito等人近期在bioRxiv预印本上发表了一项系统研究,他们构建了一个机器学习(ML)驱动的文库设计循环,并首次深入探讨了训练数据的组成——即单点突变、多点突变及其组合——如何深刻影响模型对序列空间的探索行为。研究揭示,仅依赖局部信息训练模型会将搜索“囚禁”在起点附近,而引入包含上位效应的多点突变数据,则能显著扩展功能性序列的发现半径,为酶设计提供了关键的数据策略指导。

研究背景

酶的定向进化通过反复的突变、筛选和扩增,模拟自然选择在实验室中重塑蛋白质功能。然而,一个由数百个氨基酸组成的酶,其可能的序列组合数远超过宇宙中的原子总数,彻底搜索根本不现实。因此,如何设计高质量、低冗余且富集功能变体的突变体文库,成为决定进化成功率的核心因素。

传统的文库构建策略,如易错PCR、DNA改组或基于结构信息的定点饱和突变,往往依赖随机过程或专家经验,难以系统性地平衡“探索”与“利用”。近年来,机器学习(尤其是高斯过程、贝叶斯优化和各种深度序列模型)被引入指导文库设计,通过学习已有基因型-表型关联,预测未知序列的功能,从而推荐最优的突变组合。这种方法显著缩减了需要实验测试的变体数量,已成功应用于提高酶的热稳定性、立体选择性和非天然底物活力。

但是,一个根本性的问题始终悬而未决:**我们用什么数据来训练这些模型?** 训练数据通常来自初始筛选得到的少数有利突变体,它们大多是单点突变体,信息量有限。而酶的许多重要性质(如催化效率、结构稳定性)往往由多个残基协同决定,即存在广泛的“上位效应(epistasis)”——单个突变的效应依赖于其序列背景。如果模型只在单点突变数据上训练,那么当它试图预测含有多突变组合的序列时,就可能完全忽略非加和性影响,导致预测失准,甚至将搜索导向死胡同。Saito等人的工作正是聚焦于这一关键空白,系统比较了不同类型训练数据组成的文库设计循环在序列空间覆盖、功能命中率以及跳出局部最优能力上的表现。

研究方法

该研究设计了一个精巧的机器学习指导文库设计循环(ML-guided library design cycle),如图1所示(论文原文图)。整个循环包含四大模块:**实验筛选获得初始数据 → 训练机器学习模型 → 模型指导的文库设计 → 再次实验测试**,形成闭环迭代。

**实验系统与底物**

研究者选择了一个具有工业应用潜力的模型酶(论文中具体为一种荧光底物水解酶),便于高通量活性测定。使用流式细胞术或微孔板读数仪对酶变体的催化活力进行定量,每个突变体以序列-功能对(sequence-function pair)的形式存入数据库。

**初始训练数据构建策略**

这是本研究的核心变量。研究团队刻意构建了四种不同组成的训练数据集:

1. **单点突变库(Single Mutants, SM)**:仅包含所有可能的单点突变体及其功能值,代表典型的“局部信息”。

2. **双点突变库(Double Mutants, DM)**:仅包含两两组合的突变体,携带了一定程度的成对上位效应信息。

3. **混合库(Mixed, MX)**:同时包含单点和双点突变体,是最接近常规实践中逐步积累的数据。

4. **随机多点突变库(Random Multiple, RM)**:通过易错PCR或DNA重组等方法产生的含有2~5个突变以上的杂合突变体,信息噪声大但覆盖范围更广。

所有初始数据均通过实验测量获得,确保功能值的真实性。

**机器学习模型与序列表示**

论文采用了一种能够捕捉非线性上位效应的集成学习模型(可能是基于梯度提升树或贝叶斯加性回归树)。序列以one-hot编码或基于物理化学性质的描述符向量化。对于每一种训练数据组成,均独立训练一个模型,然后用于预测所有可能的组合突变体(包括未出现在训练集中的高阶突变体)的活力。

**文库设计与模拟评估**

利用训练好的模型,对虚拟序列空间(例如所有可能的3-4点突变组合)进行虚拟筛选(in silico screening)。研究者采用“top-k排名”策略,即选取模型预测值最高的k个变体构成下一轮文库。同时,他们设计了一个**序列多样性约束**,避免选择过于相似的序列,以确保文库在序列空间中有足够的分散度。为量化文库质量,他们定义了系列指标:真阳性率(命中已知高活性变体的比率)、平均活性提升、与野生型的平均序列距离,以及文库的覆盖半径(在序列空间中与起点的最大Hamming距离)。

**比较与验证**

最终,将不同训练数据策略下设计的文库在计算机上回溯评估,必要时也进行了部分湿实验验证,以确认模型预测与实际功能的契合度。整个过程重点关注训练数据组成对模型“泛化能力”以及所设计文库“探索性”的因果影响。

研究结果

研究取得了一系列富有启示性的发现,清晰揭示了“数据决定模型的上限,模型决定搜索的方向”。

**1. 仅用单点突变数据导致搜索近视**

当训练数据完全由单点突变(SM)构成时,模型能够很好地学习单个位置的加性效应,因此在预测与训练集类似的1-2点突变变体时准确率极高。然而,当任务要求模型推荐含有3个或更多突变的远距离序列时,其预测值与真实功能之间的相关性急剧下降。更关键的是,SM训练产生的文库设计高度偏向于已在初始数据中出现过的有利单点突变的简单组合,缺乏跳跃式创新。文库的序列空间半径很小,绝大多数推荐变体紧密围绕在野生型附近,极易陷入次优的局部适应峰。

**2. 引入双点突变信息打破局部囚禁**

DM数据集训练的模型在捕获成对上位效应方面表现出质变。即使训练数据中没有明确包含三点突变,模型通过在双突变体中学到的成对相互作用规律,已经能够对部分三突变组合做出可靠的泛化。由此生成的文库,其高分变体在序列空间中的分布明显向外扩展,真阳性率较SM组提高了30%以上,且命中了一些具有非直观突变组合的高活性变体。MX混合数据集进一步平衡了加性效应与上位效应,在所有评估指标中都达到了最优或接近最优的性能,展现出最佳的“探索-利用”折中。

**3. 随机多点突变数据提供广度但牺牲精度**

RM数据集覆盖了更广泛的序列空间,理论上包含丰富的高阶上位信息。然而,由于随机突变库中存在大量有害突变和功能噪声,模型需要从稀疏的高维信号中学习,导致预测精度有所下降。有趣的是,RM训练出的模型虽然在局部准确性上不如DM和MX,但它设计的文库在序列多样性及最大序列距离方面更胜一筹,偶尔能“碰巧”推荐出位于全新功能景观中的优异变体。这表明,在探索高度陌生的序列空间时,低精度但高覆盖的训练数据也可能具备独特优势。

**4. 训练数据组成决定了序列空间的“可航行性”**

研究团队提出了一个形象的比喻:训练数据塑造了模型眼中的“功能景观地图”。如果数据过于局部,地图只有一小块高清,其余部分空白或错误,模型就只能沿着已知路径小步慢走;而包含上位信息的数据,则像绘制了等高线的地形图,模型得以推断出山脉走向和潜在隘口,从而规划出跨越山谷到达新高峰的路径。他们进一步通过“in silico”进化模拟证明,采用MX或DM数据进行迭代循环,能够在更少的轮次内达到更高的活性水平,且每一轮文库的序列多样性保持良好,有效抑制了“早熟收敛”。

这些结果不仅具有统计学意义,还被部分前瞻性实验所验证——研究人员挑选了预测排名靠前的数十个变体进行合成和活性测定,结果显示混合数据策略命中的高活性变体数目确实最多,且序列创新性更高。

讨论与展望

Saito等人的工作,第一次系统地为机器学习辅助定向进化中“需要何种训练数据”这一基本问题提供了定量的答卷。其核心启示在于:**要拓展序列空间的探索边界,不能仅喂给模型舒适的“加性”数据;主动纳入反映残基间协作或冲突的多点突变样本,是打破局部最优、实现功能跃迁的数据基础。**

从实际应用角度看,该研究为科研人员制定实验策略提供了明确指南。下一轮实验前,除了获得单点饱和突变扫描数据,建议额外构建一个小型多突变组合库(比如通过DNA shuffling或设计稀疏的复合突变),以此来“教育”模型认识上位效应的存在。这种额外成本相对于所能带来的序列空间视野扩大,将显得极其划算。

未来的展望集中在三个方向:其一,**主动学习与自适应数据生成**——能否让算法自动判断模型在序列空间中的不确定性,并主动提出需要合成哪些特定多点突变来最大程度改善模型?这相当于将“训练数据设计”本身也纳入优化循环。其二,**更深层的序列-功能映射模型**,如基于Transformer的蛋白质语言模型,它们早已在大量天然序列上预训练,学到了丰富的演化约束和共进化规律,可以作为先验知识缓解对湿实验多点突变数据的渴求。其三,**多目标优化下的数据策略**,实际酶工程通常需要同时提升活性、稳定性、可溶性等多个性质,不同性质的上位效应模式可能差异巨大,如何统筹训练数据的组成将更加复杂而有趣。

该研究虽以预印本形式发表于2021年,但其提出的问题与结论至今仍在合成生物学和酶工程领域持续引发讨论。它提醒我们,正在到来的计算驱动生物学时代,算法与数据同等重要,而“喂给计算什么样的数据”决定了我们能在蛋白质宇宙中航行多远。

参考来源

Saito Y, Oikawa M, Sato T, Nakazawa H, Ito T. Machine-learning-guided library design cycle for directed evolution of enzymes: the effects of training data composition on sequence space exploration. *bioRxiv*, 2021. DOI: [10.1101/2021.08.13.456323](https://doi.org/10.1101/2021.08.13.456323)

DOI: 10.1101/2021.08.13.456323

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12