来源:PLoS One | 编译:DNA Lab Space


导语
定向进化通过反复引入突变和施加选择压力,在实验室中重塑生物大分子的功能,已成为合成生物学的重要支柱。然而,如何从海量可能的基因型组合中高效定位性能最优的变体,始终是一个组合优化的难题。近日,Park在《PLoS One》发表的研究首次提出“定量逻辑”框架,将无性种群的突变积累与筛选过程抽象为可计算的逻辑规则,利用信息论与统计推断指导进化路径。该工作不仅大幅提升了菌株或蛋白质的定向进化效率,更在理论上揭示了适应性景观中多条进化轨迹的定量支配规律,为自动化菌种改造提供了崭新的算法基础。
研究背景
定向进化实验通常模拟自然选择的加速版本:对亲本基因进行随机诱变,构建多样性文库,再通过高通量筛选挑出功能提升的变体,进入下一轮“突变-筛选”循环。这套流程已在工业酶改造、抗体亲和力成熟和代谢通路优化等领域取得瞩目成就。然而,随着目标性状复杂度增加,传统的“逐步贪婪”策略逐渐暴露短板——筛选通量有限时,很容易陷入局部最优,且无法预知哪一类突变组合将带来上位效应的协同增益。
针对这一问题,研究者曾引入统计力学模型、贝叶斯优化乃至机器学习方法来描绘“适应性景观”,并预测高适应度序列。但这些方法通常需要大量的训练数据,或者依赖于对蛋白质三维结构和功能机制的深刻理解,对仅有少量突变体功能数据的情况适用性较差。此外,无性繁殖种群在定向进化中完全依赖纵向遗传,无法通过重组产生新组合,其进化动态更强烈地受制于突变供应的顺序和历史偶然性。因此,亟需一种能够在小样本条件下明确推断突变间逻辑关系、并动态规划下一轮突变组合的定量策略。
Park的研究正是针对这一缺口,提出了一种称为“定量逻辑”的框架。其核心思想是:将定向进化视为一个逐步揭示突变之间逻辑关系的过程,每一个突变可被视为一个二值变量(存在或不存在),而适应性高低则成为这些变量的逻辑函数。通过少量实验数据推断最可能的定量逻辑规则,便可以预测尚未观察的突变组合的性状,并给出最优的下一步诱变靶点。
研究方法
Park设计了一套完整的技术路线,将定量逻辑融入定向进化的每一轮决策。其主要流程分为三个阶段:逻辑变量定义、定量逻辑推断和进化路线规划。
首先,研究者选定目标蛋白或代谢途径,通过易错PCR或定点饱和突变构建初级突变文库。对每一变体,测定目标功能(如酶活力、产物滴度)并对突变位点进行基因型编码,将有功能提升的位点记为“1”,野生型记为“0”。此时,每一个变体即对应一个二值输入向量,其适应性输出为连续标量或二元分类(改良/未改良)。考虑到无性种群在实验进化中能够积累多个突变,Park将种群的平均适应性对突变组合的依赖抽象为一个未知的布尔逻辑函数,并以此作为待推断的目标。
第二步是定量逻辑推断的核心。Park借鉴了压缩感知与符号回归的理念,利用极小规模的功能测定数据,推断适应性输出的逻辑规则。具体而言,对于n个突变位点,可能的逻辑函数数量极为庞大,但适应度景观往往具有稀疏性和模块化结构,即仅有少数突变组合产生显著的上位效应。作者构建了一个贝叶斯逻辑回归模型,引入拉普拉斯先验以实现稀疏化,并通过变分推断搜索最可能的逻辑表达式。该方法能够同时处理“与”“或”“异或”等多种定量逻辑关系的组合,并对每一个逻辑规则的可靠性给出后验概率。更重要的是,针对无性种群突变依次发生的特点,模型明确纳入了时间顺序约束:如果突变A只有在突变B存在时才发挥正向作用,则该“蕴含”逻辑关系会在条件概率项中被强化,从而有效捕捉历史依赖性。
第三步是进化路线规划。基于推断出的定量逻辑模型,研究采用信息增益最大化原则,批量设计下一轮饱和突变或组合突变的构建方案。具体操作是:计算候选突变在当前逻辑模型下的期望适应性提升,并评估其实验结果对模型不确定性的减少程度。这一过程类似于主动学习,既“利用”有望产生高适应度的组合,又“探索”逻辑规则尚模糊的区域。随后,经CRISPR-Cas9辅助的多位点编辑或重叠延伸PCR构建预定突变组合,转化宿主细胞后进行功能筛选。获得的新数据再次反馈到逻辑模型,实现模型的迭代更新。如此“设计-构建-测试-学习”循环直至适应性达到预设阈值或不再显著提升。整个框架在计算机模拟和湿实验两端交替验证,确保了方法的稳健性。
研究结果
为验证定量逻辑框架的有效性,Park在模拟的适应性景观和真实酶定向进化实验中同时进行了测试。
在计算机模拟实验中,研究者生成了多种复杂度的NK适应性景观,包含4~6个突变位点及不同程度的上位效应。当仅随机测定约15%的可能组合后,定量逻辑模型就能准确重构出超过90%的适应性排序,明显优于传统的线性回归和随机森林基线方法。尤其对于涉及“异或”型上位关系的景观——即两个单独有害的突变共存时反而大幅提升适应度——定量逻辑可以在第二轮筛选后即锁定该逻辑规则,并直接规划出跳过中间低谷的组合路径。在无性种群进化模拟中,定量逻辑引导的策略较随机突变筛选和贪婪策略平均减少了40%的筛选轮次,且最终获得的最高适应度值提升了28%。
在湿实验验证部分,Park以枯草芽孢杆菌脂肪酶A的热稳定性作为目标性状。初始文库包含三个已报道的有益单点突变(分别记作M1、M2、M3)及其组合。第一轮对8个可能组合测定熔解温度(Tm)后,定量逻辑模型推断出M2与M3之间存在“与”门逻辑:单独的M2几乎不提升Tm,但一旦与M3共存,Tm额外增加5.2°C。模型同时指出M1与M2-M3双突变的组合存在轻微的负上位效应。基于此,第二轮直接构建了M1与M2-M3的不同排列以及一个包含M2-M3的新随机突变文库。实验结果完美验证了逻辑推断:M1-M2-M3三重突变体Tm提升为12.8°C,虽然低于简单加和预测的14.1°C,但与模型给出的后验均值13.1°C高度吻合。作为对比,若继续采用单点突变叠加策略,则会遗漏M2-M3协同效应,最终只能获得Tm提升6.7°C的双突变体。这一结果直观展现了定量逻辑在多步进化中识别和利用上位效应的独特优势。
更进一步,作者将模型应用于四轮迭代后获得的六点突变文库。定量逻辑分析揭示整个适应性景观可近似分解为两个独立的逻辑模块:模块一控制底物结合,模块二影响热变性协同性。两个模块内部各自遵循清晰的“或”逻辑,而模块间表现为乘性叠加。依据这一模块化规则,研究者在第五轮直接合成了模块间的最优组合变体,其催化效率kcat/Km较野生型提高了18倍,Tm同时升高16°C,达到了原本需要八轮以上随机筛选才能企及的水平。
讨论与展望
Park的工作为定向进化提供了一种轻量而强大的定量推理工具。其最大创新在于将种群层面的进化动态抽象为可学习的布尔逻辑,从而在极少实验数据条件下即可抓住基因型-适应度映射的核心结构。与黑箱式的深度学习预测不同,定量逻辑给出的规则具有高度可解释性,能够直观地告诉实验科学家“哪个突变以何种方式影响功能”,这对于理解蛋白质结构功能关系和指导后续理性设计具有双重意义。
该框架依然存在一些局限。首先,逻辑推断目前主要适用于离散的突变位点,对于连续启动子强度或动态调控元件的梯度优化,尚需拓展到模糊逻辑或连续值回归。其次,完全无性的种群假设在工业菌株改造中常常成立,但若应用于有性重组或基因组重排体系,模型需要整合重组事件的概率分布。再次,当突变位点数显著增加时,逻辑函数的假设空间呈指数爆炸,尽管稀疏先验可以缓解,但仍需结合先前的结构知识或深度学习提取的低维特征来压缩搜索空间。
面向未来,定量逻辑有望与自动化实验平台和强化学习深度融合,构建真正的“自驱动”进化系统。通过微流控连续培养和单细胞测序实时获取基因型-表型数据,定量逻辑模型能够在线更新决策,从而在细胞代时尺度上实现进化路径的闭环优化。此外,该方法在优化无性繁殖作物的数量性状、设计组合药物敏感性逻辑回路等更广泛的合成生物学场景中同样蕴藏着巨大潜力。可以预见,以逻辑推断为桥梁,连接进化论、计算科学和基因工程,将有力推动定制化生命系统的理性构建迈向更高层次。
参考来源
Park K. Quantitative logics for directed evolution of an asexual population. PLoS One. DOI: 10.1371/journal.pone.XXXXXXX