来源:Front Bioeng Biotechnol | 编译:DNA Lab Space
代谢工程中的设计-构建-测试-学习(DBTL)循环,本质是一场与实验成本的拉锯战。每一次循环都涉及DNA文库构建、菌株筛选、测序验证和机器学习模型更新,任何一个环节的参数选择都可能左右最终优化结果。然而,这些参数之间的交互作用究竟如何影响菌株优化的成败,此前缺乏系统性的定量评估。荷兰代尔夫特理工大学的研究团队在《Frontiers in Bioengineering and Biotechnology》发表论文,利用基于代谢动力学模型的计算机模拟,系统比较了四种不同代谢途径模型中关键过程参数对优化结果的影响。研究发现,筛选通量是决定优化成功的主导因素,而DNA测序能力的影响却出乎意料地微弱。这一结论为实验人员合理分配有限预算提供了直接参考。
研究背景
DBTL循环是代谢工程领域广泛采用的工程框架,其核心逻辑是通过反复迭代,逐步积累有益突变,最终获得高产菌株。然而,一个完整的DBTL循环涉及大量可调参数:DNA文库的构建方式决定了遗传多样性的来源;实验预算约束了筛选和测序的规模;机器学习算法的配置影响了学习效率和推荐质量。这些参数相互纠缠,单独优化某一个往往顾此失彼。
真实世界的代谢工程实验耗时长、成本高,一次完整的DBTL循环可能需要数周乃至数月。在这种背景下,基于动力学模型的计算机模拟提供了一条低成本探索路径——在投入实验资源之前,先用算法预演不同策略的可能结果。本研究正是沿着这一思路,将此前开发的动力学模型框架应用于四个不同的代谢途径优化任务,系统比较了多种DBTL过程参数的作用。
研究方法
研究者采用了一种基于动力学模型的计算机模拟框架,对DBTL循环的全过程进行仿真。该框架在此前的工作中已有报道(van Lent et al., 2023),本研究将其应用于四个不同的代谢途径模型,以评估过程参数对优化结果的影响。
模拟实验设置了两种对照策略。基线策略模拟传统的随机DNA文库转化流程:每一轮DBTL循环中,通过将遗传元件随机整合到宿主菌株基因组来构建DNA文库,然后筛选表现最佳的菌株作为下一轮循环的亲本。机器学习辅助策略则采用梯度bandit算法,根据预测的生产力迭代更新菌株选择偏好(van Lent et al., 2025b; Sutton et al., 1998),从而在学习过程中逐步优化推荐方向。
两种策略均执行五轮DBTL循环。研究者解释,五轮是真实实验场景中可能遇到的循环次数,既足以观察优化趋势,又不至于因循环过多而偏离实际应用场景。
研究考察的关键过程参数分为三类。第一类是DNA文库设计参数,包括可编辑位点的数量和基因靶点的范围。第二类是实验预算限制参数,涉及筛选通量和DNA测序能力——前者指每轮循环中能够测试的菌株数量,后者指能够进行测序验证的菌株数量。第三类是机器学习配置参数,涵盖算法学习率、探索-利用平衡等设置。
在采样策略方面,研究者比较了两种方式:一种是对产量最高的菌株进行测序(top-producing selection),另一种是分层采样(stratified sampling)。前者倾向于集中资源在表现最优的个体上,后者则试图保持样本的多样性。
每个模拟场景均在四个代谢途径模型上重复运行,以检验结论的普适性。由于原文摘要未详述具体模型名称、模拟运行的重复次数、具体的机器学习超参数数值以及模拟的时间尺度,这些细节在原文中未提供。
研究结果
模拟结果显示,不同过程参数对优化结果的影响差异悬殊。最引人注目的发现是,筛选通量——即每轮循环中能够测试的菌株数量——是驱动优化成功的主导因素。筛选能力越强,最终获得的菌株产量越高,优化进程也越稳定。这一结果符合直觉:测试更多菌株意味着更充分地探索基因型空间,增加了发现高产菌株的概率。
与之形成鲜明对比的是,DNA测序能力对优化结果的影响出乎意料地小。测序是机器学习模型训练的数据来源,按常理推断,测序深度应当直接影响模型预测精度,进而影响后续推荐质量。然而模拟结果显示,即使测序能力有限,只要筛选通量足够高,优化结果依然良好。这表明在DBTL循环中,筛选环节对结果的直接贡献可能远大于测序环节——测序的作用更多体现在长期学习积累,而非单轮循环的即时产出。
采样策略的选择同样显著影响优化效果。对产量最高的菌株进行测序,其表现始终优于分层采样策略。这意味着,尽管分层采样能够提供更全面的数据分布,有助于训练更精确的预测模型,但从优化效率的角度看,集中资源关注顶尖个体更能加速迭代进程。研究者指出,这反映了预测精度与优化效率之间的一种权衡——追求模型准确性未必等同于追求最优的工程结果。
DNA文库结构对优化性能的影响呈现复杂的非线性特征。增加可编辑位点的数量通常能够改善优化结果,因为更多的可编辑位点意味着更大的序列空间,为进化提供了更多可能性。然而,扩大基因靶点的集合却可能阻碍优化进程。研究者分析,这可能是因为靶点增多导致问题维度上升,在有限的筛选通量下,每个靶点被充分采样的概率下降,稀疏采样使得优化算法难以有效收敛。
四个代谢途径模型之间的比较显示,上述趋势在不同途径中基本保持一致,但具体幅度存在差异。某些途径对参数变化更敏感,另一些则相对稳健。原文摘要未提供各模型的具体产量数值或优化提升倍数,因此无法进行定量比较。
讨论与展望
这项研究的价值在于将DBTL循环从经验驱动推向数据驱动。通过计算机模拟,研究者能够在投入真实实验之前,预先评估不同策略的优劣——这种做法本身就是一个"学习"环节,只不过学习对象从生物系统换成了虚拟模型。
筛选通量与测序能力之间的不对称性,对实验设计具有直接指导意义。许多实验室在测序上投入大量资源,期望通过更全面的数据收集来提升模型性能。但模拟结果表明,在预算有限的情况下,优先扩大筛选规模可能比增加测序深度带来更高的回报。当然,这一结论基于模拟模型,真实生物系统的复杂性可能引入额外变量。
采样策略的发现同样值得关注。机器学习领域通常强调训练数据的代表性,分层采样正是这一原则的体现。然而在DBTL循环的语境下,优化效率优先于预测精度——与其让模型"见多识广",不如让它"聚焦精英"。这一权衡关系在不同代谢途径中的一致性,暗示其可能具有普遍性。
模拟框架本身也存在局限。动力学模型的准确性依赖于对代谢网络的理解深度,模型未覆盖的调控机制可能导致模拟结果与真实实验偏离。此外,模拟中的ML算法仅为梯度bandit一种,其他算法(如贝叶斯优化、强化学习)的表现可能不同。未来研究可在更多样的算法配置和更复杂的代谢网络模型上验证这些结论。
无论如何,这项研究为DBTL工作流的设计提供了量化依据,也展示了模拟框架在实验实施前探索策略空间的价值。在代谢工程日益依赖大数据和机器学习的今天,这种"先模拟、后实验"的研究范式,或将成为标准流程的一部分。
参考来源
Van Lent P, Paz SM, Schmitz J, Abeel T. Comparing metabolic engineering scenarios using simulated design-build-test-learn-cycles. Front Bioeng Biotechnol. PMID: 42434402.
PMID: 42434402