模拟DBTL循环:用计算机预演代谢工程改造的成败关键

来源:Front Bioeng Biotechnol | 编译:DNA Lab Space

📎 相关工具:参考文献格式化

导语:代谢工程中的设计-构建-测试-学习(DBTL)循环耗时耗力,参数选择却常凭经验。比利时根特大学的研究团队用动力学模型在计算机里完整跑完五轮DBTL循环,系统评估了DNA文库设计、实验预算和机器学习配置对菌株优化效果的影响。结果出人意料:测序能力对优化成功的影响微乎其微,而筛选通量才是真正的胜负手。

研究背景

代谢工程改造微生物菌株,本质上是面对一个巨大的组合设计空间——基因靶点、启动子、拷贝数、表达强度,每个维度都有无数种排列方式。面对如此庞大的搜索空间,工程学家提出了DBTL循环框架:设计DNA文库,构建突变菌株,测试表型性能,学习数据规律,然后进入下一轮迭代。

这个框架听起来条理清晰,实际操作却充满岔路口。DNA文库该怎么做?随机整合还是理性设计?测序多少株?筛选多少株?机器学习模型用哪种算法?每一轮循环的预算怎么分配?这些参数相互纠缠,共同决定最终优化效果。在真实实验中,一轮DBTL循环往往需要数周时间和大量经费,想用试错法摸清这些参数的影响,成本高得难以承受。

模拟仿真提供了另一条路径。如果能在计算机里用代谢动力学模型模拟DBTL循环的全过程,就能以极低成本系统比较不同策略组合的优劣。这正是Van Lent等人开展这项研究的出发点——他们使用先前开发的基于动力学模型的框架,在四种不同的代谢途径模型上,定量评估关键过程参数对菌株优化结果的影响。

研究方法

研究团队构建了完整的计算机模拟DBTL循环流程,核心是比较两种策略:ML辅助推荐策略和随机DNA文库转化基线策略。

Evaluating process variables for pathway model (A) . In plots D-H, the purple bar represents the baseline scenario ( S = 100 , N = 50 , F = 10 , P = 6 , X = 4 , β = 10 ) . Three categories of process parameters are illustrated with pictograms: parameters related to ML, those related to the DBTL cycl
▲ Evaluating process variables for pathway model (A) . In plots D-H, the purple bar represents the baseline scenario ( S = 100 , N = 50 , F = 10 , P = 6 , X = 4 , β = 10 ) . Three categories of process parameters are illustrated with pictograms: parameters related to ML, those related to the DBTL cycl

基线策略的操作逻辑很直接:每一轮DBTL循环中,通过随机整合遗传元件到宿主菌株来构建DNA文库,测试后选出性能最优的菌株作为下一轮循环的亲本。这种"挑最好的继续迭代"的做法,是现实中许多实验室采用的朴素方案。

ML辅助策略则引入了强化学习中的梯度赌博机算法。该算法根据模型预测的生产力,迭代更新菌株选择的偏好权重。每一轮循环中,算法根据当前偏好从候选菌株中做出选择,测试后获得真实性能反馈,再据此调整下一轮的偏好参数。这种策略的核心思想是让算法在循环过程中不断"学习",逐渐把选择倾向调整到高产出区域。

两种策略都设定为五轮DBTL循环。作者选择五轮的原因很实际——这是真实世界实验中可能遇到的循环次数。每轮循环都包含完整的构建、测试和学习步骤,模拟过程完全基于代谢动力学模型的计算结果。

研究覆盖了三大类关键过程参数。第一类是DNA文库设计参数,包括可编辑位点数量和基因靶点集合规模。第二类是实验预算限制参数,包括筛选容量(即每轮能测试多少株菌)和DNA测序容量(即能对多少株菌进行测序)。第三类是机器学习配置参数,涉及ML模型的具体设置。

筛选能力对机器学习辅助优化性能有重要影响。(A)途径模型A-C的优化问题有6个基因靶点(F=6),而途径模型D由5个靶基因组成(F=5)。所有模型均考虑6个文库位置(P=6)。筛选能力对曲线下面积性能有重要影响,而DNA测序对优化性能影响甚微。(B–D)途径模型B-D的类似热图。
▲ 筛选能力对机器学习辅助优化性能有重要影响。(A)途径模型A-C的优化问题有6个基因靶点(F=6),而途径模型D由5个靶基因组成(F=5)。所有模型均考虑6个文库位置(P=6)。筛选能力对曲线下面积性能有重要影响,而DNA测序对优化性能影响甚微。(B–D)途径模型B-D的类似热图。

实验在四种不同的代谢途径模型上重复进行。这四种模型代表了不同的代谢网络拓扑结构和动力学特征,使研究结论具有更广的适用性。每个参数组合下,模拟DBTL循环都会完整运行五轮,记录最终的菌株优化效果。

关于具体的模型参数、模拟运行次数、计算平台等细节,原文摘要未详述具体参数。但研究框架的底层逻辑是清晰的:用动力学模型替代真实菌株,用计算模拟替代湿实验操作,从而在完全可控的条件下探索参数空间。

研究结果

模拟结果揭示出几个鲜明且反直觉的规律。

筛选容量是优化成功的主导驱动因素。在四种代谢途径模型上,提高每轮循环能够测试的菌株数量,都显著改善了最终优化效果。这个结果符合直觉——更多的筛选意味着更大的搜索空间覆盖,更有可能找到高产出菌株。但作者进一步发现,筛选容量的影响远大于其他参数,这提示实验设计时应当优先保证足够的筛选通量。

DNA测序容量对优化结果的影响出人意料地小。测序通常被视为机器学习建模的基础——没有足够的数据,模型怎么学习?但模拟结果显示,即使测序容量增加,优化效果也没有明显提升。作者指出,尽管测序对模型训练很重要,但在DBTL循环的优化效率层面,它的边际贡献远低于筛选容量。

选择策略显著影响优化效率。研究比较了两种菌株选择方式:一种是最优菌株优先测序——把产量最高的菌株优先送去测序;另一种是分层抽样——按产量分层后均匀采样测序。结果显示,选择最优菌株进行测序的策略始终优于分层抽样策略。这个结果揭示了预测准确性与优化效率之间的权衡:分层抽样能提供更全面的训练数据,理论上有利于模型预测精度;但最优菌株优先策略把有限的测序预算集中在最有价值的样本上,从而更直接地推动优化进程。

DNA文库结构对性能有强烈影响,且影响方向并不一致。增加可编辑位置的数量通常能改善优化结果——更多的可编辑位点意味着更大的设计空间,为搜索算法提供了更多可能性。但扩大基因靶点集合却可能阻碍优化进程。作者将这一现象归因于维度的增加和采样的稀疏化:靶点多了,每个靶点被充分探索的机会就少了,算法在高维空间中更容易迷失方向。

DNA测序菌株的选择方法(A–D)途径模型的优化结果。分层方法在生产值范围内均匀选择,而最佳采样方法选择最高产的菌株(见材料与方法)。一般而言,产物优化更倾向于最佳采样方法。(E–H)XGBoost模型的Pearson相关系数R²。分层采样方法通常表现出更高的性能。
▲ DNA测序菌株的选择方法(A–D)途径模型的优化结果。分层方法在生产值范围内均匀选择,而最佳采样方法选择最高产的菌株(见材料与方法)。一般而言,产物优化更倾向于最佳采样方法。(E–H)XGBoost模型的Pearson相关系数R²。分层采样方法通常表现出更高的性能。

四种代谢途径模型的结果在定性层面保持一致,但在具体数值上存在差异。原文摘要未提供具体数值数据,但研究结论的稳健性得到了多模型验证。

这些发现共同勾勒出一幅清晰的图景:DBTL循环的优化效果并非由单一参数决定,而是多个参数交互作用的结果。其中,筛选容量和DNA文库结构是最关键的杠杆点,而测序容量的重要性被高估了。

讨论与展望

这项研究的价值在于,它用计算机模拟的方式,在真实实验投入之前就为DBTL工作流程的设计提供了可操作的指导。筛选容量优先、最优菌株优先测序、谨慎扩大基因靶点集合——这些原则可以直接转化为实验设计的决策依据。

研究也存在明显的边界。动力学模型的保真度决定了模拟结果的可靠性,而真实菌株的生理复杂性远超任何模型。此外,研究聚焦于四种代谢途径模型,结论能否推广到更广泛的代谢工程场景,仍需进一步验证。

模拟框架的潜力远不止于此。随着模型精度的提升和计算效率的改进,这类仿真工具可能成为代谢工程实验设计的标准前置步骤——在动手构建菌株之前,先在计算机里跑几轮虚拟DBTL循环,把参数空间摸清楚,把策略选好,再进入实验室。这种"先模拟、后实验"的工作范式,或许能大幅降低代谢工程的时间成本和经济成本。

参考来源

Van Lent P, Paz SM, Schmitz J, Abeel T. Comparing metabolic engineering scenarios using simulated design-build-test-learn-cycles. Front Bioeng Biotechnol. PMID: 42434402.

PMID: 42434402

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 基于染色质可及性的酿酒酵母基因表达水平多机器学习模型预测 09-12