模拟DBTL循环揭示代谢工程优化中的关键过程参数

来源:Front Bioeng Biotechnol | 编译:DNA Lab Space

📎 相关工具:论文深度润色

代谢工程中的Design-Build-Test-Learn(DBTL)循环被广泛使用,但其效率受实验预算、DNA文库设计和机器学习配置等多重参数共同影响。荷兰代尔夫特理工大学的研究团队利用基于动力学模型的计算机模拟,系统评估了这些参数对四种不同代谢途径优化结果的影响。研究发现,筛选能力是优化成功的主导因素,而DNA测序能力的影响却出人意料地小。该成果发表于《Frontiers in Bioengineering and Biotechnology》。

研究背景

代谢工程的目标是通过改造微生物的代谢网络,使其高效生产目标化合物。面对海量的基因组合可能性,研究人员通常采用DBTL循环这一工程框架来指导菌株优化。每个循环包括设计DNA文库、构建突变菌株、测试其性能、学习数据并指导下一轮设计。

然而,DBTL循环的实际效果取决于大量实验和算法设计选择。DNA文库的构建方式、测序深度、筛选通量、机器学习模型的配置——这些参数如何共同影响最终的菌株优化成果,此前缺乏系统性认识。

真实世界的代谢工程实验耗时费力,一个完整的DBTL循环可能需要数周甚至数月。用计算机模拟替代部分实验,可以在投入湿实验之前预判不同策略的优劣。这正是该研究的出发点——利用已有的动力学模型框架,在四种代谢途径上模拟执行多轮DBTL循环,定量比较不同过程参数组合下的优化效果。

研究方法

研究团队采用了一种此前开发的、基于动力学模型的模拟框架。该框架能够在计算机中构建代谢途径的动力学模型,并模拟多轮DBTL循环的完整流程。

四种代谢途径模型——研究选择了四种不同的代谢途径模型作为测试平台。原文摘要未详述这四种途径的具体名称和生物学功能,但强调它们代表了不同的代谢网络结构特征。

模拟DBTL循环流程——每个模拟循环包含四个阶段。在设计阶段,研究团队设定了不同的DNA文库构建策略。构建阶段模拟将遗传元件随机整合到宿主菌株基因组中。测试阶段评估各突变菌株的目标产物产量。学习阶段则采用机器学习算法分析数据,指导下一轮文库设计。

关键过程参数——研究系统考察了三类过程参数。第一类是DNA文库设计参数,包括可编辑位点数量和基因靶点集合大小。第二类是实验预算限制,包括筛选能力和DNA测序能力——即每个循环中能够测试多少菌株、能够对多少菌株进行全基因组测序。第三类是机器学习配置,包括算法选择、训练数据使用方式等。

对照策略设计——研究设置了两种核心策略进行对比。基线策略为随机DNA文库转化法:每个循环随机构建DNA文库,选择表现最好的菌株作为下一轮的亲本。机器学习辅助策略则采用梯度强盗算法(gradient bandit algorithm),根据预测的生产力迭代更新菌株选择偏好。论文原文详细描述了梯度强盗算法的更新机制:算法维护一组选择偏好参数,每轮根据预测产量更新这些参数,从而逐步偏向高产量菌株的设计空间区域。

优化轮次设定——研究选择执行五轮DBTL循环。论文指出,五轮是在真实世界中可能遇到的循环次数,既足以观察趋势,又不至于计算负担过重。

采样策略对比——研究比较了两种测序采样策略。一种是对产量最高的菌株进行测序(top-producing selection),另一种是分层抽样(stratified sampling),即在不同产量区间均匀选取菌株测序。前者偏向开发(exploitation),后者偏向探索(exploration)。

机器学习配置——研究考察了机器学习模型的不同配置方式对优化效果的影响。具体配置参数(如学习率、网络结构、训练轮数等)在原文摘要中未详述,但研究明确指出机器学习配置是影响优化结果的三类关键过程参数之一。

Evaluating process variables for pathway model (A) . In plots D-H, the purple bar represents the baseline scenario ( S = 100 , N = 50 , F = 10 , P = 6 , X = 4 , β = 10 ) . Three categories of process parameters are illustrated with pictograms: parameters related to ML, those related to the DBTL cycl
▲ Evaluating process variables for pathway model (A) . In plots D-H, the purple bar represents the baseline scenario ( S = 100 , N = 50 , F = 10 , P = 6 , X = 4 , β = 10 ) . Three categories of process parameters are illustrated with pictograms: parameters related to ML, those related to the DBTL cycl

研究结果

筛选能力是主导因素——模拟结果显示,在影响菌株优化成功的所有过程参数中,筛选能力(即每个循环能够测试的菌株数量)是最主要的驱动因素。筛选能力越大,优化效果越好。这一结论在四种代谢途径模型中表现一致。

测序能力影响微弱——与直觉相反,DNA测序能力对优化成功的影响非常小。尽管测序数据对机器学习模型的训练至关重要,但增加测序通量并不能显著改善优化结果。论文原文用"surprisingly little impact"(出人意料地小)来描述这一发现。研究认为,这可能是因为在有限的实验预算下,筛选通量决定了搜索空间的覆盖广度,而测序深度对模型训练的边际贡献相对有限。

测序采样策略的取舍——选择产量最高的菌株进行测序,其优化效果始终优于分层抽样。这表明,在DBTL循环的语境下,将有限的测序资源集中于表现最好的菌株,比均匀覆盖不同产量区间的策略更能推动菌株优化进程。论文指出,这一结果凸显了预测准确性与优化效率之间的权衡——分层抽样可能提供更全面的模型训练数据,但牺牲了优化效率。

DNA文库结构的效应——DNA文库结构对优化性能有强烈影响。具体而言,增加可编辑位点的数量通常能改善优化结果。可编辑位点是指DNA文库中允许发生突变或重组的基因位置,位点越多,每轮循环能够探索的序列空间越大。

基因靶点集合的双刃剑效应——然而,扩大基因靶点集合却可能阻碍优化进程。论文将这一现象归因于维度增加或采样稀疏——当靶点基因数量增多,设计空间的维度随之升高,在有限的筛选能力下,每个维度能够被充分探索的样本数减少,导致优化效率下降。这一发现提示,在设计DNA文库时,并非基因靶点越多越好,需要在设计空间规模和采样密度之间寻找平衡。

筛选能力对机器学习辅助优化性能有显著影响。(A) 通路模型A-C的优化问题具有6个基因靶点(F=6),而通路模型D包含5个靶基因(F=5)。所有模型均考虑6个文库位置(P=6)。筛选能力对曲线下面积性能影响显著,而DNA测序对优化性能影响甚微。(B–D) 通路模型B-D的相似热图。
▲ 筛选能力对机器学习辅助优化性能有显著影响。(A) 通路模型A-C的优化问题具有6个基因靶点(F=6),而通路模型D包含5个靶基因(F=5)。所有模型均考虑6个文库位置(P=6)。筛选能力对曲线下面积性能影响显著,而DNA测序对优化性能影响甚微。(B–D) 通路模型B-D的相似热图。

机器学习辅助策略的优势——机器学习辅助的推荐策略在大多数场景下优于随机DNA文库转化基线。梯度强盗算法能够根据历史数据不断调整菌株选择偏好,使得每一轮的文库设计都更加聚焦于高产量区域。不过,论文原文未提供具体的产量提升百分比数据,仅以定性方式描述了这一优势。

四种途径模型的共性——上述结论在四种不同的代谢途径模型中得到了一致验证。这表明,尽管代谢途径的拓扑结构和动力学特征各异,但DBTL循环过程参数的影响规律具有跨途径的普适性。

对DBTL工作流设计的启示——研究为设计更有效的DBTL工作流提供了可操作的指导。在预算有限的情况下,优先扩大筛选能力比增加测序通量更能提升优化效果。在测序资源分配上,应优先对高产量菌株进行测序。在文库设计上,适度增加可编辑位点有利,但盲目扩大基因靶点集合可能适得其反。

DNA测序菌株的选择方法(A–D)途径模型的优化结果。分层方法在生产值范围内均匀选择,而最佳采样方法选择最高产菌株(见材料与方法)。一般而言,产物优化倾向于最佳采样方法。(E–H)XGBoost模型的Pearson相关系数R²。分层采样方法通常表现出更高的性能。
▲ DNA测序菌株的选择方法(A–D)途径模型的优化结果。分层方法在生产值范围内均匀选择,而最佳采样方法选择最高产菌株(见材料与方法)。一般而言,产物优化倾向于最佳采样方法。(E–H)XGBoost模型的Pearson相关系数R²。分层采样方法通常表现出更高的性能。

讨论与展望

这项研究的价值在于将DBTL循环从"经验驱动"推向"可量化预测"。模拟框架让研究人员能够在投入湿实验前,预先评估不同策略组合的潜在收益。筛选能力的主导地位和测序能力的微弱影响,这两个发现尤其值得注意——它们挑战了"更多测序数据必然带来更好模型"的直觉假设。

当然,模拟研究有其固有局限。动力学模型的准确性取决于参数质量,而真实实验中的噪声、脱靶效应、菌株适应性代价等因素在模拟中难以完全复现。论文原文摘要未提供模拟框架的具体验证数据,也未详述四种代谢途径模型的参数来源。

未来方向可能包括将更多真实实验数据纳入模拟框架,验证模拟预测与实际实验结果的一致性。此外,模拟框架也可扩展至更多样的代谢途径和更复杂的文库设计策略。原文未详述这些方向,但模拟框架的可扩展性为其应用于更广泛的代谢工程场景留下了空间。

参考来源

Van Lent P, Paz SM, Schmitz J, Abeel T. Comparing metabolic engineering scenarios using simulated design-build-test-learn-cycles. Front Bioeng Biotechnol. PMID: 42434402.

PMID: 42434402

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 基于染色质可及性的酿酒酵母基因表达水平多机器学习模型预测 09-12