来源:Front Bioeng Biotechnol | 编译:DNA Lab Space
导语:代谢工程中的设计-构建-测试-学习(DBTL)循环耗时耗力,参数选择却常凭经验。比利时根特大学的研究团队用动力学模型在计算机里完整跑完五轮DBTL循环,系统评估了DNA文库设计、实验预算和机器学习配置对菌株优化效果的影响。结果出人意料:测序能力对优化成功的影响微乎其微,而筛选通量才是真正的胜负手。
研究背景
代谢工程改造微生物菌株,本质上是面对一个巨大的组合设计空间——基因靶点、启动子、拷贝数、表达强度,每个维度都有无数种排列方式。面对如此庞大的搜索空间,工程学家提出了DBTL循环框架:设计DNA文库,构建突变菌株,测试表型性能,学习数据规律,然后进入下一轮迭代。
这个框架听起来条理清晰,实际操作却充满岔路口。DNA文库该怎么做?随机整合还是理性设计?测序多少株?筛选多少株?机器学习模型用哪种算法?每一轮循环的预算怎么分配?这些参数相互纠缠,共同决定最终优化效果。在真实实验中,一轮DBTL循环往往需要数周时间和大量经费,想用试错法摸清这些参数的影响,成本高得难以承受。
模拟仿真提供了另一条路径。如果能在计算机里用代谢动力学模型模拟DBTL循环的全过程,就能以极低成本系统比较不同策略组合的优劣。这正是Van Lent等人开展这项研究的出发点——他们使用先前开发的基于动力学模型的框架,在四种不同的代谢途径模型上,定量评估关键过程参数对菌株优化结果的影响。
研究方法
研究团队构建了完整的计算机模拟DBTL循环流程,核心是比较两种策略:ML辅助推荐策略和随机DNA文库转化基线策略。

基线策略的操作逻辑很直接:每一轮DBTL循环中,通过随机整合遗传元件到宿主菌株来构建DNA文库,测试后选出性能最优的菌株作为下一轮循环的亲本。这种"挑最好的继续迭代"的做法,是现实中许多实验室采用的朴素方案。
ML辅助策略则引入了强化学习中的梯度赌博机算法。该算法根据模型预测的生产力,迭代更新菌株选择的偏好权重。每一轮循环中,算法根据当前偏好从候选菌株中做出选择,测试后获得真实性能反馈,再据此调整下一轮的偏好参数。这种策略的核心思想是让算法在循环过程中不断"学习",逐渐把选择倾向调整到高产出区域。
两种策略都设定为五轮DBTL循环。作者选择五轮的原因很实际——这是真实世界实验中可能遇到的循环次数。每轮循环都包含完整的构建、测试和学习步骤,模拟过程完全基于代谢动力学模型的计算结果。
研究覆盖了三大类关键过程参数。第一类是DNA文库设计参数,包括可编辑位点数量和基因靶点集合规模。第二类是实验预算限制参数,包括筛选容量(即每轮能测试多少株菌)和DNA测序容量(即能对多少株菌进行测序)。第三类是机器学习配置参数,涉及ML模型的具体设置。

实验在四种不同的代谢途径模型上重复进行。这四种模型代表了不同的代谢网络拓扑结构和动力学特征,使研究结论具有更广的适用性。每个参数组合下,模拟DBTL循环都会完整运行五轮,记录最终的菌株优化效果。
关于具体的模型参数、模拟运行次数、计算平台等细节,原文摘要未详述具体参数。但研究框架的底层逻辑是清晰的:用动力学模型替代真实菌株,用计算模拟替代湿实验操作,从而在完全可控的条件下探索参数空间。
研究结果
模拟结果揭示出几个鲜明且反直觉的规律。
筛选容量是优化成功的主导驱动因素。在四种代谢途径模型上,提高每轮循环能够测试的菌株数量,都显著改善了最终优化效果。这个结果符合直觉——更多的筛选意味着更大的搜索空间覆盖,更有可能找到高产出菌株。但作者进一步发现,筛选容量的影响远大于其他参数,这提示实验设计时应当优先保证足够的筛选通量。
DNA测序容量对优化结果的影响出人意料地小。测序通常被视为机器学习建模的基础——没有足够的数据,模型怎么学习?但模拟结果显示,即使测序容量增加,优化效果也没有明显提升。作者指出,尽管测序对模型训练很重要,但在DBTL循环的优化效率层面,它的边际贡献远低于筛选容量。
选择策略显著影响优化效率。研究比较了两种菌株选择方式:一种是最优菌株优先测序——把产量最高的菌株优先送去测序;另一种是分层抽样——按产量分层后均匀采样测序。结果显示,选择最优菌株进行测序的策略始终优于分层抽样策略。这个结果揭示了预测准确性与优化效率之间的权衡:分层抽样能提供更全面的训练数据,理论上有利于模型预测精度;但最优菌株优先策略把有限的测序预算集中在最有价值的样本上,从而更直接地推动优化进程。
DNA文库结构对性能有强烈影响,且影响方向并不一致。增加可编辑位置的数量通常能改善优化结果——更多的可编辑位点意味着更大的设计空间,为搜索算法提供了更多可能性。但扩大基因靶点集合却可能阻碍优化进程。作者将这一现象归因于维度的增加和采样的稀疏化:靶点多了,每个靶点被充分探索的机会就少了,算法在高维空间中更容易迷失方向。

四种代谢途径模型的结果在定性层面保持一致,但在具体数值上存在差异。原文摘要未提供具体数值数据,但研究结论的稳健性得到了多模型验证。
这些发现共同勾勒出一幅清晰的图景:DBTL循环的优化效果并非由单一参数决定,而是多个参数交互作用的结果。其中,筛选容量和DNA文库结构是最关键的杠杆点,而测序容量的重要性被高估了。
讨论与展望
这项研究的价值在于,它用计算机模拟的方式,在真实实验投入之前就为DBTL工作流程的设计提供了可操作的指导。筛选容量优先、最优菌株优先测序、谨慎扩大基因靶点集合——这些原则可以直接转化为实验设计的决策依据。
研究也存在明显的边界。动力学模型的保真度决定了模拟结果的可靠性,而真实菌株的生理复杂性远超任何模型。此外,研究聚焦于四种代谢途径模型,结论能否推广到更广泛的代谢工程场景,仍需进一步验证。
模拟框架的潜力远不止于此。随着模型精度的提升和计算效率的改进,这类仿真工具可能成为代谢工程实验设计的标准前置步骤——在动手构建菌株之前,先在计算机里跑几轮虚拟DBTL循环,把参数空间摸清楚,把策略选好,再进入实验室。这种"先模拟、后实验"的工作范式,或许能大幅降低代谢工程的时间成本和经济成本。
参考来源
Van Lent P, Paz SM, Schmitz J, Abeel T. Comparing metabolic engineering scenarios using simulated design-build-test-learn-cycles. Front Bioeng Biotechnol. PMID: 42434402.
PMID: 42434402