合成生物学驱动天然产物工程迈向闭环自动化

来源:Semantic Scholar | 编译:DNA Lab Space

导语

天然产物是药物、农药和高值化学品的重要源泉,但其传统研发周期长、通量低,难以满足现代生物经济需求。合成生物学为天然产物的高效发现与制造提供了系统性解决方案。近期,Foldi等人在《ACS Synthetic Biology》发表的综述,系统梳理了“发现(Discover)–设计(Design)–构建(Build)–测试(Test)–学习(Learn)”(DBTL)循环中各项赋能技术的突破性进展,深入阐释了自动化、机器学习和基因组挖掘如何将天然产物工程推入高速迭代的新阶段。该文不仅是一张技术全景图,更首次明确指出了跨阶段整合与数据闭环流动是突破当前天然产物合成生物学瓶颈的关键所在。

研究背景

天然产物因其化学结构的复杂性和多样的生物活性,长期在医药与农业领域占据不可替代的地位。然而,经典的天然产物开发模式高度依赖低效的筛选与经验性优化,一个新药分子从发现到产业化的周期往往超过十年。合成生物学的兴起试图通过工程化理念重塑这一流程,其核心思想是将生物系统视为可编程的制造平台,通过“自下而上”的元件组装与代谢途径重构,实现目标分子的定向合成。

DBTL循环是合成生物学的中心工程范式:从生物系统中发现新的功能部件或途径(Discover),进行计算机辅助的理性设计与建模(Design),将设计转化为DNA实体并导入底盘细胞(Build),通过高通量分析手段对工程细胞的性能进行定量评估(Test),最后借助先进的数据分析方法从结果中提炼出普适性规律,指导下一轮设计的改进(Learn)。然而,长期以来,天然产物领域的DBTL各阶段发展极不均衡,测试与学习环节的滞后严重制约了循环的整体迭代速度。

Foldi等人的这篇综述正是在这一背景下,对DBTL每一阶段的最新技术浪潮进行了全景式扫描,尤其聚焦于那些能够显著加速循环转动、消解阶段间壁垒的使能技术。文章的特殊价值在于,它并非孤立地罗列技术清单,而是始终以“循环”为叙事主线,强调数据在不同阶段间的无缝衔接与正反馈放大效应。

研究方法

本篇综述采用了系统性的文献回顾与主题提炼的方法。作者团队没有陷入单一技术的细节叙述,而是以DBTL循环的整体框架为纲领,对近年来(尤其2020年以后)发表的数百篇高水平研究论文、预印本和技术报告进行了解剖式梳理。其方法论特色体现在以下三个层面:

首先,建立了清晰的技术分类学。在“发现”阶段,聚焦于基因组挖掘策略的演化,从经典的BGC(生物合成基因簇)规则识别到基于深度学习的大规模虚拟筛选,逐一比较了antiSMASH、DeepBGC、ClusterFinder等工具在预测能力和假阳性率上的代际差异。在设计阶段,则区分为途径设计、酶工程和调控设计三大子域,涵盖了从CAD工具(如RetroPath、BioStudio)到蛋白语言模型(如ESM-1b、ProteinMPNN)驱动的全新酶设计。在“构建”阶段,着重评估了DNA组装(如Golden Gate、Gibson Assembly变体)和CRISPR多重基因组编辑在大型生物合成基因簇操作中的通量与保真度。“测试”环节被细化为基于质谱的代谢组学和基于生物传感器的单细胞筛选技术,而“学习”阶段则突出自动化实验-云端数据库-计算模型三元协同的新范式。

其次,突出技术整合度评价。综述不仅讨论单项技术的进步,更罕见地关注了“跨界”融合案例。例如,伊利诺伊大学香槟分校的iBioFAB自动化平台如何将构建、测试和学习紧密耦合,通过机器人操作实现“无人值守”的DBTL全周期运转;以及Amyris公司如何通过自动化菌株构建与质谱分析数据的实时反馈,将酵母中青蒿酸途径的产量在短短数月内提升数十倍。这种“平台化”研究方法的描述,从工程学角度揭示了循环加速的底层机制。

第三,引入批判性视角。作者并非全盘照搬文献结论,而是敏锐地指出了各阶段普遍存在的技术陷阱:基因组挖掘中BGC沉默导致的“湿实验”验证严重滞后,设计环节对底盘细胞代谢背景模型的过度简化,测试中样品前处理瓶颈导致的分析通量洼地,以及学习阶段因数据标注成本高昂且标准不统一导致的模型泛化性差。这种务实的批判性分析,使得综述本身具备了超越一般性回顾的方法论指导意义。

研究结果

该综述的核心发现可被提炼为一条乐观而清醒的主线:天然产物合成生物学已进入“DBTL半闭环”阶段,测试与学习之间的自动反馈回路正逐步形成,但发现与设计之间、设计到构建的自动化链条仍存在明显断点。具体而言,作者详细揭示了五个阶段各自的技术前沿与内在张力。

在“发现”维度,基因组数据的指数级增长已催生出令人瞩目的计算发现能力。基于隐马尔可夫模型与深度卷积神经网络结合的BGC挖掘系统,将原核生物基因组的BGC检出率提升至90%以上,并从人类口腔微生物组、深海沉积物宏基因组中发现了数千个前所未有的新型BGC。然而,作者通过统计数据指出,这些预测出的BGC中,能够在实验室被成功表达并检测到预期产物的比例不足5%。“表达沉默”成为发现阶段的最大拦路虎,折射出从序列到化学型的巨大鸿沟。

“设计”阶段正在经历从静态蓝图到动态模拟的范式转变。简单的逆合成分析工具已被能动态整合细胞资源、毒性与热力学约束的约束型途径设计平台取代。在酶的水平,基于蛋白质语言模型的无监督学习方法可从海量天然序列中学习“适应性突变”的隐含规则,快速生成兼具高活性和热稳定性的催化剂变体。令人印象深刻的是,该文评述了2023年的一项里程碑工作:完全由深度学习从头设计的照亮素(luminescence)途径酶,其催化效率可与数百万年进化的天然酶媲美。尽管如此,作者提醒,这些设计仍高度依赖对反应机制的预知,对于涉及多结构域巨型酶的非线性反应网络,从头设计的成功率依然很低。

“构建”技术的突破集中在速度和规模两个维度。模块化克隆结合自动移液站,使得月通量达到数千个菌株构建成为现实。更关键的是,CRISPR介导的活体直接进化与多重基因组工程,使得大型BGC(通常大于50 kb)的高效染色体整合与宿主依赖性表达优化不再遥不可及。综述注意到,酿酒酵母中的“端粒定位整合”和链霉菌中的“接合型高效转移”,已经成为大幅缩短构建-测试周期的关键工程技术。

“测试”环节被作者视为五年来进步最快的领域。解吸电喷雾电离(DESI)质谱成像结合离子淌度分离,允许直接在微生物菌落上进行空间分辨的代谢轮廓分析,将检测通量从每天数百个样品跃升至万级以上。同时,基因编码的生物传感器(如别构转录因子响应开关、基于FRET的代谢物指示剂)与流式细胞分选(FACS)或微流控液滴的联用,使单细胞分辨率的实时代谢产物筛选成为通行做法。然而,作者指出,代谢物的极端化学异质性意味着目前没有一种全能检测手段,方法开发成本高昂仍是核心限制。

对于“学习”阶段,综述系统总结了自动化推荐系统与主动学习算法在菌株优化中的决定性作用。贝叶斯优化和多臂老虎机算法已能在设计空间极其庞大(10^20种以上组合可能)的情况下,仅通过数百次实验就定位最优途径表达水平。数据库与本体建设使实验元数据被标准化记录,进而通过图神经网络预测基因-化合物对应关系,实现了“算出来→看到它”的真正循环加速。但作者警示,大部分公开数据由于缺乏可操作的阴性结果和详细的实验上下文,难以用于训练高可靠性的预测模型,数据基础设施是制约学习效能的隐在瓶颈。

讨论与展望

该综述所描绘的天然产物合成生物学图景既令人振奋,又充满务实批判。最突出的启示在于,DBTL循环的整体效能并不取决于其中“长板”的长度,而恰恰受制于那些碎片化、手工依赖度高的“短板”环节。当前,测试和学习的自动化闭环已在小分子优化场景中展现出颠覆性力量,但发现与设计之间的迭代仍然极度依赖科学家个人的专家直觉与手工操作,这暗示着下一波突破很可能来自计算设计与实验验证的无缝直连——即“发现即设计、设计即构建”的自动化云实验室。

从应用前景角度,综述指明了三条最有希望的方向。其一,基于宏基因组和单细胞测序的未培养微生物化学宝藏挖掘,有望为现有抗生素耐药的病原体提供全新化学防御策略。其二,从头蛋白设计正在使定制功能的非天然辅因子依赖酶成为现实,这可能开辟天然产物化学修饰空间中迄今无法触及的化学键连接模式。其三,生物铸造厂与计算的深度耦合,将真正实现“黑箱”菌株优化——研究者只需定义产品的目标浓度与纯度,系统自行完成数轮DBTL循环交付最优工程菌。然而,作者也冷静地提出了实现这一愿景所必须克服的多重挑战:包括跨测序-质谱的通用数据标准制定、知识产权的安全性与归属难题,以及如何在自动化进程中保留人类科学家的创造性洞察。

该文最终传达的核心信息是:合成生物学之于天然产物,已经超越了“替代化学合成”的朴素目标,正在向“超越天然进化的分子创新”迈进。这一趋势的实现,将有赖于DBTL循环从松散耦合的技术链条进化为一个真正集成的、数据驱动的自学习系统。对学术界和产业界的从业者而言,这篇综述既提供了详尽的技术导航,更明确了一项集体使命——共同构建能够支撑DBTL闭环运行的公共数字基础设施。

参考来源

Foldi J, Connolly JA, Takano E, Breitling R. Synthetic Biology of Natural Products Engineering: Recent Advances Across the Discover–Design–Build–Test–Learn Cycle. ACS Synthetic Biology. DOI: 10.1021/acssynbio.4c00391.

DOI: 10.1021/acssynbio.4c00391

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 基于染色质可及性的酿酒酵母基因表达水平多机器学习模型预测 09-12