来源:Semantic Scholar | 编译:DNA Lab Space
导语
在合成生物学与生物制造高速发展的今天,如何高效构建和筛选具有优良性状的蛋白质和代谢通路仍是核心挑战。基因多样性的创制,从最初模拟自然进化的随机诱变,到如今可编程的基因组重塑,经历了思路与工具的颠覆性跃迁。英国曼彻斯特大学Andrew Currin等学者在《Biotechnology Advances》发表的重磅综述,系统梳理了这一“进化中的艺术”。文章不仅回溯了定向进化从耗力费时到高通量自动化的历程,更深刻揭示了合成生物学如何以设计-构建-测试-学习循环重塑多样性生成范式,为生物催化、代谢工程和新型治疗开发绘制出清晰的赋能路线图。
研究背景
自然界用数十亿年时间雕刻出千姿百态的蛋白质功能与代谢网络,其底层驱动力正是随机突变与自然选择。人类工程师借鉴这一原理,于上世纪90年代开创定向进化,通过体外随机诱变和筛选,实现了酶的“加速进化”,Frances Arnold因此荣膺诺贝尔化学奖。然而,传统定向进化受制于文库容量与功能筛选的瓶颈:随机突变产生的绝大多数变异体是有害或中性的,而每轮进化仅能探索序列空间的一小片区域。即便后来出现了基因重组、易错PCR等技术,这种“盲目变异+人工选择”的模式依然面临巨大的筛选压力,尤其当目标性状缺乏高通量筛选方案时,进化效率急剧下降。
与此同时,随着DNA测序与合成成本的指数级下降,以及基因组编辑工具CRISPR-Cas的普及,合成生物学从“理解生命”迈向“重设计生命”。合成生物学不再满足于对已有序列的修修补补,而是试图按照工程学原理从头设计遗传回路、酶活性位点乃至全基因组。这一转变的核心,在于从“随机生成多样性”走向“主动构建设计库”。人们开始提出新的问题:能否将理性设计、计算预测与定向进化深度融合?能否在基因组水平上同时扰动多个靶点,实现代谢网络层面的全局优化?Currin等人的综述正是基于这条从“进化中学习”到“设计驱动进化”的脉络,对基因多样性创制手段进行了全景式解构。
研究方法
该综述并非原始实验研究,而是对当前基因多样性构建技术体系的方法学梳理与趋势判断。作者将创制多样性的技术路线划分为两大阶段和六个核心策略层,从“未设计”到“完全设计”逐级递进。
第一阶段是**以随机诱变和重组为核心的经典定向进化流程**。典型操作包括:采用易错PCR在目标基因中引入随机点突变;或者利用DNA shuffling将同源基因家族进行随机片段重组,产生嵌合体文库。为提高文库质量,后续发展出序列饱和诱变(SeSaM)和单点饱和诱变等策略,能对关键残基进行系统性的氨基酸替换。这些方法构建的文库容量通常达到10⁶-10⁸个变体,随后需要通过基于荧光、抗性或产物显色的高通量筛选,或者借助展示技术(如噬菌体展示、酵母表面展示、核糖体展示)偶联荧光激活细胞分选(FACS)富集有功能变体。对于无法建立高通量筛选的酶活性,还可通过连续进化系统避免手动迭代,如Phage-assisted continuous evolution(PACE)在噬菌体复制周期中直接耦合目标功能与繁殖必需基因,实现长达数百轮的无人值守进化。
第二阶段是**合成生物学驱动的设计型多样性构建**。文章重点介绍了多重自动化基因组工程(MAGE)与CRISPR系统联用的变革。MAGE利用寡核苷酸库与λ-Red重组系统,可在大肠杆菌染色体上同时引入数以千计的靶向突变,实现基因组水平的连续微进化。在其基础上发展出的CRISPR-dCas9系统则能对表达调控进行程控扰动,构建启动子强度阶梯文库或gRNA介导的转录抑制/激活文库,从而在不用敲除基因的前提下,系统地扰动代谢通路的通量分布。更激进的策略是完全化学合成:通过对酶的活性口袋、结构域进行模块化拆分与重新组合,或者将非天然氨基酸纳入蛋白合成体系,设计出自然界不存在的非经典蛋白。这些方法生成的多是小型但信息量极高的“文库”——文库容量虽只有10³-10⁵,但每个变体都经过计算过滤或机理引导,阳性率显著高于随机文库。
此外,作者还强调了计算工具的深度融合。机器学习和进化耦合分析(如EVcouplings)能从多序列比对中推断残基间共进化关系,用于指导稀疏诱变和共识设计;而Rosetta、AlphaFold等结构预测工具则让从头设计结合域或催化裂隙成为可能。这些计算预测输出的“虚拟文库”,经实验验证后又能反馈训练模型,形成“设计-构建-测试-学习”闭环,极大地压缩了筛选规模并加速了进化周期。
研究结果
文章通过横向对比揭示了不同创制策略在文库多样性、筛选负担、功能增益幅度方面的根本性差异,主要可归纳为以下核心发现:
**一、随机诱变与重组:通量巨大但质量堪忧。** 经典定向进化方法(如易错PCR和DNA shuffling)能够轻易产生10⁷以上变体,但由于突变分布的随机性与偏差(如AT偏好),文库中超过95%的变体功能劣化,甚至有大量移码和截短蛋白。导致筛选必须依赖强大的高通量方法。即便如此,此类技术在工业酶改造史上仍成就斐然,例如将枯草杆菌蛋白酶E的有机溶剂活性提升数百倍。值得注意的是,若缺乏有效筛选,这些海量文库反而成为负担,因为测序深度往往只能覆盖文库的极小部分,绝大多数功能信息被“沉没”。
**二、高通量连续进化突破筛选瓶颈。** PACE等体内连续进化系统真正意义上解耦了人力干预与进化速度。以T7 RNA聚合酶为进化对象的经典案例中,通过将目的活性与噬菌体pIII蛋白的表达关联,系统在短短数天内自发完成了200多轮进化,获得能识别新型启动子的聚合酶变体,而传统手动方法需要数月。这类方法的成功关键在于设计严格的遗传偶联回路,使得有益突变引发自我放大信号。其生成的多样性高度聚焦于功能获得性突变,有效文库占比激增。
**三、设计驱动的小型文库:事半功倍。** 当引入结构信息或共进化约束时,文库质量实现质的飞跃。例如,对P450BM3的活性位点同时进行多位点和饱和诱变,仅构建5000个变体的小文库,就筛选到能将短链烷烃羟基化活力提升数百倍的优势突变体。又如利用EVcouplings指导的共识突变,在保持蛋白稳定性的前提下,仅需引入5-8个关键“恢复性突变”,就能让原本脆弱的人类细胞色素c过氧化物酶在酵母中高活性表达。合成生物学工具使得对数十个靶点进行组合扰动成为可能:CRISPRi介导的转录调控文库在番茄红素合成路径优化中,通过对12个基因进行多水平抑制的组合筛选,成功将产量提高近8倍,而这种多靶点组合在随机诱变中是极难实现的。
**四、计算驱动的从头设计开始产出功能完整的蛋白。** 2020年代初,基于深度学习的蛋白质序列生成模型(如ProtGPT2、ProteinMPNN)已能设计出折叠能量和溶解性均优于天然蛋白的序列,实验验证成功率显著提高。尤其是深度幻觉(deep hallucination)和约束式反向折叠技术,让创造全新酶活性成为可能。综述引用的一项里程碑工作,是首次完全通过 Rosetta 从头设计出催化Diels-Alder环加成反应的酶,并经定向进化进一步提升活性,标志着“设计-进化”融合路线的成熟。
**五、组合干扰与自动化工作流。** 合成生物学平台将DNA组装、转化、测试步骤高度自动化。文中描述的Biofoundry设施,能以每周数万个实验通量进行设计库构建和功能表征。MAGE偶联自动化迭代,实现了对大肠杆菌基因组RBS序列的全覆盖扰动,在几周内产生超过百亿个基因组变体组合,并通过多重筛选锁定改善酪氨酸产量的候选菌株。这种“文库规模×构建速度”的双重放大能力,正将基因多样性创制从艺术转变为工程。
讨论与展望
基因多样性构建已经从一门依赖直觉与运气的“手艺”,进阶为理性设计与高通量进化深度融合的工程科学。作者认为,未来的突破点将不限于单一蛋白,而是向细胞全代谢网络和微生物群落层面延伸。我们能够设计同时优化数十个酶的协同表达,或者在原位改造人类肠道菌群的代谢流,这些皆需要新型的体内多样性生成手段。
计算能力的持续渗透将是核心催化剂。随着大语言模型开始在蛋白质序列世界中“学习语法”,我们有望直接生成具有预设功能的蛋白质家族,并在计算机内完成第一轮筛选。然而,真正瓶颈已经从“如何产生多样性”转移到“如何读取和理解多样性”。功能筛选的发展滞后于建库能力,特别是针对复杂性状(如抗逆性、多酶协同效率)的高通量分析方法依然稀缺。将基因型-表型关联记录在DNA本身(如基于CRISPR的谱系追踪),配合单细胞测序和质谱成像,或能揭示多维功能景观。
此外,生物安全与伦理考量日益重要。当合成生物学让我们以空前速度创造自然界未曾存在的代谢通路和活性蛋白时,亟需构建与能力相匹配的生物防护与监管框架。作者呼吁国际学界在分享工具的同时,共同建立安全筛选准则与序列使用的可追溯机制。
总体而言,这篇综述为合成生物学研究者和工程师提供了一份清晰的“技术地图”——从选择适当的多样性构建方法,到理解各策略的规模-精度权衡,再到展望计算驱动闭环进化。在“设计代替筛选,但进化验证设计”的新范式下,基因多样性的创造性艺术正稳步迈向可预测、可放大的工程奇迹。
参考来源
- A. Currin, Steven Parker, Christopher J. Robinson, E. Takano, N. Scrutton. The evolving art of creating genetic diversity: From directed evolution to synthetic biology. *Biotechnology Advances*, 2021, DOI: 10.1016/j.biotechadv.2021.107762.
DOI: 10.1016/j.biotechadv.2021.107762