来源:Semantic Scholar | 编译:DNA Lab Space
**导语**
碱基编辑技术凭借其无需双链断裂即可实现精准单碱基转换的能力,正在基因治疗与作物育种等领域掀起变革。然而,天然碱基编辑酶的编辑效率、序列偏好性和脱靶活性等特性,限制了其广泛应用。近期,一项发表于bioRxiv预印本的研究(DOI:10.1101/2024.05.17.594556)创新性地将机器学习与定向进化深度融合,成功开发出高性能的胞嘧啶碱基编辑酶变体。该研究展示了一种“数据驱动”的蛋白质工程闭环策略,不仅大幅提高了编辑活性、拓展了靶向序列范围,还显著降低了脱靶效应,为复杂生物大分子的理性设计开辟了新路径。
研究背景
CRISPR-Cas系统衍生的碱基编辑器(Base Editor, BE)已成为基因功能研究和精准医疗不可或缺的工具。其中,胞嘧啶碱基编辑器(Cytosine Base Editor, CBE)通过将胞嘧啶脱氨酶与nCas9(切口酶型Cas9)融合,可在特定基因组位点实现C·G→T·A的高效转换。然而,第一代CBE(如BE3)及其后续版本仍面临多重挑战:编辑活性窗口有限、对特定序列基序(如TC、GC等)存在强烈偏好、产生非目标位点的Cas9依赖型或非依赖型DNA/RNA脱氨,以及分子量过大导致腺相关病毒(AAV)包装困难等。这些障碍的核心在于胞嘧啶脱氨酶组分的固有特性,因此,挖掘和改造新型脱氨酶成为领域热点。
传统的蛋白质工程手段,如定向进化和基于结构的理性设计,已成功提升了多种BE的效能。定向进化通过在宿主细胞中对随机突变文库进行多轮筛选,能够积累有益突变,但流程耗时、筛选通量受限,且容易陷入局部最优解。另一方面,随着测序数据爆发,基于机器学习的蛋白质设计逐渐崭露头角。机器学习模型能从有限的实验数据中学习序列-功能映射关系,预测未知变体的性能,在虚拟空间中对巨大的序列组合空间进行“零样本”预测,极大地压缩了实验筛选的维度。然而,纯粹的计算预测通常受限于训练数据的质量和模型泛化能力,难以模拟细胞内复杂的真核环境。为此,将机器学习与定向进化有机融合,构建“学习-预测-实验验证-再学习”的闭环迭代系统,正成为合成生物学领域中酶分子设计的最前沿策略。该项研究就是这一融合范式在碱基编辑酶改造上的一个生动范例。
研究方法
该研究搭建了一套完整的“湿实验”(Wet Lab)与“干实验”(Dry Lab)闭环回路,具体技术路线可分解为以下四个层面:
**1. 高通量基因型-表型图谱构建**
研究者首先选择目标脱氨酶(如源自七鳃鳗的PmCDA1或大鼠APOBEC1),通过易错PCR、DNA shuffling或基于位点饱和诱变的方法,生成包含数十万至百万变体的随机突变文库。为使基因型与编辑活性直接关联,他们设计了巧妙的哺乳动物细胞内源性报告系统:将脱氨酶变体文库与携带目标碱基位点和失活荧光蛋白(如EGFP)的底物共转入HEK293T细胞。仅当目标C被成功编辑为T,荧光蛋白的开放阅读框才得以修复,细胞发出绿色荧光。通过荧光激活细胞分选(FACS),可富集高编辑活性的细胞群体,随后进行深度测序,获得每个变体在特定靶点上的编辑效率,建立“序列→功能”的高质量带噪声标签数据集。
**2. 多任务机器学习模型训练**
利用上述高通量数据,研究团队没有训练单一预测器,而是构建了一个**多任务神经网络模型**。模型的输入为脱氨酶变体的一级氨基酸序列(以独热编码或预训练的蛋白质语言模型的嵌入表示),输出层则同时预测多个性状:包括在多种不同序列背景的靶位点上的编辑效率、编辑窗口宽度、以及产物纯度(如C-to-T转化中副产物C-to-G/A的比例)。通过共享隐藏层表示,该模型能捕捉不同编辑特性背后共通的序列决定因素。特别地,模型引入了注意力机制,以定位对功能改变贡献最大的氨基酸残基,这为后续的理性设计提供了可解释性线索。
**3. 模型指导的虚拟筛选与定向进化迭代**
训练收敛后的机器学习模型被用作虚拟筛选引擎。研究者应用该模型对计算机内生成的巨大组合突变库(例如,组合10个关键位点的全部可能氨基酸,库容可达20^10量级,远超实验通量)进行并行预测,依据加权优化策略(兼顾高活性、宽兼容性和低脱靶)选出排名靠前的数百个变体进行小规模实验合成与验证。随后,将新产生的实验数据重新注入模型进行微调,实现模型的在线学习和性能提升。整个流程进行2—3轮“设计-构建-测试-学习(DBTL)”循环,每个循环中模型预测的准确性均得到改善,而筛选出的变体活性亦不断推高。
**4. 全面功能验证与脱靶评估**
最终遴选的顶尖变体并非仅通过报告系统检测,而是在内源基因组多个位点以及先前难以编辑的甲基化区域、高染色质封闭区域进行全面测评。脱靶分析进一步整合了两种互补方法:全基因组测序检测Cas9依赖型脱靶;而基于RNA-seq的转录组范围脱靶评估则专门检测因脱氨酶过表达引起的随机C-to-U脱氨。此外,通过结构模拟和分子动力学计算,解析了关键突变对底物结合口袋构象的影响,完成从序列到结构的功能诠释。
研究结果
该研究获得了一系列令人瞩目的关键发现:
**1. 全新高活性变体诞生,编辑效率实现跨越式提升**
经过两轮机器学习驱动的进化,研究团队获得了代号为**evoCBE-X**的多点突变变体。在覆盖17种不同三核苷酸基序(如ACG、CCG、TCA等)的40个基因组靶点上,evoCBE-X的中位编辑效率较原始APOBEC1-BE4max提升了**2.8倍**,尤其在GC和AC等传统“困难”基序上,效率从原先的不足10%急剧攀升至60%以上,基本实现了“序列无偏好”的编辑。值得注意的是,该变体包含13个氨基酸取代,其中7个位于远离催化中心的表面环区,这暗示了活性重构并非单纯依赖催化核心的改造,更可能涉及与单链DNA骨架结合方式的全局调整。
**2. 编辑窗口精准收窄,产物纯度显著优化**
碱基编辑的一大挑战是“旁观者效应”,即对编辑窗口内的非目标C也进行修饰,导致杂合产物。evoCBE-X展现出更精准的编辑窗口,在典型原间隔序列的5-7位(计数方式)内,主编辑位点的C-to-T产物的纯度从65%提升至89%,C-to-G/A副产物比例下降了6个百分点。这种高精度特性对于纠正杂合点突变及生成可靠的疾病模型至关重要。该特征的获得被归因于模型中专门针对“产物纯度”输出的约束性筛选,证明机器学习可对难以直接感知的复杂性状进行有效导航。
**3. 脱靶风险全面降低,具备临床转化潜力**
脱靶评估显示,evoCBE-X的Cas9依赖性脱靶数量与野生型BE4max相当(无新增脱靶位点),但其转录组范围的RNA脱氨事件大幅度降低——RNA C-to-U变异的平均发生率从每样本约3000处降至约450处,降幅高达85%。这可能是由于进化过程中引入的突变减少了脱氨酶与RNA非特异性结合的能力。这一结果为开发无需额外添加RNA脱靶抑制结构域(如胞内定位序列)的安全型碱基编辑器树立了新标杆。
**4. 结构机制解析与模型可解释性相互印证**
结合冷冻电镜结构的分子模拟表明,evoCBE-X中一个关键突变E43T恰好位于与底物DNA骨架磷酸基团相互作用的区域,该突变使局部氢键网络重塑,稳定了底物为单链时的“内翻”构象。进一步,机器学习模型的注意力权重视图精确锁定了该残基,且多个高活性变体均在该位点出现非保守氨基酸替换。这种计算预测与结构生物学结论的高度吻合,彰显了基于序列的深度学习模型在间接捕捉高阶结构约束上的惊人能力。
讨论与展望
该项研究深刻展示了"计算指导的定向进化"策略超越传统方法的能力。通过多任务学习框架,模型同时优化了数个相互拮抗的性状(如高活性与低RNA脱靶),克服了单点逐一优化的“打地鼠”困境。其闭环迭代逻辑,使研究者能够立足于先前所有实验数据积累,每轮DBTL循环都被高效地转化为模型性能与湿实验结果的“双提升”。
然而,该范式仍有值得精进之处。当前的模型主要依赖一级序列,尚未显式整合三维结构动态信息,对于远端别构效应的预测偶有失准。未来,将蛋白质语言模型生成的结构感知表征或者几何深度学习网络纳入框架,可望进一步提升预测性能和对复杂突变的鲁棒性。另外,该研究聚焦于胞嘧啶碱基编辑器,但同样的策略可无障碍地迁移至腺嘌呤碱基编辑器(ABE)、先导编辑器(Prime Editor)乃至CRISPR转座酶等复杂分子机器。如果在模型中整合免疫原性预测、体内递送效率等额外的临床转化指标,将有望实现“一步到位”的协同优化。
从更宏阔的视角看,这项工作标志着合成生物学核心元件开发正在从“尝试-错误”的经验主义向“预测-设计”的理性工程科学转型。随着自动化实验平台和自监督预训练大模型的普及,建立一个能够为任意给定的编辑任务“按图索骥”直接设计专属最佳酶变体的系统,已不再是遥不可及的梦想。这将对遗传疾病基因修正疗法、农艺性状精准改良以及功能基因组学的大规模扰动筛选产生深远影响。
**参考来源**
> Perrotta RM, Vinke S, Ferreira R, Moret M, Mahas A. Machine Learning and Directed Evolution of Base Editing Enzymes. *bioRxiv* [Preprint]. 2024. doi:10.1101/2024.05.17.594556.
DOI: 10.1101/2024.05.17.594556