无细胞表达系统可预测性的核苷酸级反应网络

来源:ACS Synth Biol | 编译:DNA Lab Space

📎 相关工具:蛋白可溶性优化分析

无细胞表达系统长期以来面临一个尴尬局面:它既能快速合成功能蛋白,又因其组分复杂而难以精准调控。加州理工学院的Murray团队近期在《ACS Synthetic Biology》上发表了一项研究,将PURE无细胞系统的转录和翻译过程建模为核苷酸级别的化学反应网络(CRN),实现了对RNA和蛋白质产量的定量预测。这项工作把"经验试错"推向了"计算设计"。

研究背景

无细胞表达系统(cell-free expression system)是合成生物学的重要工具,尤其适合DNA电路的快速原型验证和功能蛋白的按需合成。粗提物(crude extract)系统虽然成本低、产量高,但内部成分繁杂——大量未知酶和底物同时参与反应,本质上是个"黑箱"。相比之下,PURE系统(Protein synthesis Using Recombinant Elements)只包含蛋白质生产所必需的转录和翻译组分,所有蛋白质和小分子的浓度都是已知的。这种"白箱"特性让PURE成为计算建模的理想平台。

然而,已有的PURE翻译模型大多局限于特定短肽。例如ePURE-MATLAB模型只能表达fMGG三肽(甲酰甲硫氨酸-甘氨酸-甘氨酸),包含968个反应和241个物种,全部手工编写。想改变肽段序列或长度?那几乎等于重写整个模型。更棘手的是,转录过程的定量模型也缺乏实验验证。本研究的目标正是打破这些限制:将翻译模型推广到任意氨基酸组成和长度的蛋白质,构建经实验验证的转录模型,最后把两者耦合为纯质量作用反应的完整蛋白质合成模型。

研究方法

建模框架:BioCRNpyler与SBML

研究团队选择化学反应网络(CRN)作为建模形式,使用BioCRNpyler编译器完成模型构建。BioCRNpyler是Python编写的模块化软件包,能从系统的高级描述自动生成所有反应、物种和参数。模型最初包含至少86个组分,随后根据目标肽段的序列动态生成其他中间组分和反应。输出格式采用系统生物学标记语言(SBML),这是该领域的标准交换格式。

模拟计算使用BioSCRAPE Python包完成。BioSCRAPE将SBML模型转换为常微分方程组(ODE),每个反应速率按质量作用定律(mass-action propensity)书写,再用Python的odeint求解器在指定初始条件下求解。之所以选择BioSCRAPE而非其他模拟器,是因为它除仿真外还内置了敏感性分析和贝叶斯推断工具。

翻译模型的推广:从fMGG到任意蛋白

第一步工作是将ePURE-MATLAB翻译模型用BioCRNpyler重写。原模型的968个反应被分为四类:起始(initiation)、延伸(elongation)、终止(termination)和辅助反应(auxiliary reactions)。延伸步骤是扩展肽段长度的关键,BioCRNpyler的可扩展性特性在此发挥核心作用——它能够根据目标蛋白的氨基酸序列自动生成对应的延伸反应链。所有反应和参数均保留自ePURE-MATLAB模型,确保与原始模型的一致性。

转录模型的构建与验证:MGapt报告系统

转录模型的验证选用孔雀石绿适配体(malachite-green aptamer,MGapt)作为报告分子。MGapt是一种RNA适配体,结合孔雀石绿染料后荧光显著增强,因此可通过荧光信号实时监测RNA产量,无需破坏性取样。研究团队将MGapt编码序列置于质粒上,在不同质粒浓度下表达,用荧光动力学数据校准转录模型参数。

耦合模型:转录+翻译的完整蛋白质合成

最后,将推广后的翻译模型与验证后的转录模型耦合,构建完整的PURE蛋白质合成模型。该模型完全由质量作用反应构成,不引入任何表观速率常数或启发式近似。耦合模型的验证对象是两种产物:MGapt(RNA适配体)和deGFP(增强型绿色荧光蛋白突变体)。两者均从质粒表达,质粒浓度设定多个梯度,以检验模型在不同模板浓度下的预测能力。

参数识别与敏感性分析

每个SBML模型都进行了局部敏感性分析,计算所有参数在所有时间点上对可测物种的敏感性。随后用贝叶斯推断算法(集成emcee Python包,在BioSCRAPE框架内运行)从实验数据中估计参数的后验概率分布。原文摘要未详述贝叶斯推断的具体先验分布和迭代次数。

Generalization of the PURE-TL model and comparison against expressed deGFP from RNA. (a) Comparison of the original ePURE-MATLAB model to the PURE-TL model. The PURE-TL model (magenta line) and the ePURE-MATLAB model (cyan line) overlap, and the difference between the models (orange circles) is show
▲ Generalization of the PURE-TL model and comparison against expressed deGFP from RNA. (a) Comparison of the original ePURE-MATLAB model to the PURE-TL model. The PURE-TL model (magenta line) and the ePURE-MATLAB model (cyan line) overlap, and the difference between the models (orange circles) is show

研究结果

翻译模型推广成功:任意肽段可编程

将ePURE-MATLAB模型转换到BioCRNpyler平台后,fMGG三肽的合成过程被完整复现。更重要的是,新框架摆脱了手工编写反应的束缚——只要给定目标蛋白的氨基酸序列,模型就能自动生成对应的起始、延伸和终止反应。原文摘要未提供推广后模型的具体反应数和物种数,但明确指出该模型能够合成任意长度和序列的肽段,这是原版ePURE-MATLAB无法做到的。

转录模型验证:MGapt荧光动力学拟合

MGapt报告实验提供了转录过程的定量数据。研究团队在不同质粒浓度下测量RNA产量随时间的变化曲线,并用转录模型进行拟合。原文摘要未提供具体质粒浓度数值和拟合误差,但确认转录模型成功捕捉了MGapt的表达动力学特征。这一结果填补了PURE系统转录建模缺乏实验验证的空白。

耦合模型预测:MGapt与deGFP的定量匹配

将转录与翻译模型耦合后,研究团队用该模型同时预测MGapt和deGFP的表达动力学。两种产物均在多个质粒浓度下进行实验,模型输出与实验数据定量吻合。原文摘要未提供deGFP的具体产量数值和质粒浓度梯度范围,但强调模型"捕捉了动力学特征"(capture the kinetics),且整个模型完全由质量作用反应构成,没有引入任何经验修正项。

模拟deGFP产量,利用有效RNA计算。PURE-TL模型的模拟deGFP产量(实线)在不同RNA浓度下初始化,与实验结果(带误差棒的圆圈)叠加,使用有效RNA浓度,详见支持信息第3.10节。
▲ 模拟deGFP产量,利用有效RNA计算。PURE-TL模型的模拟deGFP产量(实线)在不同RNA浓度下初始化,与实验结果(带误差棒的圆圈)叠加,使用有效RNA浓度,详见支持信息第3.10节。

参数敏感性:识别关键调控节点

局部敏感性分析揭示了影响测量物种(RNA和蛋白质产量)的最敏感参数。这些参数对应的反应步骤,就是控制PURE系统输出的关键调控节点。原文摘要未详述哪些具体参数被识别为最敏感,也未提供敏感性系数的数值。

使用T7 RNA聚合酶重建的大肠杆菌转录系统合成RNA示意图。我们将转录反应分为三个子过程:起始、延伸和终止。不包括辅助反应,如能量回收或与翻译明确相关的反应。使用BioRender.com创建。
▲ 使用T7 RNA聚合酶重建的大肠杆菌转录系统合成RNA示意图。我们将转录反应分为三个子过程:起始、延伸和终止。不包括辅助反应,如能量回收或与翻译明确相关的反应。使用BioRender.com创建。

讨论与展望

这项研究的核心价值在于方法论:把PURE系统的建模从"特例手工"推进到"通用自动"。BioCRNpyler的可扩展性意味着,研究者只需输入目标蛋白的序列,就能获得完整的质量作用反应网络——这为DNA电路设计、代谢途径优化等下游应用提供了计算基础设施。

不过,模型仍有提升空间。当前验证仅覆盖MGapt和deGFP两种产物,更多蛋白(特别是跨膜蛋白、含非天然氨基酸的蛋白)的表达预测尚待检验。此外,模型的所有参数均来自ePURE-MATLAB原版,若PURE系统批次间存在组分活性差异,模型可能需要重新校准。原文摘要未提及模型对批次差异的鲁棒性分析。

从应用角度看,这种"序列进、动力学出"的预测能力,可能让无细胞系统从"实验筛选"转向"计算设计"。当蛋白质合成过程可以被定量预测时,合成生物学的研究范式也将随之改变——不再是"做了才知道",而是"算了再做"。

参考来源

Jurado Z, Pandey A, Murray RM. Nucleotide-Level Chemical Reaction Network Modeling Enables Quantitative Prediction of Reconstituted Cell-Free Expression Systems. ACS Synthetic Biology. PMID: 42289988.

PMID: 42289988

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 基于染色质可及性的酿酒酵母基因表达水平多机器学习模型预测 09-12