核苷酸级化学反应网络建模

来源:ACS Synth Biol | 编译:DNA Lab Space

📎 相关工具:参考文献格式化

无细胞表达系统长期面临一个尴尬:粗提物像个黑箱,里面发生了什么谁也说不清。PURE系统虽然只保留转录翻译必需组分,却缺乏足够实验数据支撑其计算模型。本研究用化学反应网络(CRN)把PURE系统的转录和翻译过程拆解到核苷酸级别,再用RNA适配体和荧光蛋白实测数据校验模型,最终实现了对蛋白质合成动力学的定量预测。

研究背景

细胞-free表达系统(cell-free expression system)近年来成为合成生物学快速原型验证的重要工具。与活细胞相比,它没有细胞膜屏障,反应条件可灵活调控,DNA电路和功能蛋白的测试周期大幅缩短。但传统粗提物(crude extract)含有数百种未知组分,反应机理不透明,这给计算建模带来了根本性障碍。

PURE系统(Protein synthesis Using Recombinant Elements)则完全不同——它只包含蛋白质生产所需的转录和翻译组分,且所有蛋白质和小分子浓度已知。这为建立可靠的计算模型提供了理想平台。然而,此前针对PURE系统的详细翻译模型仅能表达一种名为fMGG的三肽(formyl-Met-Gly-Gly),且模型包含968个反应和241个物种,全部手工书写,想要改变或延长肽序列几乎不可能。

该研究试图解决两个核心问题:其一,如何将PURE翻译模型推广到任意氨基酸组成和长度的蛋白质;其二,如何建立转录过程的化学反应网络,并将转录与翻译模型偶联,形成完整的蛋白质合成预测工具。

研究方法

这项工作的技术路线分为三个层次:模型泛化、转录模型构建、以及转录-翻译偶联。

翻译模型的泛化改造

研究者以ePURE-MATLAB模型为起点,这是一个基于大肠杆菌重建体外翻译系统的确定性模型。原始模型仅能合成fMGG三肽,且968个反应和241个物种全部显式书写,扩展肽序列的工作量极大。

为突破这一限制,团队采用BioCRNpyler——一个基于Python的CRN编译器工具。该工具提供面向对象、模块化的框架,能从系统的高层描述自动生成所有反应、物种和参数。模型最初至少包含86个组分,系统会根据目标肽的序列自动生成其他中间组分和反应。

具体操作上,研究者先将ePURE-MATLAB翻译模型转换为Python格式,针对fMGG肽进行验证。原始模型中的反应被分为四组:起始(initiation)、延伸(elongation)、终止(termination)和辅助反应(auxiliary reactions)。利用BioCRNpyler的可扩展特性,延伸步骤得以自动生成,无需手工书写每个反应。

BioCRNpyler将模型输出为标准生物建模语言SBML(Systems Biology Markup Language)。随后使用BioSCRAPE Python包进行模拟——该工具将CRN转换为常微分方程(ODE),每个反应速率采用质量作用定律(mass-action propensity)表示,最终用Python的odeint求解器求解。BioSCRAPE还支持敏感性分析和贝叶斯推断,这为后续参数校准提供了工具基础。

转录模型的建立与验证

转录模型的验证采用了一种巧妙的策略:使用孔雀石绿适配体(malachite-green aptamer,MGapt)作为RNA产量的报告分子。MGapt是一种RNA适配体,当与孔雀石绿染料结合时会发出荧光信号,从而实时监测RNA转录产量。

研究者构建了包含转录过程的CRN模型,并将模型预测与MGapt的DNA表达实验数据进行比对。原文摘要未详述转录模型的具体反应参数(如RNA聚合酶浓度、NTP浓度、温度等),但明确表示转录模型经过了实验验证。

转录-翻译偶联模型

最后一步是将验证过的转录模型与泛化后的翻译模型偶联,形成完整的蛋白质合成模型。该模型完全由质量作用反应构成,不依赖任何经验性的近似方程。偶联后的模型用于捕获从不同浓度质粒表达的MGapt和deGFP(一种绿色荧光蛋白变体)的动力学特征。

值得注意的是,deGFP并非简单的报告蛋白——它包含较长的氨基酸序列,这正好检验了泛化翻译模型对任意长度蛋白质的适用性。

研究结果

翻译模型的成功泛化

将ePURE-MATLAB模型转换为BioCRNpyler格式后,原先需要手工书写的968个反应和241个物种现在可以由程序自动生成。更重要的是,模型不再局限于fMGG三肽——研究者可以输入任意氨基酸序列,系统自动生成对应的反应网络。

这一改造的实质意义在于:模型从“一次性使用”变成了“可重复使用”的工具。原始模型修改一个氨基酸就需要手动调整大量反应方程,而现在只需改变输入序列即可。

转录模型的实验验证

使用MGapt适配体作为RNA报告分子,研究者获得了转录过程的实验数据。原文摘要未提供具体的RNA产量数值或时间曲线数据,但明确表示转录模型得到了实验验证。这意味着模型预测的RNA合成动力学与实验观测吻合,包括转录的起始、延伸和终止过程。

偶联模型的预测能力

将转录与翻译模型偶联后,研究者用该模型捕获了MGapt和deGFP从不同浓度质粒表达的动力学特征。原文摘要未提供具体的质粒浓度梯度、蛋白产量数值或时间常数,但关键结论是:偶联模型能够定量预测蛋白质合成的动态过程。

这一结果的意义在于,模型完全基于质量作用反应构建,没有引入任何经验性的校正因子,却能够复现实验观测到的表达动力学。这验证了PURE系统作为“已知组分”平台的计算可预测性。

Generalization of the PURE-TL model and comparison against expressed deGFP from RNA. (a) Comparison of the original ePURE-MATLAB model to the PURE-TL model. The PURE-TL model (magenta line) and the ePURE-MATLAB model (cyan line) overlap, and the difference between the models (orange circles) is show
▲ Generalization of the PURE-TL model and comparison against expressed deGFP from RNA. (a) Comparison of the original ePURE-MATLAB model to the PURE-TL model. The PURE-TL model (magenta line) and the ePURE-MATLAB model (cyan line) overlap, and the difference between the models (orange circles) is show

讨论与展望

这项工作的核心贡献在于方法论层面。用BioCRNpyler将968个反应、241个物种的复杂模型转化为可编程、可扩展的框架,本质上解决了合成生物学建模中“一次建模、永远锁死”的困境。研究者选择MGapt而非传统报告基因验证转录模型,这一设计很有巧思——RNA适配体直接报告转录产物,绕开了翻译步骤的干扰,使得转录模型可以独立校准。

不过,模型仍有明显边界。原文摘要未提及翻译后修饰、蛋白折叠或共翻译折叠等过程,而这些在复杂蛋白表达中至关重要。此外,所有验证实验均基于质粒表达,对线性DNA模板(如PCR产物)的适用性尚未展示。

从应用角度看,该模型为DNA电路的原型设计提供了计算前筛工具。在湿实验之前先用模型跑一遍表达动力学,可以大幅减少试错成本。但模型目前的适用范围仍集中在PURE系统——这是其优势也是限制,粗提物系统的复杂性远非当前模型所能覆盖。

未来值得关注的方向包括:将模型扩展到更多蛋白类型(特别是膜蛋白或毒性蛋白),引入共翻译折叠机制,以及探索如何将模型参数与实验条件(如温度、离子强度)建立映射关系。

模拟deGFP生产利用有效RNA计算。PURE-TL模型的模拟deGFP生产(实线)在不同RNA浓度下初始化,叠加实验结果(带误差棒的圆圈),使用有效RNA浓度,如支持信息第3.10节所述。
▲ 模拟deGFP生产利用有效RNA计算。PURE-TL模型的模拟deGFP生产(实线)在不同RNA浓度下初始化,叠加实验结果(带误差棒的圆圈),使用有效RNA浓度,如支持信息第3.10节所述。

参考来源

Jurado Z, Pandey A, Murray RM. Nucleotide-Level Chemical Reaction Network Modeling Enables Quantitative Prediction of Reconstituted Cell-Free Expression Systems. ACS Synthetic Biology. PMID: 42289988. DOI: 10.1021/acssynbio.4c00873.

使用T7 RNA聚合酶的重构大肠杆菌转录系统进行RNA合成的示意图。我们将转录反应分为三个子过程:起始、延伸和终止。辅助反应(如能量回收或与翻译明确相关的反应)未包含在内。使用BioRender.com创建。
▲ 使用T7 RNA聚合酶的重构大肠杆菌转录系统进行RNA合成的示意图。我们将转录反应分为三个子过程:起始、延伸和终止。辅助反应(如能量回收或与翻译明确相关的反应)未包含在内。使用BioRender.com创建。

PMID: 42289988

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12