来源:ACS Synth Biol | 编译:DNA Lab Space
无细胞表达系统长期面临一个尴尬:粗提物像个黑箱,里面发生了什么谁也说不清。PURE系统虽然只保留转录翻译必需组分,却缺乏足够实验数据支撑其计算模型。本研究用化学反应网络(CRN)把PURE系统的转录和翻译过程拆解到核苷酸级别,再用RNA适配体和荧光蛋白实测数据校验模型,最终实现了对蛋白质合成动力学的定量预测。
研究背景
细胞-free表达系统(cell-free expression system)近年来成为合成生物学快速原型验证的重要工具。与活细胞相比,它没有细胞膜屏障,反应条件可灵活调控,DNA电路和功能蛋白的测试周期大幅缩短。但传统粗提物(crude extract)含有数百种未知组分,反应机理不透明,这给计算建模带来了根本性障碍。
PURE系统(Protein synthesis Using Recombinant Elements)则完全不同——它只包含蛋白质生产所需的转录和翻译组分,且所有蛋白质和小分子浓度已知。这为建立可靠的计算模型提供了理想平台。然而,此前针对PURE系统的详细翻译模型仅能表达一种名为fMGG的三肽(formyl-Met-Gly-Gly),且模型包含968个反应和241个物种,全部手工书写,想要改变或延长肽序列几乎不可能。
该研究试图解决两个核心问题:其一,如何将PURE翻译模型推广到任意氨基酸组成和长度的蛋白质;其二,如何建立转录过程的化学反应网络,并将转录与翻译模型偶联,形成完整的蛋白质合成预测工具。
研究方法
这项工作的技术路线分为三个层次:模型泛化、转录模型构建、以及转录-翻译偶联。
翻译模型的泛化改造
研究者以ePURE-MATLAB模型为起点,这是一个基于大肠杆菌重建体外翻译系统的确定性模型。原始模型仅能合成fMGG三肽,且968个反应和241个物种全部显式书写,扩展肽序列的工作量极大。
为突破这一限制,团队采用BioCRNpyler——一个基于Python的CRN编译器工具。该工具提供面向对象、模块化的框架,能从系统的高层描述自动生成所有反应、物种和参数。模型最初至少包含86个组分,系统会根据目标肽的序列自动生成其他中间组分和反应。
具体操作上,研究者先将ePURE-MATLAB翻译模型转换为Python格式,针对fMGG肽进行验证。原始模型中的反应被分为四组:起始(initiation)、延伸(elongation)、终止(termination)和辅助反应(auxiliary reactions)。利用BioCRNpyler的可扩展特性,延伸步骤得以自动生成,无需手工书写每个反应。
BioCRNpyler将模型输出为标准生物建模语言SBML(Systems Biology Markup Language)。随后使用BioSCRAPE Python包进行模拟——该工具将CRN转换为常微分方程(ODE),每个反应速率采用质量作用定律(mass-action propensity)表示,最终用Python的odeint求解器求解。BioSCRAPE还支持敏感性分析和贝叶斯推断,这为后续参数校准提供了工具基础。
转录模型的建立与验证
转录模型的验证采用了一种巧妙的策略:使用孔雀石绿适配体(malachite-green aptamer,MGapt)作为RNA产量的报告分子。MGapt是一种RNA适配体,当与孔雀石绿染料结合时会发出荧光信号,从而实时监测RNA转录产量。
研究者构建了包含转录过程的CRN模型,并将模型预测与MGapt的DNA表达实验数据进行比对。原文摘要未详述转录模型的具体反应参数(如RNA聚合酶浓度、NTP浓度、温度等),但明确表示转录模型经过了实验验证。
转录-翻译偶联模型
最后一步是将验证过的转录模型与泛化后的翻译模型偶联,形成完整的蛋白质合成模型。该模型完全由质量作用反应构成,不依赖任何经验性的近似方程。偶联后的模型用于捕获从不同浓度质粒表达的MGapt和deGFP(一种绿色荧光蛋白变体)的动力学特征。
值得注意的是,deGFP并非简单的报告蛋白——它包含较长的氨基酸序列,这正好检验了泛化翻译模型对任意长度蛋白质的适用性。
研究结果
翻译模型的成功泛化
将ePURE-MATLAB模型转换为BioCRNpyler格式后,原先需要手工书写的968个反应和241个物种现在可以由程序自动生成。更重要的是,模型不再局限于fMGG三肽——研究者可以输入任意氨基酸序列,系统自动生成对应的反应网络。
这一改造的实质意义在于:模型从“一次性使用”变成了“可重复使用”的工具。原始模型修改一个氨基酸就需要手动调整大量反应方程,而现在只需改变输入序列即可。
转录模型的实验验证
使用MGapt适配体作为RNA报告分子,研究者获得了转录过程的实验数据。原文摘要未提供具体的RNA产量数值或时间曲线数据,但明确表示转录模型得到了实验验证。这意味着模型预测的RNA合成动力学与实验观测吻合,包括转录的起始、延伸和终止过程。
偶联模型的预测能力
将转录与翻译模型偶联后,研究者用该模型捕获了MGapt和deGFP从不同浓度质粒表达的动力学特征。原文摘要未提供具体的质粒浓度梯度、蛋白产量数值或时间常数,但关键结论是:偶联模型能够定量预测蛋白质合成的动态过程。
这一结果的意义在于,模型完全基于质量作用反应构建,没有引入任何经验性的校正因子,却能够复现实验观测到的表达动力学。这验证了PURE系统作为“已知组分”平台的计算可预测性。

讨论与展望
这项工作的核心贡献在于方法论层面。用BioCRNpyler将968个反应、241个物种的复杂模型转化为可编程、可扩展的框架,本质上解决了合成生物学建模中“一次建模、永远锁死”的困境。研究者选择MGapt而非传统报告基因验证转录模型,这一设计很有巧思——RNA适配体直接报告转录产物,绕开了翻译步骤的干扰,使得转录模型可以独立校准。
不过,模型仍有明显边界。原文摘要未提及翻译后修饰、蛋白折叠或共翻译折叠等过程,而这些在复杂蛋白表达中至关重要。此外,所有验证实验均基于质粒表达,对线性DNA模板(如PCR产物)的适用性尚未展示。
从应用角度看,该模型为DNA电路的原型设计提供了计算前筛工具。在湿实验之前先用模型跑一遍表达动力学,可以大幅减少试错成本。但模型目前的适用范围仍集中在PURE系统——这是其优势也是限制,粗提物系统的复杂性远非当前模型所能覆盖。
未来值得关注的方向包括:将模型扩展到更多蛋白类型(特别是膜蛋白或毒性蛋白),引入共翻译折叠机制,以及探索如何将模型参数与实验条件(如温度、离子强度)建立映射关系。

参考来源
Jurado Z, Pandey A, Murray RM. Nucleotide-Level Chemical Reaction Network Modeling Enables Quantitative Prediction of Reconstituted Cell-Free Expression Systems. ACS Synthetic Biology. PMID: 42289988. DOI: 10.1021/acssynbio.4c00873.

PMID: 42289988