来源:ACS Synth Biol | 编译:DNA Lab Space
无细胞表达系统长期以来面临一个尴尬局面:它既能快速合成功能蛋白,又因其组分复杂而难以精准调控。加州理工学院的Murray团队近期在《ACS Synthetic Biology》上发表了一项研究,将PURE无细胞系统的转录和翻译过程建模为核苷酸级别的化学反应网络(CRN),实现了对RNA和蛋白质产量的定量预测。这项工作把"经验试错"推向了"计算设计"。
研究背景
无细胞表达系统(cell-free expression system)是合成生物学的重要工具,尤其适合DNA电路的快速原型验证和功能蛋白的按需合成。粗提物(crude extract)系统虽然成本低、产量高,但内部成分繁杂——大量未知酶和底物同时参与反应,本质上是个"黑箱"。相比之下,PURE系统(Protein synthesis Using Recombinant Elements)只包含蛋白质生产所必需的转录和翻译组分,所有蛋白质和小分子的浓度都是已知的。这种"白箱"特性让PURE成为计算建模的理想平台。
然而,已有的PURE翻译模型大多局限于特定短肽。例如ePURE-MATLAB模型只能表达fMGG三肽(甲酰甲硫氨酸-甘氨酸-甘氨酸),包含968个反应和241个物种,全部手工编写。想改变肽段序列或长度?那几乎等于重写整个模型。更棘手的是,转录过程的定量模型也缺乏实验验证。本研究的目标正是打破这些限制:将翻译模型推广到任意氨基酸组成和长度的蛋白质,构建经实验验证的转录模型,最后把两者耦合为纯质量作用反应的完整蛋白质合成模型。
研究方法
建模框架:BioCRNpyler与SBML
研究团队选择化学反应网络(CRN)作为建模形式,使用BioCRNpyler编译器完成模型构建。BioCRNpyler是Python编写的模块化软件包,能从系统的高级描述自动生成所有反应、物种和参数。模型最初包含至少86个组分,随后根据目标肽段的序列动态生成其他中间组分和反应。输出格式采用系统生物学标记语言(SBML),这是该领域的标准交换格式。
模拟计算使用BioSCRAPE Python包完成。BioSCRAPE将SBML模型转换为常微分方程组(ODE),每个反应速率按质量作用定律(mass-action propensity)书写,再用Python的odeint求解器在指定初始条件下求解。之所以选择BioSCRAPE而非其他模拟器,是因为它除仿真外还内置了敏感性分析和贝叶斯推断工具。
翻译模型的推广:从fMGG到任意蛋白
第一步工作是将ePURE-MATLAB翻译模型用BioCRNpyler重写。原模型的968个反应被分为四类:起始(initiation)、延伸(elongation)、终止(termination)和辅助反应(auxiliary reactions)。延伸步骤是扩展肽段长度的关键,BioCRNpyler的可扩展性特性在此发挥核心作用——它能够根据目标蛋白的氨基酸序列自动生成对应的延伸反应链。所有反应和参数均保留自ePURE-MATLAB模型,确保与原始模型的一致性。
转录模型的构建与验证:MGapt报告系统
转录模型的验证选用孔雀石绿适配体(malachite-green aptamer,MGapt)作为报告分子。MGapt是一种RNA适配体,结合孔雀石绿染料后荧光显著增强,因此可通过荧光信号实时监测RNA产量,无需破坏性取样。研究团队将MGapt编码序列置于质粒上,在不同质粒浓度下表达,用荧光动力学数据校准转录模型参数。
耦合模型:转录+翻译的完整蛋白质合成
最后,将推广后的翻译模型与验证后的转录模型耦合,构建完整的PURE蛋白质合成模型。该模型完全由质量作用反应构成,不引入任何表观速率常数或启发式近似。耦合模型的验证对象是两种产物:MGapt(RNA适配体)和deGFP(增强型绿色荧光蛋白突变体)。两者均从质粒表达,质粒浓度设定多个梯度,以检验模型在不同模板浓度下的预测能力。
参数识别与敏感性分析
每个SBML模型都进行了局部敏感性分析,计算所有参数在所有时间点上对可测物种的敏感性。随后用贝叶斯推断算法(集成emcee Python包,在BioSCRAPE框架内运行)从实验数据中估计参数的后验概率分布。原文摘要未详述贝叶斯推断的具体先验分布和迭代次数。

研究结果
翻译模型推广成功:任意肽段可编程
将ePURE-MATLAB模型转换到BioCRNpyler平台后,fMGG三肽的合成过程被完整复现。更重要的是,新框架摆脱了手工编写反应的束缚——只要给定目标蛋白的氨基酸序列,模型就能自动生成对应的起始、延伸和终止反应。原文摘要未提供推广后模型的具体反应数和物种数,但明确指出该模型能够合成任意长度和序列的肽段,这是原版ePURE-MATLAB无法做到的。
转录模型验证:MGapt荧光动力学拟合
MGapt报告实验提供了转录过程的定量数据。研究团队在不同质粒浓度下测量RNA产量随时间的变化曲线,并用转录模型进行拟合。原文摘要未提供具体质粒浓度数值和拟合误差,但确认转录模型成功捕捉了MGapt的表达动力学特征。这一结果填补了PURE系统转录建模缺乏实验验证的空白。
耦合模型预测:MGapt与deGFP的定量匹配
将转录与翻译模型耦合后,研究团队用该模型同时预测MGapt和deGFP的表达动力学。两种产物均在多个质粒浓度下进行实验,模型输出与实验数据定量吻合。原文摘要未提供deGFP的具体产量数值和质粒浓度梯度范围,但强调模型"捕捉了动力学特征"(capture the kinetics),且整个模型完全由质量作用反应构成,没有引入任何经验修正项。

参数敏感性:识别关键调控节点
局部敏感性分析揭示了影响测量物种(RNA和蛋白质产量)的最敏感参数。这些参数对应的反应步骤,就是控制PURE系统输出的关键调控节点。原文摘要未详述哪些具体参数被识别为最敏感,也未提供敏感性系数的数值。

讨论与展望
这项研究的核心价值在于方法论:把PURE系统的建模从"特例手工"推进到"通用自动"。BioCRNpyler的可扩展性意味着,研究者只需输入目标蛋白的序列,就能获得完整的质量作用反应网络——这为DNA电路设计、代谢途径优化等下游应用提供了计算基础设施。
不过,模型仍有提升空间。当前验证仅覆盖MGapt和deGFP两种产物,更多蛋白(特别是跨膜蛋白、含非天然氨基酸的蛋白)的表达预测尚待检验。此外,模型的所有参数均来自ePURE-MATLAB原版,若PURE系统批次间存在组分活性差异,模型可能需要重新校准。原文摘要未提及模型对批次差异的鲁棒性分析。
从应用角度看,这种"序列进、动力学出"的预测能力,可能让无细胞系统从"实验筛选"转向"计算设计"。当蛋白质合成过程可以被定量预测时,合成生物学的研究范式也将随之改变——不再是"做了才知道",而是"算了再做"。
参考来源
Jurado Z, Pandey A, Murray RM. Nucleotide-Level Chemical Reaction Network Modeling Enables Quantitative Prediction of Reconstituted Cell-Free Expression Systems. ACS Synthetic Biology. PMID: 42289988.
PMID: 42289988