来源:ACS Synth Biol | 编译:DNA Lab Space
无细胞表达系统长期面临一个尴尬:粗提物像个黑箱,里面成分杂、反应多,谁也说不清每一步到底发生了什么。而PURE系统不同——它只含翻译和转录所需的必要组分,每种蛋白质和小分子的浓度都是已知的。这让精确建模成为可能,也让“预测蛋白质产量”从口号变成了可操作的技术路线。然而,支撑PURE系统模型的目标蛋白表达实验数据一直稀缺。这篇发表于《ACS Synthetic Biology》的研究,正是冲着这个缺口来的。
研究背景
细胞-free表达系统(cell-free expression system)在DNA电路快速原型化和功能性蛋白合成领域应用广泛。粗提物(crude extracts)成本低、操作简单,但成分复杂,大量未知反应混杂其中,模型预测的可靠性大打折扣。PURE系统则不同,它只包含蛋白生产所需的转录和翻译组分,所有蛋白质和小分子的浓度都是已知的,因此可以支撑详细的机理建模和可靠的计算预测。
但问题在于:针对PURE系统的模型虽然精细,却缺乏足够的实验数据来验证目标蛋白的表达。已有的ePURE-MATLAB翻译模型仅能表达一种名为fMGG的三肽(formyl-Met-Gly-Gly),模型包含968个反应和241个物种,全部显式写入。想换个肽段?那几乎等于重写整个模型。这种“一次性”建模方式既费人力又难扩展,严重制约了PURE系统在蛋白工程中的应用。
本研究的思路很直接:用化学反应网络(CRN)编译器BioCRNpyler,把PURE系统的翻译模型泛化到任意氨基酸组成和长度的蛋白质;再为转录过程构建CRN模型,用孔雀绿适配体(MGapt)验证RNA产量;最后把转录和翻译模型耦合成一个完全由质量作用反应构成的PURE蛋白合成模型,并用它捕获不同质粒浓度下MGapt和deGFP的表达动力学。
研究方法
模型构建:从固定三肽到任意序列
研究者以已发表的fMGG三肽确定性合成模型为基础,该模型基于大肠杆菌重组体外翻译系统的组分构建。他们采用CRN形式化方法,借助名为BioCRNpyler的CRN编译器,创建了一个详细的机理模型。这个计算模型的独特之处在于:它可以合成任意长度和序列的肽段,而不仅限于fMGG。
CRN模型最初从最少86个组分开始,根据目标肽段的序列自动生成其他中间组分和反应。BioCRNpyler输出标准生物学建模语言SBML(Systems Biology Markup Language)格式的文件,导出的SBML文件可用任何兼容的模拟器运行。研究者选用BioSCRAPE这个Python包来模拟SBML模型——BioSCRAPE先将CRN模型转换为常微分方程(ODE),再用Python的odeint求解器在指定初始条件下求解。每个反应速率都按质量作用倾向性(mass-action propensity)写出。选择BioSCRAPE的原因在于它除了模型模拟,还支持敏感性分析和贝叶斯推断工具。
模型转换:从ePURE-MATLAB到BioCRNpyler
研究者首先把ePURE-MATLAB翻译模型用BioCRNpyler转换到Python环境,目标肽段仍是fMGG。基于电子表格版的ePURE-MATLAB模型,反应被分为四组:起始(initiation)、延伸(elongation)、终止(termination)和辅助反应(auxiliary reactions)。为了生成依赖目标肽段的物种和反应,他们利用了BioCRNpyler中支持可扩展性的功能——这对延伸步骤至关重要。原模型的所有反应和参数均予以保留。BioCRNpyler提供了面向对象、模块化的框架,能自动生成所有反应、物种和参数,把系统的高层描述编译成CRN模型。模型可导出为SBML格式,其组成组件和关联参数可共享,用于构建更大的系统模型。这种用BioCRNpyler构建PURE模型的方式,让模型变得易于修改、扩展和共享。BioCRNpyler还包含零部件和参数库,可将模型的部分内容分享给其他更大的系统模型。
转录模型验证:用MGapt测量RNA产量
为验证转录模型,研究者使用DNA表达孔雀绿适配体(malachite-green aptamer,MGapt)来测量RNA产量。MGapt是一种能结合孔雀绿染料并增强其荧光的RNA适配体,其荧光信号与RNA浓度成正比,因此可作为RNA合成的定量读出。
参数识别:敏感性分析与贝叶斯推断
对每个SBML模型,研究者运行了局部敏感性分析,获取所有参数在所有时间点上对测量物种的敏感性。随后,他们利用实验数据识别模型中最敏感的参数。参数识别采用BioSCRAPE中实现的贝叶斯推断算法,配合emcee Python包完成。给定实验数据后,通过该算法获得参数的概率分布。
最终模型:质量作用反应构成的PURE蛋白合成模型
最后,研究者将转录模型与泛化的翻译模型耦合,构建了一个完全由质量作用反应构成的PURE蛋白合成模型。该组合模型用于捕获从不同浓度质粒表达的MGapt和deGFP的动力学特征。
原文摘要未详述的具体参数包括:质粒浓度梯度设置的具体数值、反应温度、反应时间、MGapt和deGFP的检测方法细节、各反应步骤的缓冲液成分等。原文未提供这些参数的定量数据。

研究结果
翻译模型泛化:从fMGG到任意蛋白
原ePURE-MATLAB模型仅能表达fMGG三肽,包含968个反应和241个物种,全部显式写入。这种设计使得改变或延伸肽段的工作既费人力又难以实现。通过BioCRNpyler的CRN编译器,研究者成功将这一模型泛化,使其能够合成任意氨基酸组成和长度的肽段。CRN模型从最少86个组分起步,根据目标肽段序列自动生成中间组分和反应。这意味着,研究者不再需要为每个新肽段手工重写数百个反应——模型可以根据序列自动扩展。
转录模型验证:MGapt荧光报告RNA产量
转录模型的验证通过MGapt来实现。MGapt是孔雀绿适配体,其荧光信号可定量反映RNA产量。研究者用DNA表达MGapt,通过测量荧光来验证转录模型的预测能力。原文摘要未提供MGapt表达的具体荧光数值或RNA产量定量数据。
组合模型预测:MGapt与deGFP的动力学捕获
研究者将转录模型与泛化的翻译模型耦合,形成PURE蛋白合成模型。该模型完全由质量作用反应构成,不依赖任何经验性的近似或简化。他们用这个组合模型捕获了从不同浓度质粒表达的MGapt和deGFP的动力学特征。原文摘要未提供deGFP表达的具体产量数值、不同质粒浓度下的表达差异倍数,或动力学曲线的定量参数。

敏感性分析与参数识别
研究者对每个SBML模型进行了局部敏感性分析,以获取测量物种对所有参数在所有时间点的敏感性。然后利用实验数据,通过贝叶斯推断算法(配合emcee Python包)识别最敏感的参数。给定实验数据后,该算法输出参数的概率分布。原文摘要未提供敏感性分析的具体结果——例如哪些参数被识别为最敏感、参数后验分布的具体形状或置信区间等。

讨论与展望
这项工作的核心贡献在于方法论:它把PURE系统的建模从“一次性的手工劳动”变成了“可扩展的模块化流程”。BioCRNpyler的引入让模型构建、修改和共享变得像搭积木一样灵活——想换目标蛋白?只需改变肽段序列,模型自动生成对应的反应网络。这种框架对无细胞系统的设计-构建-测试循环具有重要意义。
不过,原文摘要未详述的部分也不少。转录模型验证中MGapt的具体荧光数据、组合模型在定量预测上的误差范围、敏感性分析识别出的关键参数清单——这些细节在摘要层面均未提供。后续若能公开完整的实验数据集和参数后验分布,将有助于其他研究团队复现和扩展这一模型框架。
另一个值得关注的点是:本研究构建的模型完全基于质量作用反应,这意味着它不依赖任何经验性的近似。这种“从机理出发”的建模方式虽然计算成本更高,但可解释性更强,也更适合用于系统性地探索PURE系统的设计空间。未来若能与自动化的实验平台结合,这种建模方法有望成为无细胞合成生物学中常规的预测工具。
参考来源
Jurado Z, Pandey A, Murray RM. Nucleotide-Level Chemical Reaction Network Modeling Enables Quantitative Prediction of Reconstituted Cell-Free Expression Systems. ACS Synthetic Biology. PMID: 42289988. DOI: 10.1021/acssynbio.4c00848.
PMID: 42289988