来源:ACS Synth Biol | 编译:DNA Lab Space
细胞无蛋白表达系统正在成为合成生物学快速原型验证的利器。但一个尴尬的事实摆在眼前:粗提物体系像个黑箱,里面发生了什么,没人能完全说清。PURE系统则不同——它只包含翻译和转录所需的必要组分,每种蛋白质和小分子的浓度都是已知的。理论上,这样的系统应该能建立精确的计算模型,实现可靠的定量预测。然而,支撑这一愿景的实验数据却少得可怜。
加州理工学院的Jurado、Pandey和Murray三位研究者近日在《ACS Synthetic Biology》上发表论文,他们用化学反应网络(CRN)建模方法,将PURE系统的转录与翻译模型耦合,构建了一个完全基于质量作用定律的蛋白质合成模型,并用该模型成功捕捉了不同质粒浓度下MGapt和deGFP的表达动力学。这项工作填补了PURE系统定量建模中实验验证的空白,让"计算指导设计"从口号变成了可操作的工具。
研究背景
无细胞表达系统(cell-free expression systems)的价值在于快速——从DNA到功能蛋白,几小时内就能完成,无需漫长的细胞培养周期。DNA电路的原型验证、功能蛋白的快速合成,都可以在这种开放环境中实现。
但粗提物(crude extracts)有一个先天缺陷:组分复杂,大量未知反应并行发生,建模者无从下手。PURE系统则干净得多。它由大肠杆菌翻译机器所需的纯化组分重组而成,所有蛋白质和小分子的浓度都是已知量。这种"透明"特性使其成为计算建模的理想平台。
此前已有研究者开发出PURE翻译模型的详细版本——ePURE-MATLAB模型。但这个模型有个硬伤:它只能表达fMGG三肽(甲酰甲硫氨酸-甘氨酸-甘氨酸)。模型包含968个反应和241个物种,全部显式写出,想要更换或延长肽序列,工作量之大令人望而却步。
更关键的问题是,PURE系统的转录模型缺乏实验数据支撑。RNA产量如何随时间变化?转录动力学参数如何确定?这些问题悬而未决,导致整个PURE蛋白质合成模型始终停留在"纸面推演"阶段。
研究方法
从三肽到任意蛋白:模型泛化的技术路线
研究团队首先面临的挑战是:如何将ePURE-MATLAB模型从只能合成fMGG三肽,扩展到能够合成任意氨基酸组成和长度的蛋白质?
他们选择了一个关键工具——BioCRNpyler。这是一个基于Python的CRN编译软件包,可以从系统的高层描述自动生成所有反应、物种和参数。BioCRNpyler采用面向对象、模块化的框架,能够将组件及其相互作用机制编译为CRN模型,并导出为标准生物学建模语言SBML(Systems Biology Markup Language)格式。
研究团队先将ePURE-MATLAB翻译模型用BioCRNpyler转换到Python环境。转换过程中,他们将模型中的反应分为四组:起始(initiation)、延伸(elongation)、终止(termination)和辅助反应(auxiliary reactions)。关键在于延伸步骤——BioCRNpyler的可扩展性特性使得生成依赖目标肽序列的物种和反应成为可能。
初始CRN模型至少包含86个组分,系统会根据目标肽的序列自动创建其他中间组分和反应。这种设计意味着,只要输入不同的肽序列,模型就能自动生成对应的反应网络,无需手动修改968个反应中的任何一个。
转录模型的构建与验证
转录模型的验证需要直接测量RNA产量。研究团队选择了孔雀石绿适配体(malachite-green aptamer,MGapt)作为报告分子。MGapt是一种RNA适配体,与孔雀石绿染料结合后会产生荧光信号,从而实现对RNA产量的实时定量。
他们用DNA表达MGapt,测量RNA的产生动力学,以此验证转录模型。原文摘要未详述具体的DNA浓度范围、反应温度和时间等参数,但明确指出转录模型是基于PURE系统的化学反应网络构建的。
模型模拟与参数推断
模型构建完成后,需要转化为可计算的数学形式。BioCRNpyler导出的SBML文件可以用任何兼容的SBML模拟器进行仿真。研究团队选择了BioSCRAPE——一个Python包,支持SBML模型的仿真、敏感性分析和贝叶斯推断。
转化过程如下:BioSCRAPE将CRN模型转换为常微分方程组(ODE),每个反应的速率用质量作用定律(mass-action propensity)表示,然后通过Python的odeint函数求解。
参数识别采用两阶段策略。第一阶段,对每个SBML模型进行局部敏感性分析,获得所有参数在所有时间点上对测量物种的敏感性。第二阶段,利用实验数据,通过BioSCRAPE中实现的贝叶斯推断算法(基于emcee Python包)识别最敏感参数。给定实验数据后,算法输出参数的概率分布。
耦合模型:转录+翻译
最后一步是将验证过的转录模型与泛化的翻译模型耦合。耦合后的模型完全由质量作用反应组成,用于模拟从质粒表达MGapt和deGFP的动力学过程。研究团队在不同质粒浓度下进行了实验,用耦合模型捕捉表达动力学特征。

研究结果
翻译模型的成功泛化
ePURE-MATLAB模型原本只能处理fMGG三肽,包含968个反应和241个物种,全部显式写出。这种"硬编码"方式使得肽链的修改或延伸极为困难——"labor-intensive and futile",原文如此形容。
通过BioCRNpyler重构后,模型获得了真正的可扩展性。研究团队完整保留了ePURE-MATLAB模型中的所有反应和参数,但将其组织方式从"写死的反应列表"转变为"按规则自动生成"的模块化框架。这意味着,任何氨基酸序列的蛋白质都可以通过输入序列信息自动生成对应的CRN模型。
转录模型的实验验证
MGapt的DNA表达实验提供了转录模型的关键验证数据。通过监测MGapt的荧光信号,研究团队获得了RNA产量随时间变化的动力学曲线。原文摘要未提供具体的RNA产量数值或时间点数据,但模型预测与实验数据的吻合是后续耦合模型成功的基础。
耦合模型的预测能力
耦合模型被用于模拟不同质粒浓度下MGapt和deGFP的表达。原文摘要明确指出,模型成功"captured the kinetics"——捕捉了这两种蛋白质的表达动力学特征。

deGFP(超折叠绿色荧光蛋白)是合成生物学中常用的报告蛋白,其荧光信号可直接反映蛋白质产量。研究团队在不同质粒浓度下进行实验,耦合模型能够再现表达动力学的变化趋势。原文未提供具体的浓度梯度设置和荧光强度数值,但"various concentrations"一词表明实验覆盖了多个质粒浓度条件。

讨论与展望
这项工作的核心贡献在于打通了PURE系统建模的"最后一公里"。此前的ePURE-MATLAB模型虽然详细,但局限于三肽,无法推广到实际应用所需的蛋白质。BioCRNpyler的引入解决了可扩展性问题,而MGapt实验则为转录模型提供了难得的实验支撑。
研究团队选择MGapt而非其他RNA检测方法,可能与其无需分离纯化、可实时监测的特点有关。deGFP作为翻译模型的验证对象,则兼顾了荧光检测的便利性和实际应用的相关性。
一个值得注意的设计选择是:模型完全基于质量作用定律构建。这意味着没有采用米氏方程等近似简化,所有反应速率都严格遵循质量作用动力学。这种"从底向上"的建模方式虽然计算成本更高,但避免了近似带来的系统误差,也使得模型参数的生化意义更加明确。
当然,当前模型的验证范围仍有限。MGapt和deGFP都是相对简单的报告蛋白,对于更复杂的多结构域蛋白、膜蛋白或翻译后修饰蛋白,模型是否依然准确,原文未提供数据。此外,PURE系统中的资源竞争效应(如多个基因共表达时的核糖体分配问题)是否能在当前框架下准确预测,也尚待验证。
但无论如何,这项工作为PURE系统的定量建模提供了一个可扩展、可共享的开源框架。当模型可以自由地"编译"任意蛋白质序列时,无细胞表达系统从经验调试走向理性设计的道路就铺平了。下一步,或许就是让模型指导实际的DNA电路设计——在实验之前,先让计算告诉你该怎么做。
参考来源
Jurado Z, Pandey A, Murray RM. Nucleotide-Level Chemical Reaction Network Modeling Enables Quantitative Prediction of Reconstituted Cell-Free Expression Systems. ACS Synthetic Biology. PMID: 42289988.
PMID: 42289988