来源:ACS Synth Biol | 编译:DNA Lab Space
细胞裂解物像一口沸腾的黑锅——里面发生着什么反应,谁也说不清。PURE系统则不同,它只保留转录翻译必需的组分,每个蛋白质、每颗小分子的浓度都摆在明面上。可偏偏这么透明的系统,却缺少足够的实验数据支撑其建模预测。加州理工学院的Jurado、Pandey和Murray近日在《ACS Synthetic Biology》上发表论文,将PURE系统的转录与翻译模型推广到任意氨基酸序列的蛋白质,并用适体RNA和荧光蛋白的实测数据验证了模型的预测能力。
研究背景
无细胞表达系统(Cell-free expression systems)是合成生物学的重要工具,能快速测试DNA回路设计、合成功能蛋白,无需维持活细胞培养。传统粗提物(crude extracts)组分复杂,大量未知反应混杂其中,如同一只难以拆解的黑箱。PURE系统(Protein synthesis Using Recombinant Elements)则剔除了所有冗余成分,只保留蛋白质生产所需的转录和翻译机器。每种蛋白质和小分子的浓度都是已知的,这让建立可靠的计算模型成为可能。
但问题随之而来——PURE系统的详细模型大多是针对特定短肽设计的。此前发表的ePURE-MATLAB模型只能表达一个由甲酰甲硫氨酸-甘氨酸-甘氨酸组成的三肽(fMGG),模型包含968个反应、241个物种,全部手工编写。想换个肽段序列,就得从头改写整个模型,费时费力且极易出错。
更关键的是,PURE模型的实验验证数据极度匮乏。模型预测的蛋白质表达动力学,到底准不准?没有实验数据对照,再精巧的模型也只是空中楼阁。
研究方法
这支研究团队的目标很明确:把PURE系统模型从"只能做三肽"推广到"任意氨基酸组成和长度的蛋白质",再用实验数据检验模型的预测能力。
第一步:用BioCRNpyler重建翻译模型
他们选择了化学反应网络(Chemical Reaction Network, CRN)形式来描述系统。CRN是一种用反应方程式刻画分子间相互作用的数学框架,每个反应速率用质量作用定律(mass-action kinetics)写出。团队使用CRN编译器BioCRNpyler——一个基于Python的软件包,能从系统的高层描述自动生成所有反应、物种和参数。
首先,他们将ePURE-MATLAB翻译模型中的968个反应分为四类:起始(initiation)、延伸(elongation)、终止(termination)和辅助反应(auxiliary reactions)。BioCRNpyler的模块化框架让延伸步骤变得可扩展——这是实现任意肽段序列的关键。初始模型至少包含86个组分,随着目标肽段序列的输入,系统会自动生成中间组分和相应反应。
模型输出采用系统生物学标记语言(SBML)格式,这是生物学建模的标准语言。模拟计算则交给BioSCRAPE——一个Python包,能将SBML模型转化为常微分方程组,用Python的odeint求解器进行数值积分。BioSCRAPE还内置了敏感性分析和贝叶斯推断工具,这对后续的参数鉴定至关重要。
第二步:建立转录模型并用MGapt适体验证
转录模型是本次工作的另一块基石。团队选择孔雀绿适体(malachite-green aptamer, MGapt)作为报告分子——这是一种RNA适体,结合孔雀绿染料后会产生荧光信号,因此可以用荧光强度实时监测RNA产量。
具体做法是:将编码MGapt的DNA模板加入PURE系统,在不同DNA浓度下测定RNA的生成动力学曲线。转录模型中的反应速率参数通过实验数据拟合获得——先做局部敏感性分析,找出对测量物种最敏感的参数,再用emcee Python包实现贝叶斯推断,从实验数据中反推参数的后验概率分布。
第三步:耦合转录-翻译模型预测蛋白质表达
最后一步,将验证过的转录模型和推广后的翻译模型耦合成一个完整的蛋白质合成模型。这个模型完全由质量作用反应构成,不含任何经验性的简化假设。团队用这个组合模型来预测两种报告蛋白的表达动力学:MGapt(RNA适体)和deGFP(一种增强型绿色荧光蛋白),两者均从不同浓度的质粒DNA模板表达。
原文摘要未详述具体的DNA浓度梯度数值、反应温度、孵育时间等实验参数,也未给出试剂用量和仪器型号。方法部分侧重计算建模流程,实验操作细节有待查阅全文补充。
研究结果
翻译模型的泛化能力
将ePURE-MATLAB模型从fMGG三肽推广到任意序列,这一目标通过BioCRNpyler成功实现。团队保留了原模型的所有反应和参数,利用CRN编译器的自动生成能力,使模型能够根据目标蛋白质的氨基酸序列自动构建相应的延伸反应网络。这意味着研究者不再需要手工编写上千个反应方程,只需输入蛋白质序列,模型便会自动生成对应的CRN。
转录模型的实验验证
转录模型的验证采用了MGapt适体系统。通过测量不同DNA模板浓度下MGapt RNA的产量,团队获得了转录动力学的实验数据。虽然原文摘要未提供具体的RNA产量数值和DNA浓度梯度数据,但模型成功捕捉了MGapt的生成动力学曲线,表明转录模型中的速率参数经过贝叶斯推断后能够准确反映PURE系统内的转录过程。
组合模型的预测能力
耦合后的转录-翻译模型被用于预测MGapt和deGFP从质粒DNA的表达。模型预测的蛋白质合成动力学与实验观测值吻合良好,且适用于多种质粒浓度条件。这一结果表明,纯质量作用反应构建的模型,无需引入任何经验修正项,就能定量描述PURE系统内的基因表达全过程。
原文摘要未提供deGFP的具体荧光强度数值、蛋白质产量(如mg/mL)或表达速率等定量数据,也未给出模型预测误差的统计指标。这些细节需要查阅论文全文获取。
讨论与展望
这项工作的核心贡献在于方法论:它展示了一条从"特例模型"到"通用模型"的技术路径。BioCRNpyler的模块化框架让模型具备了可扩展性和可共享性——翻译模型可以嵌入更大的系统模型,零件库和参数库也能被其他研究组复用。
选择MGapt和deGFP作为验证对象颇具巧思。MGapt是RNA适体,直接反映转录产量;deGFP是蛋白质,报告翻译完成度。两个报告分子覆盖了转录和翻译两个层面,恰好验证了耦合模型的完整性。
一个值得注意的设计选择是:模型完全基于质量作用反应,这保证了热力学一致性和可解释性,但代价是参数数量庞大。贝叶斯推断配合敏感性分析,有效缩小了参数搜索空间,这为类似复杂生物模型的参数化提供了可借鉴的范例。
PURE系统模型的价值不止于预测蛋白质产量。有了可靠的定量模型,DNA回路设计、蛋白质工程改造、代谢通路重构等任务都可以先在计算机上模拟筛选,再进入实验验证,大幅提升合成生物学的设计-构建-测试循环效率。当然,从三肽到任意蛋白质的跨越虽已完成,但模型对长链蛋白质、共翻译折叠、翻译暂停等复杂现象的刻画能力仍有待检验。
参考来源
Jurado Z, Pandey A, Murray RM. Nucleotide-Level Chemical Reaction Network Modeling Enables Quantitative Prediction of Reconstituted Cell-Free Expression Systems. ACS Synthetic Biology. PMID: 42289988. DOI: 10.1021/acssynbio.4c00861.
PMID: 42289988