来源:In Silico Design of phaCAB Expression Constructs for Cellulolytic Hosts Toward Hemp Hurd Valorisation and Polyhydroxybutyrate Biosynthesis.(Molecules)| 编译:DNA Lab Space
导读
塑料污染催生了可降解生物聚合物研究热潮。聚羟基丁酸酯(PHB)性能堪比聚丙烯,但生产成本居高不下。本研究以工业大麻麻秆(HH)这一废弃木质纤维素生物质为切入点,利用计算机模拟手段,将Cupriavidus necator H16的phaCAB基因簇设计为适用于纤维素降解宿主——热纤梭菌(Clostridium thermocellum)和里氏木霉(Trichoderma reesei)——的表达构建体。全程未涉及湿实验,但为未来整合生物加工(CBP)奠定了序列层面的设计基础。
研究背景
合成塑料的持久性与难降解性引发日益严峻的环境问题。PHB作为聚羟基脂肪酸酯(PHA)家族中最受关注的成员,具有与聚丙烯相当的热塑性——平均摩尔质量、55–80%的高结晶度、高达180°C的熔点及高拉伸强度。其可生物降解性和生物相容性使其在包装、医疗器械、农用地膜等领域具有应用前景。然而,碳源底物与发酵过程的高成本制约了PHB的大规模生产。
工业大麻麻秆是纤维提取后遗留的木質化内芯,作为农业废弃物,量大价廉且碳中和。将其作为木质纤维素原料供给可发酵糖,是实现可持续PHB生产的潜在路径。本研究建立在前期利用磁性纳米颗粒固定化纤维素酶水解预处理麻秆的工作基础之上,旨在通过计算机模拟评估将C. necator H16的phaC1、phaA和phaB1基因引入两种纤维素降解宿主(C. thermocellum DSM 1313与T. reesei RUT C-30)的可行性,为未来PHB生产构建概念性生物精炼平台。
研究方法
2.1 phaCAB基因的检索与验证
从注释基因组组装GCA_000009285.2(1号染色体登录号AM260479.1)中检索C. necator PHB生物合成操纵子的天然phaC1(H16_A1437)、phaA(H16_A1438)和phaB1(H16_A1439)编码序列,其位于1号染色体1557353-1559122、1559207-1560388和1560463-1561203位置(PhaC1 UniProt登录号P23608;PhaA UniProt登录号P14611;PhaB1 UniProt登录号14697)。位点特异性基因phaC1和phaB1在下文中分别简称为phaC和phaB。三条编码序列均作为独立开放阅读框(ORF)处理。在后续构建体设计前,记录其编码边界、起始密码子、末端终止密码子及翻译产物。每条编码序列均翻译为单一ORF,无内部终止密码子,与参考蛋白完全一致。
选择该操纵子的原因在于其是研究最深入的PHB生物合成系统之一,并已在多种微生物宿主中成功表达,适合作为计算菌株工程研究的模式途径。该操纵子编码PHB生物合成所需的三种核心酶:PhaA(乙酰辅酶A乙酰转移酶)、PhaB(乙酰乙酰辅酶A还原酶)和PhaC(PHB合酶)。下游构建体设计前,使用Clustal Omega(v1.2.4)评估序列完整性、开放阅读框保留情况及翻译连续性。三个基因在整个研究过程中始终作为独立开放阅读框处理,未生成融合PhaCAB产物。
【数据】基因组组装:GCA_000009285.2;染色体位置:1557353-1559122(phaC1)、1559207-1560388(phaA)、1560463-1561203(phaB1);比对工具:Clustal Omega v1.2.4

图1展示了phaCAB编码序列的计算设计与验证流程。各编码序列从基因组组装GCA_000009285.2中检索,分别翻译并验证为独立开放阅读框,在计算机中组装为中间载体pET-24a(+)-phaCAB,随后进行序列比对和模拟限制性酶切分析,最后针对T. reesei和C. thermocellum设计宿主特异性构建体。
2.2 phaCAB编码蛋白的计算机理化特性表征
使用ExPASy ProtParam平台分析PhaA、PhaB和PhaC的理化性质,如图2所示。考察参数包括分子量、理论等电点、不稳定指数、脂肪族指数和亲水性。这些参数仅作为基于序列的基线理化描述符,不用于预测溶解度、表达性能、蛋白质折叠、催化活性或宿主兼容性。未进行结构建模或蛋白质折叠预测。
理化表征旨在提供PHB生物合成酶的基线序列描述符,并识别未来实验实施中可能值得关注的数值。这些参数不用于预测溶解度、表达性能、蛋白质折叠、催化活性、辅因子可用性或宿主兼容性,仅作为初步理化描述符解读。
【数据】分析平台:ExPASy ProtParam;分析参数:分子量、理论pI、不稳定指数、脂肪族指数、GRAVY

图2为phaCAB编码蛋白的计算机理化表征流程图。使用ExPASy ProtParam分析分子量、理论等电点、不稳定指数、脂肪族指数、GRAVY、消光系数及估计半衰期。这些输出仅作为基线序列理化描述符解读,不预测蛋白质折叠、溶解度、催化活性、表达性能或宿主兼容性。估计半衰期是大肠杆菌体内参考值,不假设外推至T. reesei或嗜热C. thermocellum。
2.3 宿主特异性载体选择与表达设计
根据各宿主系统的生理和转录特征选择表达载体。pET-24a(+)选为E. coli BL21(DE3)的中间克隆载体。对于T. reesei,设计三个独立表达盒,每个表达盒拥有各自的启动子和终止子,而非单一多顺反子或双向启动子排列——这反映了该宿主多基因表达架构表征有限的情况。每个表达盒组合组成型tef1启动子、真菌Kozak上下文、一条编码序列和cbh1终止子,以及经过验证的真菌选择标记(hph)和靶向候选整合区域NL1的5′和3′同源臂(各约1000 bp)。候选位点为T. reesei RUT C-30组装GCA_000513815.1的scaffold_6:142,300–144,300(+链),坐标以半开区间[start, end)格式给出——5′臂[142,300–143,300)和3′臂[143,300–144,300)各恰好1000 bp且无重叠,合计恰好2000 bp。该位点是计算提出的候选位点,其中性需实验确认。设计旨在保留天然cbh1位点及其纤维素分解功能——有报道称将异源基因整合到远离天然cbh1位点的位置可避免破坏内源纤维素酶表达,且在某些替代位点可能比cbh1位点整合本身支持更高的异源转录。
对于C. thermocellum,使用pIKM1作为穿梭载体骨架,并添加宿主兼容的groEL启动子、独立核糖体结合位点、适当的基因间间距和转录终止子。由于仅凭序列分析无法确定启动子强度,启动子兼容性依据文献中记载的在目标宿主中的功能进行评估。定量启动子强度和条件特异性活性有待实验确定。载体选择基于文献报道的宿主兼容性、启动子可用性和异源表达研究适用性。
【数据】T. reesei同源臂:5′臂1000 bp + 3′臂1000 bp,合计2000 bp;候选整合位点:scaffold_6:142,300–144,300(+链);C. thermocellum载体骨架:pIKM1;启动子:groEL

图4为T. reesei特异性表达构建体(TrePHB3整合构建体)的计算机组装示意图。天然phaC(1770 bp)、phaA(1182 bp)和phaB(741 bp)编码序列被整合到三个独立的tef1驱动表达盒中,每个表达盒包含真菌Kozak上下文和cbh1终止子。最终构建体还包含gpdA–hph–trpC选择盒以及设计用于保留天然cbh1位点的候选NL1 5′和3′同源臂。

图5为C. thermocellum表达构建体(pCtPHB1)的计算机组装示意图。groEL–RBS1-phaC–RBS2-phaA–RBS3-phaB–终止子表达盒(4143 bp)在计算机中组装并插入6198 bp pIKM1骨架(Addgene保藏序列)的KflI和XbaI位点之间——切除两位点间172 bp天然片段后保留6026 bp——最终构建体为10,169 bp。
2.4 引物设计与限制性位点工程
引物设计支持E. coli中的中间组装以及T. reesei和C. thermocellum的宿主特异性构建。对于中间构建体,BamHI和SalI位点侧翼连接pET-24a(+)中的组装插入片段。对于C. thermocellum,KflI和XbaI位点侧翼连接groEL驱动的表达盒以插入pIKM1。对于T. reesei,特异性基因引物携带真菌Kozak上下文和用于表达盒组装的重叠尾部,而非单一方向性插入,使每个基因形成独立表达盒。使用SnapGene(v6.2)评估熔解温度、GC含量和位点整合,确认理论兼容性。对各个编码序列进行筛选,确认不存在可能干扰组装的内部识别位点。其他关键因素包括载体兼容性、编码序列完整性保留以及异源表达所需的启动子-基因方向维持。
【数据】中间构建体酶切位点:BamHI/SalI;C. thermocellum酶切位点:KflI/XbaI;软件:SnapGene v6.2

图3为中间载体pET-24a(+)-phaCAB构建体的计算机组装图。天然phaC、phaA和phaB编码序列组装为3693 bp插入片段(三条含终止密码子CDS的长度之和,插入片段边界不含额外接头或限制性位点碱基),侧翼为BamHI和SalI位点,连接至5291 bp的pET-24a(+)载体,生成约8984 bp的重组构建体。
2.5 宿主特异性密码子使用与序列组成分析
由于成功的虚拟组装并不能确定表达可行性,因此对两个最终宿主以及中间组装宿主E. coli BL21(DE3)中的每条编码序列进行了特异性宿主兼容性分析。针对phaC、phaA和phaB在T. reesei和C. thermocellum中的情况,评估以下参数:基因长度;编码序列GC含量;宿主基因组GC含量及二者差异;密码子适应指数(CAI);有效密码子数;稀有密码子频率和聚集情况。
phaC、phaA和phaB的编码序列在去除末端终止密码子后分别进行分析。宿主特异性密码子适应参考表由各宿主组装的注释核糖体蛋白编码序列生成。C. thermocellum参考集包含来自组装GCF_000184925.1的56条核糖体蛋白编码序列,T. reesei参考集包含来自组装GCA_000513815.1的100条核糖体蛋白编码序列。两种情况均选择相应RefSeq/GenBank注释中标注为核糖体蛋白的编码序列,排除假基因和部分CDS。对于E. coli,使用Biopython内置的SharpEcoliIndex参考集(Bio.SeqUtils.CodonUsageIndices),该参考集源自Sharp和Li的高表达大肠杆菌基因集,基因组GC含量根据组装GCF_000009565.1计算。天然C. necator H16编码序列从组装GCA_000009285.2检索。
密码子适应指数使用Sharp–Li相对适应度方法计算,在Biopython 1.86中实现。宿主参考集中不存在的密码子被赋予伪值。
【数据】C. thermocellum参考集:56条核糖体蛋白CDS(GCF_000184925.1);T. reesei参考集:100条核糖体蛋白CDS(GCA_000513815.1);E. coli参考集:SharpEcoliIndex;软件:Biopython 1.86

图6显示天然phaCAB基因的相对宿主兼容性,以数值而非定性类别呈现。密码子使用兼容性以phaC、phaA和phaB的平均CAI表示,GC兼容性以基因-宿主GC差异的平均绝对值表示:T. reesei平均CAI 0.702,平均|ΔGC| 12.72个百分点;C. thermocellum平均CAI 0.488,平均|ΔGC| 26.91个百分点。CAI值针对不同宿主特异性参考集计算,不是跨生物体的可直接比较的绝对性能标度,仅应作为宿主内相对度量。
研究结果
3.1 phaCAB序列检索与翻译的确认
从C. necator(组装GCA_000009285.2)检索的天然phaC1、phaA和phaB1编码序列分别翻译,并使用Clustal Omega与其各自参考蛋白进行比对。如图A1示意性总结所示,每条翻译序列与其对应参考蛋白之间观察到100%同一性,确认了整个翻译流程中开放阅读框的保留,不存在替换、插入或缺失。这些结果表明编码区域保持完整,适用于下游克隆和构建体开发。
此处的100%同一性反映了对已保藏C. necator H16编码序列的忠实检索和翻译,而非跨物种保守性。确认的序列完整性为后续理化表征、引物设计和计算机克隆分析提供了信心。100%同一性是对本研究所用序列检索和翻译流程准确性的质量控制检查,本身并非实质性生物学发现。
【数据】序列同一性:100%;比对工具:Clustal Omega

图10为检索到的phaC1、phaA和phaB1编码序列的蛋白水平同一性概要示意图:三次独立的参考序列与翻译序列同一性检查,每次均作为独立开放阅读框分析。
3.2 phaCAB编码蛋白的理化特性表征
#### 3.2.1 PhaA(乙酰辅酶A乙酰转移酶)
phaA基因编码乙酰辅酶A乙酰转移酶蛋白。在多种细菌中,phaA与phaB(乙酰乙酰辅酶A还原酶)在操纵子中成簇排列,提示PHB生产过程中存在协调表达。然而,在某些物种中,phaA与phaB之间的转录终止信号可能使二者的表达解偶联。PhaA负责两个乙酰辅酶A分子的初始缩合形成乙酰乙酰辅酶A,从而启动PHB生物合成。该酶由393个氨基酸组成,计算分子量为40.87 kDa,理论等电点(pI)为5.85,呈微酸性。不稳定指数(28.9)将该酶归类为稳定蛋白。脂肪族指数相对较高,为92.4;但实际热稳定性需要实验测试。负的GRAVY值(−0.12)表明整体亲水特性。虽然计算预测不能确证表达成功,但这些特征为未来实验表达研究提供了初步支持。
【数据】氨基酸数:393;分子量:40.87 kDa;理论pI:5.85;不稳定指数:28.9;脂肪族指数:92.4;GRAVY:−0.12
#### 3.2.2 PhaB(乙酰乙酰辅酶A还原酶)
PhaB是PHA生物合成途径中的关键酶,催化NADPH依赖的乙酰乙酰辅酶A还原为(R)-3-羟基丁酰辅酶A,后者随后被PHA合酶聚合形成PHB等PHA。该酶相对较小,约246个氨基酸,分子量26.45 kDa,理论pI为6.32,接近中性。不稳定指数(31.7)预测为稳定蛋白,脂肪族指数(84.6)相对较高;实际热稳定性需要实验测试。GRAVY值略负(−0.05),表明整体亲水特性;ProtParam不预测亚细胞定位,任何辅因子相互作用需要单独的实验或结构证据。
【数据】氨基酸数:约246;分子量:26.45 kDa;理论pI:6.32;不稳定指数:31.7;脂肪族指数:84.6;GRAVY:−0.05
#### 3.2.3 PhaC(聚羟基丁酸酯合酶)
PhaC是负责PHB链延伸的关键聚合酶。该酶约含589个氨基酸,分子量63.98 kDa。不稳定指数(35.4)低于不稳定阈值,脂肪族指数(88.1)相对较高;实际热稳定性需要实验测试。消光系数反映芳香族残基(Trp、Tyr、Cys)的丰度,主要用于估算蛋白质浓度,本身不确立结构稳定性。GRAVY值(−0.09)表明整体亲水特性;ProtParam不预测亚细胞或颗粒相关定位。
综合来看,ProtParam分析提供了与稳定、亲水蛋白一致的基线序列理化描述符;实际表达、折叠、活性和宿主兼容性需要实验验证。类似理化特征在C. necator的PHB生物合成酶中已有报道,这些酶通常是在聚合物合成途径中发挥作用的稳定胞内蛋白。这些序列衍生理化描述符为未来异源表达研究提供了基线信息,但不预测宿主兼容性或表达性能。
对其他工业相关PHA产生菌属(Azotobacter、Bacillus、Cupriavidus和Halomonas)的PHA合酶(PhaC)进行的类似ProtParam理化分析报告称,Cupriavidus PhaC同源物的不稳定指数约为34–43,GRAVY值在−0.27至−0.16之间,与本研究获得的C. necator H16 PhaC的稳定亲水特性(不稳定指数35.4,GRAVY −0.09)基本一致。不同PhaC序列的独立计算机分析结果一致,支持ProtParam衍生描述符作为初步筛选步骤的总体可靠性;但与该研究相同,此类序列衍生预测单独不能替代实验解析的结构或功能数据,特别是考虑到Bacillus来源PHA合酶与结构保守的Azotobacter、Cupriavidus和Halomonas组存在结构分化的报道。
【数据】氨基酸数:约589;分子量:63.98 kDa;不稳定指数:35.4;脂肪族指数:88.1;GRAVY:−0.09

图11为phaC、phaA和phaB在构建体阶段的蛋白水平同一性概要(翻译来源CDS与翻译构建体衍生CDS,氨基酸单位),分别显示每个基因,仅供参考。三个基因在整个研究过程中作为独立开放阅读框分析和处理;该图不代表融合的PhaCAB蛋白。
3.3 宿主特异性密码子与调控兼容性
来自C. necator H16的天然phaC、phaA和phaB编码序列在两个最终宿主和E. coli中间对照中显示出不同的密码子使用谱。对于E. coli,phaC、phaA和phaB的CAI值分别为0.7666、0.7695和0.7544,三个基因中没有任何密码子低于稀有密码子阈值。E. coli显示出最高的密码子兼容性,尽管其仅作为中间对照纳入。
C. thermocellum获得最低CAI值,phaC为0.4832,phaA为0.4912,phaB为0.4898。该宿主还显示出最大的组成差异,phaC、phaA和phaB的GC含量分别超过宿主基因组GC含量27.69、29.04和24.01个百分点。稀有密码子频率为phaC 5.26%、phaA 3.05%、phaB 4.07%,三个基因中主要的宿主不利密码子均为精氨酸密码子CGC——该密码子在此AT富集嗜热菌中被强烈回避。在phaC中鉴定出两个稀有密码子簇,phaB中一个。
T. reesei获得中高CAI值,phaC为0.6582,phaA为0.7356,phaB为0.7111。组成差异相应较小,分别为13.50、14.85和9.82个百分点。稀有密码子稀少,phaC为0.68%,phaA为0.51%,phaB中未检测到,三个基因中均未鉴定出稀有密码子簇。主要的宿主不利密码子为AAA和GTA。
ENC值分别为phaC 31.17、phaA 27.76、phaB 29.28。这些值表明同义密码子使用存在中等偏倚,与C. necator基因组的高GC含量(66.34%)一致,也是天然细菌编码序列的典型特征。这反映在相对密码子使用兼容性和稀有密码子负荷上(表6和图6),与T. reesei中度分歧,与C. thermocellum强烈分歧,因此密码子优化对嗜热菌更为关键。本文报道的pCtPHB1构建体有意保留天然C. necator编码序列作为未优化参考设计:它建立了判断预测密码子使用不匹配程度的基线,并避免在缺乏任何关于同义替换效果的实验数据之前引入未经测试的同义替换。密码子优化版本留待未来实验数据支持后进行。
【数据】E. coli CAI:0.7666(phaC)/0.7695(phaA)/0.7544(phaB);C. thermocellum CAI:0.4832/0.4912/0.4898;C. thermocellum GC差异:+27.69/+29.04/+24.01个百分点;C. thermocellum稀有密码子频率:5.26%/3.05%/4.07%;T. reesei CAI:0.6582/0.7356/0.7111;T. reesei GC差异:+13.50/+14.85/+9.82个百分点;T. reesei稀有密码子频率:0.68%/0.51%/未检测到;ENC:31.17/27.76/29.28;C. necator基因组GC:66.34%

图7为中间载体pET-24a(+)-phaCAB的模拟琼脂糖凝胶验证。泳道MW:分子量梯带。泳道1:仅编码序列phaCAB插入片段(约3693 bp;含终止密码子的CDS长度总和,不含引物添加的限制性位点碱基)。泳道2:线性化pET-24a(+)载体骨架(约5291 bp)。泳道3:完整重组pET-24a(+)-phaCAB构建体(约8984 bp)。泳道4:BamHI/SalI双酶切重组构建体,释放线性化载体骨架和phaCAB插入片段,呈预期的双片段模式。

图8为T. reesei TrePHB3整合构建体的计算机琼脂糖凝胶大小验证。泳道1代表完整的约10,343 bp整合构建体;泳道2–4代表三个独立的tef1驱动表达盒,分别携带phaC、phaA和phaB,大小约为2620、2032和1591 bp;泳道5代表约2100 bp的gpdA–hph–trpC选择盒。

图9为C. thermocellum pCtPHB1构建体的计算机琼脂糖凝胶验证。泳道1代表完整的10,169 bp构建体。泳道2代表KflI/XbaI双酶切,产生6026 bp的保留pIKM1骨架和4143 bp的完整groEL–phaC–phaA–phaB–终止子表达盒。泳道3–5分别代表phaC、phaA和phaB编码序列产物,大小为1770、1182和741 bp。
讨论与解读
本研究通过计算机模拟完成了从基因检索、理化表征、宿主特异性载体设计到密码子兼容性评估的全流程。核心发现可归纳为三点:其一,C. necator H16的phaCAB基因序列经检索翻译后与参考蛋白100%一致,序列完整性得到确认;其二,三种酶蛋白均表现为稳定亲水特性——不稳定指数均低于40,GRAVY均为负值,其中PhaA的不稳定指数最低(28.9),脂肪族指数最高(92.4);其三,密码子兼容性分析显示,T. reesei的CAI值(0.658–0.736)显著优于C. thermocellum(0.483–0.491),后者还面临高达24–29个百分点的GC含量差异和CGC稀有密码子聚集问题。这些定量结果明确提示:若未来进行实验验证,C. thermocellum需要密码子优化,而T. reesei的天然序列可能直接可行。
编译者解读:本研究将废弃麻秆增值、纤维素降解CBP宿主与PHB途径设计串联为一个概念性生物精炼框架,思路清晰且具有实际应用指向。方法上严格区分"计算设计"与"实验验证"的边界——所有结论均标注为序列衍生描述符,未越界推测表达性能。值得肯定的是,研究有意保留C. thermocellum的未优化天然序列作为参考基线,这种克制的设计策略为后续密码子优化提供了量化对照。局限性同样明显:全程无湿实验验证,启动子强度、同源臂中性、蛋白可溶性等关键参数均停留在计算机预测层面。下一步若能在T. reesei中先行验证TrePHB3构建体的整合与表达,将大幅提升该设计框架的可信度。
参考来源
Myeni ZR, Gumede S, Ntombela N, Dziike F, Deenadayalu N. In Silico Design of phaCAB Expression Constructs for Cellulolytic Hosts Toward Hemp Hurd Valorisation and Polyhydroxybutyrate Biosynthesis. Molecules. PMID: 42588577.
PMID: 42588577