自养固碳蛋白-RNA互作在产乙酸菌中缺失的系统级预测

来源:Systems-level analysis predicts no autotrophy-linked protein-RNA interactions in Clostridium autoethanogenum.(Nat Commun)| 编译:DNA Lab Space

📎 相关工具:高级引物设计工具

导读

气体发酵利用产乙酸菌将工业废气中的CO/CO₂转化为燃料和化学品,是实现碳循环的重要生物路线。然而,我们对这类菌基因调控的理解仍十分有限。本研究以模式产乙酸菌 Clostridium autoethanogenum 为对象,结合恒化培养、功能基因组学与计算方法,系统绘制了自养与异养条件下的转录与翻译调控图谱,并预测了全基因组范围的蛋白-RNA互作。结果显示自养与异养之间的转录和翻译调控有限且不偶联,预测出的14个反式调控RNA结合蛋白(RBP)均不与自养关键基因直接关联。

研究背景

化石燃料依赖驱动温室气体排放,加速气候变化;废弃物积累则威胁全球生物可持续性。气体发酵通过利用工业废气和气化废弃物的碳氧化物,借助产乙酸菌将其转化为增值产品,成为应对上述挑战的可行技术。产乙酸菌凭借Wood-Ljungdahl通路(WLP)——目前已知最高效的CO₂固定途径——成为CO和CO₂捕集与转化的优选生物催化剂。然而,我们对产乙酸菌基因功能和代谢调控的认识不足,阻碍了对其细胞工厂的理性改造。多数研究聚焦转录层面,有限实验条件的结果提示代谢通量主要受翻译后调控,而多组学分析则表明转录后调控对遗传信息从DNA流向蛋白质具有显著影响。本研究旨在通过系统级方法,鉴定自养条件下全基因组的蛋白-RNA互作,填补该领域对RNA结合蛋白认知的空白。

研究方法

菌株与培养条件

本研究使用 C. autoethanogenum LAbrini36菌株(保藏于德国微生物和细胞培养物保藏中心,DSM 115981)。C. autoethanogenum 以生物三重复恒化连续培养方式生长,分别进行自养(合成气:50% CO、20% H₂、20% CO₂、10% Ar;AS Linde Gas)或异养(果糖15 g/L)培养,培养基为化学成分确定培养基(不含酵母提取物;补充方法)。培养在严格厌氧条件下进行,温度37°C,pH 5(以5 M NH₄OH维持),使用1.4 L Multifors生物反应器(Infors AG),工作体积约750 mL,连接Hiden HPR-20-QIC质谱仪(Hiden Analytical)进行在线尾气分析。消泡剂(435530;Sigma-Aldrich)以10 μL/h的速率连续加入反应器以防止起泡。自养培养使用合成气流速50 mL/min、搅拌转速675 RPM;异养培养使用N₂流速50 mL/min、搅拌转速200 RPM(接种后20小时内使用CO₂代替N₂)。由此,合成气和果糖培养的恒化器在稀释率(D)分别为1.03 ± 0.05和0.997 ± 0.003 day⁻¹条件下,达到稳态生物量浓度分别为1.37 ± 0.003和1.03 ± 0.008 g细胞干重/L。稳态结果和样品在培养物光密度(OD)、气体摄取和产率稳定至少三个工作体积后采集。

【数据】菌株:C. autoethanogenum LAbrini36(DSM 115981);合成气组成:50% CO、20% H₂、20% CO₂、10% Ar;果糖浓度:15 g/L;温度:37°C;pH:5;稀释率:1.03 ± 0.05(合成气)、0.997 ± 0.003 day⁻¹(果糖);稳态生物量:1.37 ± 0.003(合成气)、1.03 ± 0.008 g CDW/L(果糖);消泡剂流速:10 μL/h;合成气流速:50 mL/min;搅拌:675 RPM(自养)、200 RPM(异养)

生物量浓度与胞外代谢组分析

生物量浓度通过培养OD与生物量浓度之间的相关系数(0.23)计算。过滤培养液样品(保存于‒20°C至分析)中乙酸盐、乙醇和2,3-丁二醇的胞外代谢组分析采用HPLC(Shimadzu Prominence-I LC-2030 plus系统),使用Rezex™ ROA-Organic Acids H+(8%)300 × 7.8 mm色谱柱(00H-0138-K0;Phenomenex)及保护柱(03B-0138-K0;Phenomenex)。样品进样20 μL,以0.5 mM H₂SO₄为流动相、0.6 mL/min流速、45°C等度洗脱30 min。使用相应标准品、示差折光检测器(RID-20A;Shimadzu)和LabSolution软件(Shimadzu)进行鉴定和定量。需注意,细胞产生的是2R,3R-丁二醇。

【数据】色谱柱:Rezex™ ROA-Organic Acids H+ (8%) 300 × 7.8 mm;进样量:20 μL;流动相:0.5 mM H₂SO₄;流速:0.6 mL/min;温度:45°C;洗脱时间:30 min;检测器:RID-20A;生物量-OD相关系数:0.23

Cappable-seq

C. autoethanogenum 恒化培养物取样进行Cappable-seq:取5 mL(合成气培养)或6.5 mL(果糖培养)培养液(以使生物量匹配),离心(5000 × g,3 min,4°C),弃上清,液氮速冻后于‒80°C保存至分析。使用RNeasy Mini Kit(Qiagen)按制造商说明书从冷冻样品中提取总RNA,并使用RNase-Free DNase Set(Qiagen)进行柱上DNase处理。总RNA样品随后转换为Cappable-seq文库⁶⁶。富集和去帽后,使用SMARTer smRNA-seq试剂盒(TakaraBio)将RNA样品转换为Illumina-ready文库。文库质量通过Agilent 2100 Bioanalyzer评估,最终使用Illumina Novaseq 6000测序仪进行1 × 100 bp循环(单端)测序。

【数据】取样量:5 mL(合成气)、6.5 mL(果糖);离心:5000 × g,3 min,4°C;保存:‒80°C;RNA提取:RNeasy Mini Kit;文库构建:SMARTer smRNA-seq kit;测序:Illumina Novaseq 6000,1 × 100 bp单端

Term-seq

与Cappable-seq相同的细胞沉淀用于Term-seq(取样细节见上文)。使用RIBO-Zero试剂盒(Illumina)按制造商说明从总RNA中去除核糖体RNA。核糖体RNA去除后的RNA 3′末端进行多聚腺苷酸化,随后进行RNA片段化、末端修复,并使用SMARTer smRNA-seq试剂盒(TakaraBio)进行文库制备。文库质量通过Agilent 2100 Bioanalyzer评估,最终使用Illumina Novaseq 6000测序仪进行2 × 100 bp循环(双端)测序。

【数据】rRNA去除:RIBO-Zero kit;文库构建:SMARTer smRNA-seq kit;测序:Illumina Novaseq 6000,2 × 100 bp双端

TIS和T3E位点全基因组鉴定的数据分析

首先,Term-seq读数(R1或R2)均修剪掉文库构建过程中添加的序列元件。在每个R1/R2配对中,经修剪选择的读数包括R1读数(当R1含有3′接头时,即读数到达mRNA片段末端时)或R2读数的反向互补序列(始终包含mRNA片段末端)。只要可能,优先选择R1而非R2,因为R1通常具有更高的序列质量。经修剪的Cappable-seq读数(按5′末端位置)和经修剪选择的Term-seq读数(按3′末端位置)使用STAR¹³¹比对到 C. autoethanogenum LAbrini菌株基因组(GenBank CP110420.1)。读数质量控制通过Fastq和测序指标进行,读数统计见补充数据5。

其次,C. autoethanogenum CDS被组织为单基因操纵子(monocistronic operons)和多基因操纵子(polycistronic operons,操作上定义为同一链上连续编码且间隔≤60 nt的蛋白质编码基因集合)。对于Cappable-seq读数覆盖度相对于操纵子的分析,我们实施了以下启发式流程:

对每个操纵子,我们考虑包含基因操纵子位置及其5′侧翼(上游)序列(延伸至同链上游基因操纵子)的基因组区域。基于基因组注释,我们将该区域内每个位置表征为假定“5′UTR”、编码区(“CDS”)或多基因操纵子的基因间区(“IG”)。

从假定“5′UTR”区域中,我们鉴定具有最大Cappable-seq 5′末端覆盖度的位置i:C(Fructose)ᵢᴹ(三个果糖生物重复中覆盖度总和最大者);C(Syngas)ᵢᴹ(三个合成气生物重复中覆盖度总和最大者)。

我们鉴定“5′UTR”、“CDS”或“IG”区域内所有满足C(Fructose)ⱼ ≥ T ∙ C(Fructose)ᵢᴹ且C(Syngas)ⱼ ≥ T ∙ C(Syngas)ᵢᴹ的位置j,其中T = 0.1为相对于操纵子5′UTR中鉴定到的最大覆盖度的分数阈值。我们将果糖或合成气生物重复中“5′UTR”区域鉴定到的所有位点视为潜在TIS候选位点,将“CDS”和“IG”区域鉴定到的所有位点视为背景(代表非特异性信号)。

【数据】比对工具:STAR;参考基因组:GenBank CP110420.1;操纵子间隔阈值:≤60 nt;覆盖度阈值:T = 0.1;生物重复数:3

图注:CDS 编码DNA序列,DTR 差异转录,DTL 差异翻译,NR 无差异调控。本图使用Flaticon.com的资源设计(完整来源归属请见致谢部分)。
▲ 图注:CDS 编码DNA序列,DTR 差异转录,DTL 差异翻译,NR 无差异调控。本图使用Flaticon.com的资源设计(完整来源归属请见致谢部分)。

研究结果

C. autoethanogenum 的自养和异养恒化培养

为绘制可能参与产乙酸菌自养的基因组范围RBP-RNA互作图谱,我们在恒化连续培养中使 C. autoethanogenum LAbrini36菌株分别以合成气(CO、H₂、CO₂;即自养)和果糖(即异养)生长(图1)。重要的是,这使我们能够在相同比生长速率(µ;约0.04 h⁻¹或约1 day⁻¹)下培养细胞,因为在稳态时µ等于稀释率,从而能够在不受自养和异养指数批次生长期间不同µ混杂效应影响的情况下,明确量化自养和异养的转录与翻译模式。例如,在 C. autoethanogenum 合成气和果糖批次培养的2,030个差异表达转录本中⁵⁰,约24%在自养恒化培养中随生长加快也差异表达³⁴。

值得注意的是,我们发现合成气与果糖稳态培养相比,比乙酸和比乙醇产率(mmol/g细胞干重/天)均高约2.3倍,比2,3-丁二醇产率高9倍(补充图1a)。前者可归因于碳分配至生物量的比例加倍(补充图1b),这有利于能量更丰富的营养物果糖;后者则表明自养条件下产生较少生物量时,需要更多通过副产物再生还原当量。有趣的是,LAbrini菌株的合成气和果糖恒化培养均仅显示乙酸产量比乙醇高约1.5倍(补充图1a),而 C. autoethanogenum JA1-1菌株的果糖批次培养几乎未检测到乙醇产生⁵⁰。

【数据】比生长速率:约0.04 h⁻¹(约1 day⁻¹);合成气vs果糖:比乙酸产率高约2.3倍、比乙醇产率高约2.3倍、比2,3-丁二醇产率高9倍;乙酸/乙醇产量比:约1.5倍;批次培养差异表达转录本:2,030个;恒化培养中随生长加快差异表达比例:约24%

实现自养所涉及的转录和翻译调控有限

我们首先使用RNA-seq(补充数据1)量化自养所涉及的转录调控(图1),并使用polysome-seq(补充数据2)而非Ribo-seq量化翻译调控,因为只有polysome-seq能提供每个mRNA拷贝水平的解析⁵¹。我们的RNA-seq分析量化了3,557个基因的转录水平,而polysome-seq分析在合成气和果糖培养的生物重复中平均确定了3,875个基因的翻译状态。合成气和果糖培养生物重复的可重复性通过Spearman相关系数估计,RNA-seq和polysome-seq数据分别为0.99和0.71(补充图2a和3)。RNA-seq数据的生物重复也聚类良好,显示合成气和果糖培养之间转录组谱明显区分(补充图2b,c)。对polysome-seq数据的组合相关分析、成分距离分析和主成分分析(详见方法)导致合成气和果糖各移除一个离群生物重复培养(补充图4)。RNA-seq数据分析得出1,784个基因在合成气和果糖生长之间具有统计学显著差异表达(q值 < 0.05)(图2a和补充数据3)。我们根据q值(值越低排名越高)确定前5%排名的基因为差异转录基因(DTR),以确保与从polysome-seq数据确定差异翻译基因(DTL)的一致性(见下段)。因此,176个基因被视为DTR,其中109个和67个分别在合成气与果糖上被下调或上调(图2a和补充数据3)。

a Volcano plot showing genes determined as differentially transcribed (DTR; #176) as a subset of 1784 genes with statistically different expression ( q -value < 0.05) between syngas and fructose chemostats (DTRs are top 5% ranked according to q -value). NR not differentially regulated, FC fold-ch
▲ a Volcano plot showing genes determined as differentially transcribed (DTR; #176) as a subset of 1784 genes with statistically different expression ( q -value < 0.05) between syngas and fructose chemostats (DTRs are top 5% ranked according to q -value). NR not differentially regulated, FC fold-ch

由于polysome-seq在单mRNA拷贝水平量化与不同数量核糖体结合的转录本,与Ribo-seq相比,它能捕获指示翻译控制的不同特征。为利用这一优势确定DTL,我们建立了三个互补的翻译调控指标(图2b;详见方法)。首先,我们计算每个基因在两种底物下核糖体结合和核糖体游离部分中mRNA比例之和的比值。这等同于polysome-seq数据传统上使用的核糖体占用术语⁵¹。然后我们通过从合成气比值中减去果糖比值来量化该翻译状态指标在合成气与果糖之间的差异(TL-STATUS)。TL-STATUS正值表示合成气相对果糖上调,负值表示下调(补充数据4)。我们的数据显示每个基因超过90%的mRNA拷贝与核糖体结合(补充数据2),与 E. coli⁵²相似,但高于 Lactococcus lactis⁵³和 Saccharomyces cerevisiae⁵¹,⁵⁴。其次,我们使用方差加权Aitchison距离量化每个基因在两种生长条件下多核糖体谱之间的差异(TL-PROFILE)(补充数据4)。第三,我们通过自举法(bootstrap)量化每个基因在合成气和果糖之间mRNA比例差异具有统计学显著性的多核糖体级分数目(POLY-FRACTIONS)(补充数据4)。TL-STATUS捕获任何基因mRNA的整体翻译状态,而POLY-FRACTIONS和TL-PROFILE通过分别捕获单个多核糖体级分及其谱之间的差异,提供翻译调控的额外信息。

为评估这三个指标作为实现自养所涉及的基因水平翻译调控指标,我们比较了每个指标前5%排名内的基因。在前5%排名共441个基因中,约2%(8个)和约14%(61个)分别被三个或两个指标共享(图2c)。有趣的是,每个指标鉴定出约29%(21.3%、32.2%、32.7%)的独特基因,并且每个指标前5%基因集中也富集了独特的KEGG Orthology(KO)功能类别⁵⁵或Pfam条目⁵⁶(图2d)。尽管在基因和功能类别水平上重叠有限,三个指标前5%基因集的交叉比较表明,三者均捕获了翻译调控的相似趋势。

【数据】RNA-seq量化基因数:3,557;polysome-seq量化基因数:3,875(平均);Spearman相关系数:RNA-seq 0.99、polysome-seq 0.71;差异表达基因数:1,784(q < 0.05);DTR数:176(109下调、67上调);核糖体结合mRNA比例:>90%;前5%总基因数:441;三指标共享:8个(约2%);两指标共享:61个(约14%);各指标独特基因比例:约29%(21.3%、32.2%、32.7%)

讨论与解读

转录后调控在产乙酸菌中发挥重要作用,但该调控层的关键参与者——RNA结合蛋白——此前从未被描述。本研究通过结合恒化培养、功能基因组学和计算方法,对模式产乙酸菌 C. autoethanogenum 进行了全基因组范围的RBP及RBP-RNA互作预测。研究发现自养与异养之间仅存在有限的转录和翻译调控(DTL仅186个),与转录水平与蛋白水平之间的良好相关性(R约0.69,1,797个基因)一致,也与不同气体底物恒化培养间差异表达蛋白数量少的结果相符——代谢通量调整主要伴随酶催化速率的变化。

编译者解读:该研究的方法论价值在于将恒化培养、polysome-seq多指标翻译分析和计算预测整合为一条系统级流水线,为解析非模式微生物的转录后调控提供了可复制的范式。其核心发现——自养相关基因的调控主要不依赖RBP介导的RNA互作——提示产乙酸菌可能通过代谢物浓度驱动的酶活性调节实现自养适应,这对代谢工程改造具有指导意义:过度关注转录因子或RBP工程或许并非最优策略。然而,预测结果缺乏CLIP-seq等实验验证,RBP功能的假说仍需湿实验检验。未来将计算预测与高通量RNA互作捕获技术结合,有望进一步揭示产乙酸菌调控网络的全貌。

参考来源

Re A, Politano GMM, Reinmets K, Benso A, Girbal L. Systems-level analysis predicts no autotrophy-linked protein-RNA interactions in Clostridium autoethanogenum. Nat Commun. PMID: 42420277.

PMID: 42420277

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 基于染色质可及性的酿酒酵母基因表达水平多机器学习模型预测 09-12