系统发现大肠杆菌中的酶底物混杂性

来源:Systematic discovery of enzyme promiscuity in Escherichia coli using in vitro metabolomics.(Commun Biol)| 编译:DNA Lab Space

📎 相关工具:论文撰写

导读

传统观点认为代谢酶是高度专一的催化剂,但越来越多的证据表明许多酶具有催化多种反应的"混杂性"能力。本研究利用非靶向代谢组学技术,对大肠杆菌中667个成功纯化的代谢酶进行了系统筛选,在天然细胞内代谢物提取物中监测动态代谢物离子谱。结果发现近半数酶能引起离子轨迹的显著变化,11%的测试酶表现出此前未知的混杂活性。研究还成功重构了22个完整反应计量关系,并通过实验验证了DeoA、NanK、CobC等酶的底物混杂性,为理解代谢网络的进化与功能注释提供了新证据。

研究背景

代谢作用传统上被视为由专一性酶构成的刚性网络,每种酶都经过优化以高效精确地催化单一生化反应。然而,越来越多的证据挑战了这一观点,表明许多——甚至大多数——酶表现出混杂性。酶混杂性指酶能够催化超出其原始进化功能(或假定功能)之外的反应,包括接受多种底物或催化多种不同反应。这些通常较慢的副反应被认为是祖先酶的进化遗留——祖先酶最初以低速率催化多种反应,随着时间推移,某些功能通过基因复制和分化被优化,而其他功能的痕迹则以混杂活性的形式留存,为理解新酶功能乃至整个代谢途径的涌现提供了线索。这些潜在代谢功能在标准条件下常被认为无足轻重,但事实上可能在生物体面临环境压力时赋予适应性优势。无需进化出全新的代谢功能,仅单个突变即可显著增强已有的混杂活性,通过利用非预期底物或途径促进适应。尽管代谢网络中的初级反应已通过假设驱动方法得到充分表征,但混杂活性尚未被系统探索。

研究方法

选定混杂酶的实验验证

为验证预测的混杂反应,我们根据底物可获得性及其功能相关性选择了一部分酶进行功能实验。纯化的酶在仅含预测底物和辅因子的酶缓冲液中孵育。在某些情况下,还检测了与已知或预测反应物结构相似的底物,以评估潜在的底物混杂性。这些酶促反应的读出通过质谱法完成,以确定是否形成了预期产物。

第一个测试的酶是CobC,通过序列相似性注释为作用于维生素B12生物合成中钴胺素中间体的磷酸酶。这些经典底物大于我们FIA-MS分析所用的m/z 50–1000窗口,因此无法检测。相反,我们确认了预测的FMN脱磷酸化为核黄素的反应(图1b–d,补充图4)。尽管已注释反应与验证反应的机制相似,但我们的结果表明CobC对化学结构不同的底物具有活性,提示其在维生素生物合成中扮演通用型角色。

a 实验装置。使用ASKA文库35中的菌株表达蛋白质,并采用TALON技术进行纯化。将纯化后的蛋白质与浓缩代谢物提取物一起孵育,该提取物制备自两种不同
▲ a 实验装置。使用ASKA文库35中的菌株表达蛋白质,并采用TALON技术进行纯化。将纯化后的蛋白质与浓缩代谢物提取物一起孵育,该提取物制备自两种不同

接下来,我们研究了N-乙酰甘露糖胺激酶(NanK),该酶已被表征为以ATP作为磷酸供体,将N-乙酰-D-甘露糖胺磷酸化为N-乙酰-D-甘露糖胺6-磷酸。正如预测的那样,NanK表现出额外的肌苷三磷酸(ITP)依赖性激酶活性,将D-甘露糖转化为D-甘露糖6-磷酸并产生肌苷二磷酸(IDP)(图5a),从而展示了辅因子混杂性(图5b)。此外,我们测试了NanK与D-果糖(因其与主要底物D-甘露糖结构相似)的孵育,揭示了额外的糖底物混杂性(补充图5)。

a Validation of NanK. Ion traces obtained from mass spectrometry-based validation experiments, showcasing the incubation of purified NanK in assay buffer containing only the substrates D-Mannose and ITP. b Reaction schemes of NanK. Depiction of known and novel reaction schemes of NanK. c Validation
▲ a Validation of NanK. Ion traces obtained from mass spectrometry-based validation experiments, showcasing the incubation of purified NanK in assay buffer containing only the substrates D-Mannose and ITP. b Reaction schemes of NanK. Depiction of known and novel reaction schemes of NanK. c Validation

接着,我们检测了嘌呤脱氧核苷磷酸化酶DeoA,该酶已知可催化多种反应,包括利用嘧啶脱氧核糖核苷作为碳源和能源。我们确认DeoA可以利用替代底物如尿苷(图5c)和结构相似的胞苷(补充图6)。这一发现扩展了DeoA的已知底物范围(图5d),拓宽了其可利用的潜在能源和碳源集合。

最后,我们检测了嘧啶特异性核糖核苷水解酶RihB,该酶已知催化尿苷和胞苷的水解。与之前的验证不同,这些实验基于低置信度离子轨迹的结果;具体而言,一个钾-胸苷加合物提示胸苷可能是潜在底物。在测试这一潜在新底物及其他与已知底物结构相似的化合物时,我们发现RihB还能以胸苷、鸟苷和脱氧尿苷为底物(补充图7)。这一发现不仅扩展了RihB的已知底物范围,还凸显了在我们报告的低置信度命中中发掘额外酶活性的潜力。

【数据】CobC:底物FMN→核黄素;NanK:底物D-甘露糖+ITP→D-甘露糖6-磷酸+IDP;DeoA:底物尿苷、胞苷;RihB:底物胸苷、鸟苷、脱氧尿苷;检测方法:质谱法;m/z窗口:50–1000

全大肠杆菌酶在代谢物提取物存在下的体外活性测定

为系统发现大肠杆菌中的酶混杂性,我们评估了所有已知代谢酶对广泛潜在底物的催化活性。我们使用ASKA文库35中的菌株,在大肠杆菌中过表达了全部1054个已知代谢酶。每个酶通过96孔格式的His标签亲和色谱纯化,最终获得667个生化可检测的蛋白(补充图1)。为提高底物覆盖率,我们按照先前描述的方法34,从两种不同的大肠杆菌培养物——一种在复杂培养基中生长,另一种在最小培养基中生长——制备了辅因子补充的浓缩代谢物提取物。这些提取物提供了丰富的天然候选底物来源。

随后,每个酶在这些提取物中孵育,我们使用非靶向流动注射飞行时间质谱监测每次酶促反应中9,554个可检测质荷比(m/z)特征——本质上是代谢物离子——的时间进程(图1a)。其中,411个离子被推定注释为791个独特代谢物,通过将测量的精确m/z值与KEGG大肠杆菌代谢物数据库中的单同位素质量匹配实现(补充数据1)36。这生成了一个相当于超过50万次单底物酶促反应测定的数据集,但存在固有局限性——无法区分具有相同化学式的异构体,也无法解释潜在的源内碎裂37。在修正了仪器漂移和批次效应等技术偏差后(补充图2),我们确定了9,554个可检测代谢物离子的相对丰度。为校正系统降解和杂质,我们对数据进行了归一化,改编了先前的方法34,迭代计算每个酶促反应中每个离子的双向Z分数(本文中简称Z分数)。该过程首先相对于该离子在所有其他酶促反应和时间点中的丰度进行,然后相对于同一酶促反应中所有其他离子的丰度进行,重复五次。

每个酶获得的离子谱以图1b为例,该图显示了CobC测定中所有检测到的代谢物离子的时间进程谱。CobC基于其与鼠伤寒沙门氏菌CobC38的高度序列同源性,被注释为多特异性α-核唑磷酸酶和腺苷钴胺素磷酸酶。值得注意的是,我们未观察到其当前注释反应的任何催化活性;部分原因是腺苷钴胺素磷酸酶反应的推定反应物超出了可检测的m/z范围。相反,我们的发现揭示了被注释为黄素单核苷酸(FMN)的代谢物离子减少,以及对应于核黄素的代谢物离子积累。基于这一观察,我们假设CobC可能混杂催化FMN磷酸酶反应(EC 3.1.3.102)(补充图3)。我们通过将纯化的CobC与纯FMN孵育确认了这一点,检测到对应于核黄素和磷酸的代谢物离子增加(图1c、d)。

【数据】过表达酶数:1054个;成功纯化酶数:667个;可检测m/z特征数:9,554个;推定注释离子数:411个(对应791个代谢物);培养基:复杂培养基+最小培养基;纯化方法:His标签亲和色谱(96孔格式);检测方法:非靶向流动注射飞行时间质谱;Z分数归一化:双向迭代5次

随机森林整合动态离子轨迹特征以发现新反应物

为系统鉴定推定的底物和产物离子,我们提取了捕捉每个酶促反应中代谢物离子动态行为的指标,并将其作为随机森林机器学习模型的输入。我们分析的特征包括整个时间进程中的平均Z分数,以及最后五个时间点的平均Z分数和几何平均秩积——大多数反应预期在该时段达到平衡。Z分数以标准差量化了响应幅度,而秩积则指示了跨测定的一致性39。利用数据的动态特性,我们还将双曲正切(S形)函数拟合到代谢物离子时间进程上。这使我们能够估计平衡时的Z分数(方程4中的参数A)及其陡度(方程4中的参数B)。这些曲线拟合的优度通过均方误差(MSE)评估。这一全面的多变量特征集随后用于训练随机森林分类器,旨在识别酶活性的底物和产物。

Depicted is a flowchart illustrating how 434,016 total measured ion time courses were assigned to different categories based on whether or not purified enzyme was added to the assay mixture (is empty?), whether the enzyme’s expression was detectable (is expressed?), whether the ion is a known reacta
▲ Depicted is a flowchart illustrating how 434,016 total measured ion time courses were assigned to different categories based on whether or not purified enzyme was added to the assay mixture (is empty?), whether the enzyme’s expression was detectable (is expressed?), whether the ion is a known reacta

为训练,我们将离子时间进程分配为类别作为机器学习输入(图2)。我们将阴性对照离子定义为未添加酶或添加酶的表达低于检测限的测定中的离子。由于后者仍有可能存在某些低活性,我们保守地将这些添加酶的已知反应物从阴性对照中排除,留下n_neg = 159,043个离子用于训练阶段。为编制阳性对照离子列表,我们将每次测定的检测离子与基于大肠杆菌iML1515代谢模型40的已知反应物集合进行比较。如果某个离子的至少一种可能注释匹配已知反应物,则该离子被分类为阳性对照离子——指示先前已知的反应(n_pos = 1,341)。需要注意的是,训练期间仅考虑基于代谢物去质子化形式([M-H]-)注释的离子。对应于代谢物加合物(例如¹²C→¹³C或H+→Na+)的离子轨迹被排除,因为它们通常比同一代谢物的去质子化形式丰度低得多,信息量也少。

接下来,我们在约160,000个标记的离子时间轨迹上训练了随机森林分类器(方法)。最终模型包含10,000棵树,每棵限制深度为5,每棵树随机采样12个特征中的20%。训练集上袋外预测的性能指标与测试集相当,表明过拟合程度很低(袋外准确率和测试集准确率分别为0.78和0.77)。

Individual features were extracted from ion traces, and the classifier was trained using ion traces annotated according to the deprotonated mass of metabolites. Training was done based on known reactants (Pos Ctrl) and negative control ions (Neg Ctrl) a SHAP values representing an estimated impact o
▲ Individual features were extracted from ion traces, and the classifier was trained using ion traces annotated according to the deprotonated mass of metabolites. Training was done based on known reactants (Pos Ctrl) and negative control ions (Neg Ctrl) a SHAP values representing an estimated impact o

【数据】阴性对照离子数:159,043个;阳性对照离子数:1,341个;随机森林参数:10,000棵树、深度5、每树采样12特征中20%;袋外准确率:0.78;测试集准确率:0.77

研究结果

随机森林分类器揭示广泛的新酶活性

利用训练好的分类器,我们对所有434,016个离子轨迹进行了预测。在以33%假发现率(FDR)为阈值时,我们鉴定出1,732个高置信度命中离子(图2)。将这些命中映射到推定的代谢物注释上,我们确定了135个推定注释的代谢物离子,这些离子对应76种酶——即11%的测试酶——表现出对非其注释反应底物的代谢物的活性。值得注意的是,被这些混杂酶作用的推定代谢物中富含核苷酸相关底物或辅因子(p = 3.2 × 10⁻⁵,超几何检验)。

为评估混杂活性的普遍程度,我们还检查了包含加合物和未注释离子在内的全部离子轨迹。当考虑所有离子(包括低置信度注释)时,在33% FDR阈值下,299种酶(接近测试酶的半数)导致离子轨迹的显著变化(图4a、b)。这一发现表明,酶混杂性在大肠杆菌代谢组中可能极为普遍,远超基于严格注释的估计。

a 影响已知底物与新型底物的酶。基于仅高置信离子痕量,通过机器学习分类器以33%的错误发现率分类的影响已知和新型底物的酶数量。b 离子痕量的意外变化。在仅考虑高置信离子(即去质子化离子([M-H]⁻))时,以及在考虑加合物(如¹²C → ¹³C或H⁺ → Na⁺)并包括未注释离子时,表现出意外离子痕量变化的酶百分比。
▲ a 影响已知底物与新型底物的酶。基于仅高置信离子痕量,通过机器学习分类器以33%的错误发现率分类的影响已知和新型底物的酶数量。b 离子痕量的意外变化。在仅考虑高置信离子(即去质子化离子([M-H]⁻))时,以及在考虑加合物(如¹²C → ¹³C或H⁺ → Na⁺)并包括未注释离子时,表现出意外离子痕量变化的酶百分比。

【数据】总离子轨迹数:434,016个;高置信度命中离子数:1,732个(33% FDR);推定注释代谢物离子数:135个;混杂酶数:76种(占测试酶11%);包含低置信度离子时混杂酶数:299种(接近半数);核苷酸富集p值:3.2 × 10⁻⁵(超几何检验)

混杂反应计量关系的重构

为深入理解新发现的混杂反应,我们尝试重构完整反应计量关系。通过同时追踪底物消耗和产物积累的离子轨迹,并结合已知代谢物注释,我们成功为11个混杂酶重构了22个完整反应计量关系。其中四个通过后续实验验证。这些反应涵盖了多种化学转化类型,包括磷酸化、脱磷酸化、核苷磷酸化裂解和水解反应。值得注意的是,某些酶显示出对多种底物的混杂活性,表明其底物范围比已知的更广泛。

【数据】重构反应计量关系数:22个(涉及11个酶);实验验证数:4个

DeoA和NanK的底物混杂性验证

我们选择了若干混杂酶进行实验验证。DeoA(嘌呤脱氧核苷磷酸化酶)已知催化嘌呤脱氧核苷的磷酸化裂解,但我们发现它也能作用于嘧啶类底物。质谱验证实验显示,纯化的DeoA在仅含底物和缓冲液的体系中能够利用尿苷(图5c)和胞苷(补充图6)作为底物,生成相应的碱基和核糖-1-磷酸。这扩展了DeoA的已知底物范围,使其能够利用更广泛的碳源和能源。

NanK(N-乙酰甘露糖胺激酶)的验证实验显示,该酶除已知的ATP依赖性N-乙酰-D-甘露糖胺磷酸化活性外,还能以ITP作为磷酸供体,将D-甘露糖磷酸化为D-甘露糖6-磷酸,同时产生IDP(图5a)。这一发现展示了NanK的辅因子混杂性(图5b)。此外,NanK还能以D-果糖为底物(补充图5),表明其糖底物混杂性。

【数据】DeoA验证底物:尿苷、胞苷;NanK验证底物:D-甘露糖+ITP→D-甘露糖6-磷酸+IDP;NanK额外底物:D-果糖

CobC的FMN脱磷酸化活性验证

CobC被注释为腺苷钴胺素/α-核唑磷酸酶,参与维生素B12生物合成。由于其经典底物超出FIA-MS检测范围(m/z 50–1000),我们转而验证了预测的FMN脱磷酸化活性。将纯化的CobC与纯FMN孵育后,我们检测到核黄素和磷酸的积累(图1c、d),证实CobC确实催化FMN的脱磷酸化反应(EC 3.1.3.102)。尽管该反应与已注释反应机制相似,但底物化学结构截然不同,提示CobC在维生素生物合成途径中扮演通用型磷酸酶的角色。

【数据】CobC底物:FMN→核黄素+磷酸;反应类型:脱磷酸化(EC 3.1.3.102);检测方法:质谱法

RihB的底物范围扩展

RihB(嘧啶特异性核糖核苷水解酶)已知催化尿苷和胞苷的水解。基于低置信度离子轨迹的提示——一个钾-胸苷加合物——我们测试了胸苷及其他结构相似化合物。实验结果表明,RihB还能以胸苷、鸟苷和脱氧尿苷为底物(补充图7)。这一发现扩展了RihB的已知底物范围,也证明了低置信度命中中可能蕴含新的酶活性。

【数据】RihB验证底物:胸苷、鸟苷、脱氧尿苷(另已知底物:尿苷、胞苷)

讨论与解读

代谢酶长期以来被视为高度专一的催化剂,但缺乏系统性的实验证据支持这一假设。通过成功纯化并测试大肠杆菌667个代谢酶对数百种候选底物的混杂催化活性,我们鉴定出76种酶作用于其先前注释反应之外的代谢物。当将分析扩展到包含低置信度注释的离子轨迹——如代谢物加合物和未注释离子(尽管预期假发现率更高)——我们发现接近半数(299种)测试酶导致离子轨迹的显著变化。此外,我们确定了其中22个未知混杂反应的完整计量关系,并成功实验验证了四个。

本方法的一个局限性在于,体外酶活性可能不能完全反映活细胞中的情况——潜在缺乏确保特异性的翻译后修饰,或需要与其他蛋白相互作用。此外,由于我们无法量化绝对反应速率,因此无法对已鉴定反应的速率做出判断。然而,与大多数其他发现酶混杂性的方法相比,本方法提供了直接、实验性且数据驱动的催化活性证据。通过采用非靶向代谢组学,我们能够以无偏方式同时监测数千个潜在底物,这是传统单底物筛选方法无法实现的。

编译者解读

本研究展示了非靶向代谢组学与机器学习相结合在酶功能发现中的强大威力。方法上,利用ASKA文库实现高通量蛋白纯化,配合FIA-MS实现数千离子的并行监测,将传统"一酶一底物"的筛选逻辑提升至组学尺度。随机森林分类器有效整合了动态离子轨迹特征,在33% FDR下平衡了灵敏度与假阳性。值得注意的是,11%的混杂酶比例可能仍是保守估计——当纳入低置信度离子时这一比例跃升至近半数,暗示代谢网络中隐藏的催化灵活性远超预期。从合成生物学应用角度看,这些新发现的混杂活性不仅为代谢模型注释提供了实验数据支撑,更为酶工程改造提供了天然起点——例如NanK的辅因子混杂性可用于拓展体外多酶级联中磷酸供体的选择范围,DeoA的嘧啶底物宽泛性则可能为核苷类似物药物合成提供新路线。未来若能将绝对反应速率纳入分析,将进一步提升该方法在定量代谢工程中的实用价值。

参考来源

Gruber CH, Sévin DC, Noor E, Zanotelli VRT, Schmitz J. Systematic discovery of enzyme promiscuity in Escherichia coli using in vitro metabolomics. Commun Biol. PMID: 42120943.

PMID: 42120943

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12