机器学习辅助发现AdMysD

来源:Machine learning-assisted discovery of AdMysD for enhanced porphyra-334 biosynthesis(Bioorganic Chemistry)| 编译:DNA Lab Space | 原文许可:elsevier-subscription

📎 相关工具:论文撰写

导读

类菌孢素氨基酸(MAAs)是兼具紫外防护与抗氧化功能的天然产物,在防晒与护肤领域应用前景广阔。其中MysD酶负责将环己烯酮骨架转化为环己烯亚胺型结构,是合成shinorine和porphyra-334的关键限速步骤。然而,目前仅有8个MysD同源酶经异源表达验证,传统监督学习难以应用于该酶的挖掘。本研究整合序列相似性网络(SSN)、深度表示学习(UniRep)与正-未标记袋装(PU Bagging)策略,从约951个未注释同源序列中锁定42个候选酶,并成功发现来自Aphanothece hegewaldii的AdMysD——其催化效率较基准酶NlMysD提升3倍,且表现出显著的底物混杂性。

研究背景

类菌孢素氨基酸(MAAs)是一类水溶性次级代谢产物,广泛分布于蓝藻、微藻、真菌和大型藻类等水生生物中。凭借高摩尔消光系数和强光保护特性,MAAs赋予宿主在强太阳辐射和高盐等极端条件下的显著进化优势。随着防晒与护肤领域对珊瑚友好型、天然可持续成分的需求日益增长,MAAs已成为化妆品、皮肤健康及功能食品领域的重要候选分子。

MAA生物合成途径起始于磷酸戊糖途径中间体景天庚酮糖-7-磷酸(S7P)。S7P先后经DHQS样酶(MysA)和O-甲基转移酶(MysB)催化发生环化、脱水和甲基化,生成4-脱氧gadusol(4-DG)。随后,ATP-grasp连接酶(MysC)将4-DG与甘氨酸缩合形成mycosporine-glycine(MG)。最后一步多样化修饰由d-Ala-d-Ala连接酶样酶(MysD)或NRPS样酶(MysE)介导,向环己烯酮核心引入第二个氨基酸(如l-丝氨酸或l-苏氨酸),生成环己烯亚胺型MAAs,如shinorine或porphyra-334(P334)。虽然上游MysABC核心在物种间相对保守,但MysD的催化效率低下,成为亚胺型MAAs生物合成的限速瓶颈。

The biosynthetic gene clusters (A), biosynthetic pathway (B) and representative mycosporine-like amino acids (C). The two highlighted side chains correspond to the amino acid residues introduced into the 4-deoxygadusol skeleton by MysC (pale peach) and MysD (grayish cyan), respectively. EVS: 2-epi-5
▲ The biosynthetic gene clusters (A), biosynthetic pathway (B) and representative mycosporine-like amino acids (C). The two highlighted side chains correspond to the amino acid residues introduced into the 4-deoxygadusol skeleton by MysC (pale peach) and MysD (grayish cyan), respectively. EVS: 2-epi-5

研究方法

通用分析程序

高效液相色谱(HPLC)分析在Shimadzu Prominence LC-20A系统上进行,配备YMC-Pack ODS-A C18色谱柱(5 μm,4.6 × 250 mm),柱温维持30°C。流动相由含0.2%(v/v)甲酸的超纯水(A相)和甲醇(B相)组成。采用2% B等度洗脱,流速0.5 mL/min,运行30 min。紫外吸收光谱(200–400 nm)通过二极管阵列检测器(DAD)记录。MG在306 nm处定量,P334及其他亚胺类mycosporine在330 nm处定量。液相色谱-高分辨质谱(LC-HRMS)采用Agilent 1260–6230 LC-TOF MS系统,色谱条件与HPLC一致。质谱以正电喷雾电离(ESI+)模式采集,扫描范围m/z 100–1700。

【数据】色谱柱:YMC-Pack ODS-A C18(5 μm,4.6 × 250 mm);柱温:30°C;流动相:0.2%甲酸水/甲醇;洗脱:2% B等度,0.5 mL/min,30 min;检测波长:306 nm(MG)、330 nm(P334);质谱:ESI+,m/z 100–1700

序列相似性网络(SSN)构建

以NlMysD序列为查询序列,从UniProt数据库检索同源序列,共获得962条同源序列。手动添加8个已知MysD序列(包括NlMysD、EuMysD、LyMysD、NpMysD、AhMysD、AmMysD和MsMysD)。数据集提交至EFI-EST平台。经初步统计分析后,根据序列长度分布和比对分数优化参数。EFI-EST预处理并去除长度超过500个氨基酸的序列后,数据集包含951条未标记同源序列和8个已验证MysD蛋白。随后的SSN构建在排除不连通或过滤节点后,最终网络保留959条序列。最终SSN使用Cytoscape v3.10.3以比对分数阈值59生成,对应约34%的最小序列同一性。

【数据】查询序列:NlMysD;初始同源序列:962条;已知MysD:8个;过滤后:951条未标记+8个验证蛋白;最终网络:959条序列;比对分数阈值:59;最小序列同一性:约34%

机器学习框架

蛋白质序列通过预训练的UniRep蛋白语言模型编码为1900维全局特征向量。非线性降维和可视化使用R(v4.5.1)中的t-SNE和UMAP完成。t-SNE分析通过Rtsne包(v0.17)执行,不进行PCA预处理,困惑度设为30,固定随机种子(42)以确保可重复性。UMAP可视化使用umap包(v0.2.10.0)默认参数。

PU-Bagging分类器采用正-未标记(PU)袋装集成模型预测MysD功能。正集包含8个已验证的MysD同源酶。在袋装框架的每次迭代中,整个正集(Np)与通过自助采样随机选择的K = Np个未标记样本(作为临时负集)组合。基学习器为决策树,使用基尼不纯度作为分裂准则,并采用平衡类权重以应对数据集不平衡。构建了Ne = 2000棵树的集成模型。未标记序列的功能概率分数(PU-bagging分数)通过平均该序列作为袋外(OOB)样本时迭代中的正类预测计算得出。

选择7个代表性候选序列进行实验验证。候选选择并非简单按PU分数取排名最高的序列,而是分两步进行:首先将搜索范围限制在预测模型识别的高置信区域(PU分数 > 0.8);其次,在该子集内,综合考虑系统发育多样性和序列多样性选择代表性候选,以最大化覆盖预测的MysD功能空间。

【数据】特征向量维度:1900维(UniRep);t-SNE困惑度:30;随机种子:42;PU-Bagging树数量:2000;正集:8个已验证MysD;高置信阈值:PU分数 > 0.8;候选数:7个

结构建模、分子对接与序列分析

AdMysD和NlMysD的三维结构通过在线ESMFold服务器预测。预测结构在PyMOL v3.1.6.1中可视化和结构叠加,比较整体折叠和底物结合区域。分子对接使用AutoDock Vina完成。蛋白和底物(ATP、l-Thr和MG)的结构用AutoDockTools v1.5.7制备,受体文件转换为pdbqt格式。对接按顺序进行——先对接ATP,再对接l-Thr和MG。候选对接姿态根据结合能及三种底物的相对方向评估,选择催化几何结构最合理的模型进行后续分析。通过PyMOL目视检查识别对接分子周围的残基,距配体约4 Å以内的残基视为构成结合口袋。序列比对使用Clustal Omega完成,比对结果用Jalview v2.11.3.3可视化。

【数据】结构预测:ESMFold;对接软件:AutoDock Vina;结合口袋定义:距配体约4 Å内残基;序列比对:Clustal Omega + Jalview v2.11.3.3

基因克隆、蛋白表达与纯化

编码4个已知MysD酶和7个PU-Bagging管线候选酶的基因经密码子优化适配大肠杆菌宿主,合成后亚克隆至pET28a(+)的NdeI/HindIII位点,构建N端6×His标签表达载体。质粒转化至E. coli BL21(DE3)进行蛋白生产。菌株在含50 μg/mL卡那霉素的LB培养基中、37°C、200 rpm条件下培养。OD600达到0.4–0.6时,用0.1 mM IPTG诱导表达,随后在16°C孵育16 h。细胞通过离心(4000 rpm,30 min)收集,重悬于裂解缓冲液(25 mM Tris-HCl,pH 8.0,250 mM NaCl,1 mM TCEP,10 mM咪唑)。超声破碎(2 s开/5 s关,共10 min)后离心(12,000 rpm,30 min),上清用于无细胞活性测定或蛋白纯化。

蛋白纯化在ÄKTA start FPLC系统上进行,使用5 mL HisTrap FF柱。非特异性蛋白用4%缓冲液B去除(A:25 mM Tris-HCl pH 8.0,250 mM NaCl,1 mM TCEP;B:含500 mM咪唑的缓冲液A)。His标签MysD蛋白用阶梯梯度(10%–100%缓冲液B)洗脱。含纯MysD的组分(SDS-PAGE确认)浓缩并缓冲液交换至储存缓冲液(50 mM Tris-HCl,pH 8.0,10%甘油)。蛋白浓度用NanoDrop 2000在280 nm处根据理论消光系数测定。

【数据】表达宿主:E. coli BL21(DE3);培养基:LB + 50 μg/mL卡那霉素;诱导:0.1 mM IPTG,OD600 0.4–0.6;表达条件:16°C,16 h;裂解缓冲液:25 mM Tris-HCl pH 8.0,250 mM NaCl,1 mM TCEP,10 mM咪唑;超声:2s开/5s关,10 min;纯化:HisTrap FF,阶梯梯度10%–100%缓冲液B;储存缓冲液:50 mM Tris-HCl pH 8.0,10%甘油

MG底物的纯化与定量

MG底物从表达mysABC簇的工程化Streptomyces lividans TK24菌株发酵液中分离。发酵在500 mL锥形瓶中进行,28°C、200 rpm条件下培养6天。胞内MG用50%(v/v)甲醇提取后超声处理。粗提物经旋转蒸发浓缩,HPLC纯化。纯化的MG(13.6 mg)冻干后经HR-MS确认。MG定量标准曲线使用一系列浓度(0.010至2.72 g/L)制备。每个点的306 nm峰面积记录三次,用线性回归建立酶学测定的定量关系。

【数据】发酵菌株:S. lividans TK24(表达mysABC簇);发酵条件:28°C,200 rpm,6天;提取:50%甲醇+超声;纯化MG产量:13.6 mg;标准曲线浓度范围:0.010–2.72 g/L;检测波长:306 nm

酶学表征与动力学测定

标准酶促反应(500 μL)含100 mM Tris-HCl(pH 8.0)、500 μM MG、2 mM l-Thr、2 mM ATP、2 mM MgCl2和0.5 μM纯化MysD。反应通过添加酶启动,25°C孵育5 min,95°C加热10 min终止。对照使用煮沸失活的酶。最适pH分别用磷酸盐-柠檬酸缓冲液(pH 6.0–7.0)、Tris-HCl(pH 7.0–9.0)和硼酸盐-NaOH缓冲液(pH 9.0–10.0)测定。

【数据】反应体系:500 μL;缓冲液:100 mM Tris-HCl pH 8.0;底物:500 μM MG,2 mM l-Thr,2 mM ATP;金属离子:2 mM MgCl2;酶量:0.5 μM;反应条件:25°C,5 min;终止:95°C,10 min;pH范围:磷酸盐-柠檬酸pH 6.0–7.0,Tris-HCl pH 7.0–9.0,硼酸盐-NaOH pH 9.0–10.0

验证四种已知MysD同源物在大肠杆菌中异源表达,其中NlMysD以P334为产物(A)。NlMysD催化MG、ATP和L-Thr生成P334的米氏方程图(B)。
▲ 验证四种已知MysD同源物在大肠杆菌中异源表达,其中NlMysD以P334为产物(A)。NlMysD催化MG、ATP和L-Thr生成P334的米氏方程图(B)。

研究结果

MysD同源酶的异源表达与功能验证

为评估MysD家族的体外催化潜力,研究对多个MysD候选酶在大肠杆菌中进行了异源表达分析。4个密码子优化的mysD基因分别来源于放线菌Mycolicibacterium sediminis(MsMysD)和三种蓝藻(Lyngbya sp. [LyMysD]、Nostoc lividum [NlMysD]和Euhalothece sp. [EuMysD])。MsMysD主要以包涵体形式存在,而其他三种重组蛋白表现出明显的可溶组分。

体外生物转化实验使用添加MG作为底物、ATP和20种氨基酸混合物的细胞裂解液进行。HPLC分析显示,仅NlMysD成功催化MG转化为亚胺类MAA——P334。相比之下,含有其他MysD同源酶或空载体对照的反应中未检测到亚胺类mycosporine产物。此外,煮沸灭活的NlMysD裂解液完全丧失催化能力,确认观察到的转化依赖于NlMysD的酶活性。因此,NlMysD被确立为后续生化表征和生物信息学挖掘的可靠参考与探针。

【数据】异源表达宿主:E. coli;表达蛋白:MsMysD、LyMysD、NlMysD、EuMysD;可溶表达:除MsMysD外均明显可溶;功能验证:仅NlMysD催化MG→P334

基准酶NlMysD的稳态动力学

在确认酶活性后,研究系统表征了NlMysD的酶学性质,为该酶类提供了首个定量动力学数据集。使用纯化酶在不同MG浓度梯度下测定P334的生成速率,数据通过非线性回归拟合米氏方程。NlMysD的Vmax为0.048 ± 0.004 μM·min⁻¹(p < 0.0001),Km为123.46 ± 40.08 μM(p < 0.05)。计算的转换数(kcat)和催化效率(kcat/Km)分别为0.0032 ± 0.0003 s⁻¹和(2.61 ± 0.88)× 10⁻⁵ s⁻¹·μM⁻¹(R² = 0.944)。

这些动力学参数揭示了极低的转换率和较弱的底物亲和力,催化效率显著低于典型初级代谢酶。尽管NlMysD此前被描述为P334生产中最有效的MysD,这些结果定量解释了现有MAA生产微生物细胞工厂中MG持续积累的现象。该数据为发现更优MysD变体建立了明确基线。

【数据】NlMysD动力学:Vmax = 0.048 ± 0.004 μM·min⁻¹(p < 0.0001);Km = 123.46 ± 40.08 μM(p < 0.05);kcat = 0.0032 ± 0.0003 s⁻¹;kcat/Km =(2.61 ± 0.88)× 10⁻⁵ s⁻¹·μM⁻¹;R² = 0.944

基于SSN和UniRep–PU Bagging的高通量挖掘

为实现更高效催化酶的发现,研究实施了机器学习辅助筛选流程。以NlMysD为搜索查询,从UniProt数据库检索到约1000条同源序列。使用959条序列(含8个已验证同源酶)构建SSN。设定比对分数59和长度过滤<500残基,建立了约34%的序列同一性截断值。在该网络中,8个已知MysD同源酶聚集在Cluster 2中,该簇包含127条独特序列。

随后使用蛋白语言模型UniRep将所有SSN序列编码为1900维特征向量。t-SNE和UMAP可视化显示,Cluster 2在潜在特征空间中形成独立区域,与负类簇(Cluster 1、3、4、5和6)清晰分离。这表明预训练的UniRep模型有效捕获了与MysD功能相关的序列特征。

随后,使用8个已验证MysD序列作为正样本训练正-未标记(PU)袋装模型。模型为SSN中所有序列分配功能概率分数。Cluster 2中的119条未表征序列得分显著高于其他簇,形成高概率富集区。从42个高置信候选(分数 > 0.8)中,选择7个MysD同源酶(AdMysD、CsMysD、AnMysD、NcMysD、RrMysD、PrMysD和NsMysD)进行后续实验验证,这些候选在高分区域分散分布且具有代表性系统发育位置。

Machine learning-assisted functional mining and screening of the MysD family. (A) Integrated data-driven workflow for the discovery of novel MysD homologues. (B) Sequence Similarity Network (SSN) of MysD homologues generated via EFI-EST, with known MysD sequences (yellow diamonds) cluster within Clu
▲ Machine learning-assisted functional mining and screening of the MysD family. (A) Integrated data-driven workflow for the discovery of novel MysD homologues. (B) Sequence Similarity Network (SSN) of MysD homologues generated via EFI-EST, with known MysD sequences (yellow diamonds) cluster within Clu

【数据】SSN序列数:959条;比对分数阈值:59;序列同一性截断:约34%;Cluster 2序列数:127条;UniRep特征维度:1900维;高置信候选:42个(分数 > 0.8);实验验证候选:7个

AdMysD的酶学表征

选定的候选酶在大肠杆菌中异源表达,使用含MG、ATP和混合氨基酸的细胞裂解液进行初步生物转化实验。HPLC分析显示,仅AdMysD显著消耗MG并生成独特的产物峰。HR-TOF MS确认产物为P334,将AdMysD鉴定为先前未表征的、能够利用MG和l-Thr合成P334的MysD同源酶。

成功纯化AdMysD后,在不同理化条件下评估其酶学特性。结果表明AdMysD偏好微碱性条件,最适pH为8.5。其在Tris-HCl和硼酸盐缓冲液中的活性显著高于磷酸盐-柠檬酸体系。温度滴定显示最适活性在30°C,45°C以上活性迅速下降,60–70°C时残余活性低于20%。金属依赖性实验表明AdMysD不依赖金属离子——在螯合剂EDTA存在下活性保持稳定。值得注意的是,Mn²⁺和Cu²⁺分别将相对活性提升至120%和150%以上,而Ca²⁺、Ni²⁺、Fe²⁺、Co²⁺、Na⁺和K⁺对酶有抑制作用。

AdMysD的生化表征与
▲ AdMysD的生化表征与

【数据】AdMysD最适pH:8.5;最适温度:30°C;60–70°C残余活性:<20%;Mn²⁺相对活性:>120%;Cu²⁺相对活性:>150%;EDTA存在下活性稳定

AdMysD与NlMysD的动力学、结构与序列比较分析

AdMysD对MG的表观稳态动力学参数通过米氏拟合确定(R² = 0.996)。AdMysD的Vmax为0.307 ± 0.012 μM·min⁻¹(p < 0.0001),Km为262.20 ± 26.39 μM(p < 0.001),kcat为0.0205 ± 0.0008 s⁻¹,kcat/Km为(7.81 ± 0.84)× 10⁻⁵ s⁻¹·μM⁻¹。

与基准酶NlMysD相比,AdMysD的转换率(kcat)提高了6倍。尽管Km增加了约2倍(表明对MG的表观亲和力略低),但AdMysD的整体催化效率(kcat/Km)比NlMysD高3倍以上。这些发现将AdMysD定位为加速MG向P334转化的优良生物合成基因元件。

结构叠加显示AdMysD和NlMysD具有高度相似的整体架构,299个对齐Cα原子的RMSD为0.774 Å,表明两种酶具有保守的整体折叠。分子对接进一步揭示,参与ATP和l-Thr结合的残基在两种酶之间保守,而若干氨基酸替换位于预测的MG结合口袋中。其中,NlMysD中的Thr121和Ala122在AdMysD中被Ala121和Leu122替换。结构建模预测NlMysD中的Thr121与MG形成氢键,而AdMysD中对应的Ala121缺乏该相互作用。这些观察表明两种酶的主要结构差异位于MG结合口袋。

【数据】AdMysD动力学:Vmax = 0.307 ± 0.012 μM·min⁻¹(p < 0.0001);Km = 262.20 ± 26.39 μM(p < 0.001);kcat = 0.0205 ± 0.0008 s⁻¹;kcat/Km =(7.81 ± 0.84)× 10⁻⁵ s⁻¹·μM⁻¹;R² = 0.996;kcat提升:6倍;催化效率提升:>3倍;RMSD:0.774 Å(299个Cα原子)

AdMysD的底物混杂性

在混合氨基酸存在下,AdMysD表现出对l-苏氨酸的强烈偏好。为研究其更广泛的底物范围,研究使用纯化的AdMysD对所有20种标准氨基酸进行了体外实验。HPLC分析表明,AdMysD能够利用l-Thr、l-Ser、l-Ala和l-Cys生成相应的亚胺类mycosporine衍生物,显示出显著的底物混杂性。

Receiver operating characteristic (ROC) analysis of PU Bagging and baseline methods in Leave-one-positive-out (LOPO) cross-validation. LOPO cross-validation was conducted using eight experimentally validated MysD enzymes. PU Bagging was evaluated against random screening, BLAST/sequence identity ran
▲ Receiver operating characteristic (ROC) analysis of PU Bagging and baseline methods in Leave-one-positive-out (LOPO) cross-validation. LOPO cross-validation was conducted using eight experimentally validated MysD enzymes. PU Bagging was evaluated against random screening, BLAST/sequence identity ran

【数据】AdMysD偏好底物:l-Thr;额外接受底物:l-Ser、l-Ala、l-Cys;底物范围:20种标准氨基酸

Machine learning-assisted discovery of AdMysD for enhanced p
▲ 论文配图

讨论与解读

AdMysD催化效率提升的序列与结构基础

比较结构分析表明,AdMysD催化效率的提升不太可能源于大规模结构重排——两种酶的整体折叠高度保守。序列变异主要集中在预测的MG结合口袋内,而参与ATP和l-苏氨酸识别的残基基本保守。这种不对称保守模式提示,MysD家族的进化多样化可能主要针对底物识别,同时保留催化框架。Thr121替换为Ala消除了酶与MG之间的预测氢键,而Ala122替换为Leu可能改变结合口袋的局部疏水环境。这些变化与AdMysD的动力学特性一致——Km适度增加但kcat显著高于NlMysD。推测MG结合口袋的微妙重塑可能在降低底物亲和力的同时促进催化转换,最终实现催化效率的提升。

宿主底盘兼容性与MysD可溶性

研究观察到多个MysD同源酶在异源表达时形成包涵体,这凸显了宿主底盘兼容性在酶功能验证中的关键作用。MsMysD主要以包涵体形式存在,而三种蓝藻来源的MysD表现出可溶表达,提示来源物种与表达宿主之间的系统发育距离可能影响蛋白折叠效率。

编译者解读

本研究展示了PU学习策略在稀疏注释酶家族挖掘中的独特价值——当正样本仅有8个时,传统监督学习几乎失效,而PU Bagging通过"正样本+未标记样本"的框架有效压缩了搜索空间。AdMysD的发现不仅提供了一个催化效率提升3倍的实用生物催化剂,更值得注意的是其底物混杂性——这为合成生物学中"一酶多产"策略提供了新可能。不过,AdMysD的Km较NlMysD升高约2倍,意味着在低底物浓度场景下其优势可能受限。未来若能将MG结合口袋的Thr121/Ala122位点进行理性突变,或可进一步优化亲和力与转换率的平衡。

参考来源

Yuan L. Machine learning-assisted discovery of AdMysD for enhanced porphyra-334 biosynthesis. Bioorganic Chemistry, 2026. DOI: 10.1016/j.bioorg.2026.110312

DOI: 10.1016/j.bioorg.2026.110312

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 基于染色质可及性的酿酒酵母基因表达水平多机器学习模型预测 09-12