来源:Development of DeepPQK and DeepQK sequence-based deep learning models to predict protein-ligand affinity and application in the directed evolution of ferulic esterase DLfae4(International Journal of Biological Macromolecules)| 编译:DNA Lab Space | 原文许可:elsevier-subscription
导读
蛋白质-配体结合亲和力是决定酶催化活性的关键因素,传统预测方法高度依赖高分辨率晶体结构,而部分蛋白晶体难以培养、耗时且昂贵。本研究构建了两个基于序列的神经网络深度学习模型——DeepPQK和DeepQK,前者整合卷积神经网络与蛋白质序列、口袋氨基酸及配体信息,后者仅依赖蛋白质序列和配体SMILES。在2016核心数据集上,两模型Pearson相关系数分别达0.805和0.804。基于模型预测设计的DLFae4突变体I149G/W237H/M297C较野生型酶活性提升5.6倍,催化效率提升10.1倍。
研究背景
酶-底物结合亲和力是决定酶活性的关键因素,提高结合亲和力已被证实是改善酶活性的有效策略。目前常用的亲和力预测方法包括分子对接、分子动力学模拟和深度学习等,这些方法大多依赖准确的蛋白质晶体结构数据,数据预处理耗时较长。Pafnucy和TopologyNet是两种经典的结构基深度学习模型,前者利用CNN提取蛋白质-配体复合物的几何特征,后者应用拓扑神经网络捕获分子结构的拓扑信息。在此基础上,Li等人提出了结构感知交互图神经网络SIGN,包含极坐标图注意力层和成对交互池化层,通过迭代更新嵌入信息并考虑原子间距离和角度。然而,这些方法均受限于晶体结构的可获得性。本研究旨在开发仅依赖序列信息的深度学习模型,绕开晶体结构瓶颈,实现高效、准确的亲和力预测。
研究方法
数据集构建
PDBbind数据库收录了来自蛋白质数据银行的实验验证蛋白质-配体结合亲和力数据,以-logKi、-logKd或-logIC50表示,已被广泛应用于先前研究的模型训练集。为保证数据不重叠并便于模型比较,数据集按照先前报道的相同方法进行处理。最终数据集包含13,351个蛋白质-配体结合亲和力文件,提供了蛋白质PDB文件、口袋PDB文件和配体SDF文件。蛋白质序列和口袋氨基酸残基从PDB文件中收集,小分子SDF文件转换为SMILES字符串。2016核心集用作测试集,其余13,061个蛋白质-小分子复合物文件按10:1比例划分为训练集和验证集。为确保三个数据集之间无数据重叠,数据集按照Wang等人描述的方法进行处理。
【数据】数据集总量:13,351个蛋白质-配体复合物;训练/验证划分:10:1;测试集:2016核心集
输入表示
蛋白质序列和配体SMILES的输入表示已被证明可有效预测蛋白质-配体结合亲和力。本研究使用Open Babel将所有配体SDF文件转换为SMILES字符串,采用64个字符表示配体SMILES字符串,每个字符由特定整数编码。蛋白质序列通过ESM-2模型转换为(N, nseq, 1280)维特征矩阵,其中N代表批次大小,nseq为蛋白质序列长度,1280为嵌入维度。以蛋白质序列中口袋氨基酸残基的位置作为索引,对蛋白质编码进行切片,获得(N, npoc, 1280)维特征矩阵作为口袋氨基酸模块的输入,npoc为口袋氨基酸数量。蛋白质序列固定为1000个字符。配体SMILES字符串使用64个唯一字符表示,每个字符分配特定整数,覆盖所有可能的原子和化学键。长度超过150个字符的SMILES字符串将被截断,短于150个字符的则用"0"填充。为口袋序列定义了63个字符,以覆盖数据集中约90%的蛋白质、90%的配体和90%的口袋。超过指定字符长度的蛋白质序列将被截断,短于该长度的序列用
【数据】蛋白质序列长度:1000字符;SMILES最大长度:150字符;口袋序列字符数:63;ESM-2嵌入维度:1280;批次大小:N
模型架构
DeepPQK采用基于卷积神经网络的架构预测蛋白质-配体结合亲和力。通过设置不同的扩张率,扩张卷积可以捕获不同尺度的上下文信息,使模型同时包含局部特征和长程依赖。传统卷积操作在扩大感受野时可能需要降低分辨率,导致信息丢失;而扩张卷积通过在卷积核内插入空间来扩大感受野,从而保持分辨率并保留更多细节信息。同时,扩张卷积在不增加参数数量的情况下提高模型容量,有助于降低过拟合风险。采用两层感知机对蛋白质和口袋氨基酸序列进行嵌入和降维,实现初步去噪和特殊特征提取。
具体而言,DeepPQK包含三个独立模块:完整蛋白质模块、局部口袋模块和配体SMILES模块,分别处理(N, 1000, 256)、(N, 63, 256)和(N, 150, 128)维特征矩阵。为捕获蛋白质序列中的多尺度长程相互作用,使用并修改了扩张卷积A模块,该模块利用四个一维扩张卷积层,每层设置五种不同扩张率,并在每层引入残差连接,实现蛋白质序列级特征的深度提取。配体模块采用扩张卷积B模块,包含三个一维扩张卷积层,每层应用四种不同扩张率,实现配体特征的精确提取。另一方面,口袋模块采用传统CNN,包含三个不同感受野大小的滤波器(64、128、256)。通过调整感受野大小,扩张卷积可基于ESM-2识别口袋氨基酸之间的局部相互作用关系,同时不丢失序列信息,实现蛋白质口袋整体的特征提取与整合。三个模块的卷积和最大池化层最终特征被拼接在一起,输入分类部分。分类部分采用MLP,包含三个全连接层,每层后接丢弃率为0.5的dropout层,使用ReLU作为激活函数以降低过拟合概率。全连接层节点数分别为512、128和64,最终与输出层连接。为最小化目标值与预测值之间的差异,采用平均绝对误差作为损失函数。训练过程中使用128的批次大小和40个轮次。最终选择验证集上误差最低的模型。DeepQK移除口袋输入模块,其余参数设置与DeepPQK相同。
【数据】扩张卷积A模块:4层×5种扩张率;扩张卷积B模块:3层×4种扩张率;口袋模块滤波器:64、128、256;dropout率:0.5;FC层节点:512、128、64;批次大小:128;训练轮次:40
评估指标
为评估模型性能,使用平均绝对误差和均方根误差作为预测误差指标。RMSE值衡量预测值与实验值之间的拟合优度。MAE和RMSE越低,模型预测与真实值之间的差异越小。RMSE按以下公式计算:RMSE = √(Σ(yᵢ - ŷᵢ)²/n),其中n为预测实例数,yᵢ为真实值,ŷᵢ为预测值。标准差和Pearson相关系数用于分析预测值与实验值之间的离散程度和相关性。Pearson相关系数在0.7至1.0范围内通常被认为具有较强的正相关性,表明模型预测与实际结果之间存在强线性关系。SD按以下公式计算:SD = √(Σ(yᵢ - apᵢ + b)²/(N-1)),其中N为蛋白质-配体复合物数量,yᵢ和pᵢ分别为复合物的实际和预测亲和力,a和b为实际值与预测值之间函数的斜率和截距。一致性指数表示两个随机选择的蛋白质-配体复合物在特定顺序下预测值与真实亲和力值之间的概率。CI值范围为0至1,越接近1表示模型预测性能越好,预测结果与实验观察之间的一致性越高。CI在0.50-0.70范围内表明模型预测精度较低,高于0.70表明模型预测结果合理。CI遵循以下公式:CI = Σ(yᵢ>yⱼ)h(pᵢ-pⱼ)/Z,其中pᵢ为较大结合亲和力值yᵢ的预测值,pⱼ为较小结合亲和力值yⱼ的预测值。
【数据】评估指标:MAE、RMSE、SD、Pearson R、CI;R>0.7为强正相关;CI>0.70为合理预测
研究结果
氨基酸差异分析
为研究蛋白质-配体结合亲和力中氨基酸组成的差异,将数据集的13,061个复合物数据按亲和力强度分为不同组别,结合亲和力值分别归类为低(0-5)、中(5-7)或高(7-)亲和力,如图1A所示。分析了不同亲和力组中优先选择的氨基酸类型(图1B和C)。不同亲和力组的蛋白质序列之间没有显著的趋势变化。然而,不同亲和力组的蛋白质结合口袋中优先选择的氨基酸类型显示出显著的趋势变化。具体而言,天冬氨酸(N)、脯氨酸(P)、精氨酸(R)、丝氨酸(S)和色氨酸(W)的比例在口袋序列中呈现显著下降趋势,而疏水性氨基酸如亮氨酸(L)、异亮氨酸(I)和缬氨酸(V)的比例呈现上升趋势,表明口袋中的特定氨基酸对蛋白质-配体亲和力具有关键影响,并推测口袋内氨基酸的疏水性对蛋白质-配体亲和力有显著影响。为验证或否定该假设,将蛋白质结合口袋的疏水性定义为基于单个氨基酸疏水性指数的加权求和分数。如图2A所示,高亲和力蛋白质结合口袋的平均疏水性指数较低亲和力组累计显著增加23%,进一步证实蛋白质-配体亲和力的增强与口袋中的疏水性氨基酸密切相关。蛋白质-配体复合物主要通过疏水相互作用和氢键稳定。更多疏水性氨基酸被埋在蛋白质内部形成疏水核心,有助于增强疏水相互作用,提高蛋白质-配体亲和力。


【数据】高亲和力组口袋平均疏水性指数:较低亲和力组增加23%;低亲和力范围:0-5;中亲和力范围:5-7;高亲和力范围:>7
口袋变异性分析
为探索影响亲和力的关键因素,分别使用POVEM 3.0计算结合口袋的体积和溶剂可及表面积。如图2B所示,随着蛋白质-配体结合亲和力的增加,结合口袋体积从192 ų大幅增加至383 ų并达到相对稳定状态,表明口袋体积对蛋白质与配体的构象和/或化学相互作用具有重要影响。较大的蛋白质结合口袋体积有利于容纳小分子配体,允许更多氨基酸残基与配体相互作用,并通过构象变化为蛋白质提供更大的灵活性以适应小分子配体,从而增强蛋白质-配体复合物的稳定性。同时,较大的蛋白质结合口袋可以容纳更多具有疏水性侧链的氨基酸残基,有利于形成疏水相互作用并稳定蛋白质-配体复合物。然而,过度增加蛋白质结合口袋体积可能降低蛋白质-配体界面的紧密性。如图2C所示,随着蛋白质-配体结合亲和力的增强,结合口袋的溶剂可及表面积从143 Ų显著增加至306 Ų,呈现比口袋体积更平滑的上升趋势。较大的溶剂可及表面积代表更多氨基酸侧链暴露于溶剂中,允许在蛋白质和配体之间形成更多氢键,为配体提供更多相互作用残基,从而增强蛋白质-配体结合亲和力。
【数据】口袋体积范围:192-383 ų;溶剂可及表面积范围:143-306 Ų
模型构建
结合口袋在复合物形成过程中对蛋白质与配体之间的特异性相互作用至关重要。因此,DeepPQK整合了最多三个基于文本的输入信息模块,包括全局蛋白质模块、局部口袋模块和配体SMILES模块,如图3所示。按照上述方法,在2016核心数据集上将DeepPQK的准确性与近期最先进方法进行比较,结果如表1所示。DeepPQK的Pearson相关系数和一致性指数分别达到0.805和0.801,这是显著的准确性提升,表明DeepPQK能够准确提取和聚合局部与全局特殊上下文特征。将口袋氨基酸位点作为输入有助于更精确地对齐模型的学习重点,增强对蛋白质结合口袋的权重,推测DeepPQK可以有效捕获口袋中氨基酸突变对亲和力的影响。尽管DeepPQK具有很高的预测准确性,但DeepPQK需要结合口袋中氨基酸残基的信息,获取这些信息仍然有些繁琐,甚至困难。为克服这一限制,开发了仅依赖蛋白质序列和配体SMILES文件作为输入的DeepQK。从蛋白质序列中提取基于文本的全局上下文特征。在训练集、验证集和测试集上测量预测统计准确性,并与DeepPQK进行比较,如图4所示。尽管模型输入中缺少口袋中的氨基酸位点,但在2016核心数据集上Pearson相关系数和一致性指数分别达到0.804,推测DeepQK可以学习蛋白质与配体之间的相对空间位置关系。为验证这一猜想,从2016核心数据集中随机选择两个复合物文件分别作为DeepQK的输入数据文件。使用SCORE-CAM技术从DeepQK的最后一个卷积层提取每个氨基酸位点的权重。SCORE-CAM基于传递给目标层的正贡献分数获得每个激活图的权重,从而消除对梯度的依赖,最终结果是权重和激活图的线性组合。在预测过程中,SCORE-CAM嵌入模型中,通过在初始化时选择最后一个卷积层作为Score-CAM的目标层,Score-CAM将自动输出最后一层中每个氨基酸位点的权重分布。将获得的结果进行归一化。使用PyMOL软件可视化显示权重分布,如图5所示。结果表明,尽管没有口袋氨基酸信息作为输入,模型仍将超过70%的氨基酸位点赋予较高权重,且这些位点位于口袋附近,表明DeepQK在训练过程中成功捕获并理解了复合物中蛋白质和配体的相对空间位置。



【数据】DeepPQK:Pearson R=0.805,CI=0.801;DeepQK:Pearson R=0.804;高权重氨基酸位点:>70%位于口袋附近
模型预测变异性分析
为更深入分析DeepQK和DeepPQK之间预测的偏差,使用本实验室先前鉴定的阿魏酸酯酶DLFae4作为研究材料。该酶能够高效降解阿魏酸甲酯释放阿魏酸,在食品、造纸、生物医药、化妆品和生物乙醇生产等多个领域具有潜在应用价值。对所有氨基酸位点进行单点饱和突变,共获得7,740个有效序列。将这些序列输入两个模型,计算每个位点饱和突变引起的标准差。标准差越高,表明该位点的突变对预测结果的影响越大,模型对该特定位点赋予的权重越高。结果如图6A和B所示,两个模型均识别出某一突变(原文此处截断)。

【数据】饱和突变序列总数:7,740个有效序列
讨论与解读
本研究构建了DeepPQK和DeepQK两个模型用于预测蛋白质-配体结合亲和力。分析结果表明,蛋白质结合口袋中氨基酸残基的类型对亲和力有显著影响。高亲和力蛋白质-配体复合物倾向于在蛋白质结合口袋中具有较高比例的疏水性氨基酸,这与先前报道一致——口袋内强疏水性有助于增强酶与底物之间的疏水相互作用,提高结合亲和力。高亲和力复合物结合口袋中甘氨酸含量较低亲和力组高20%,由于甘氨酸具有最小的侧链,这导致口袋体积增大和柔韧性增强,形成更多酶与配体之间的氢键,从而提高蛋白质-配体复合物的稳定性。Liu等人通过比较醛酮还原酶AKR5C3的结构,设计了侧链尺寸减小的AKR5C3-R192G变体,增加了蛋白质结合口袋的尺寸和疏水性,提高了蛋白质-配体亲和力,以丁烷-2,3-二酮为底物时,变体AKR5C3-R192G的Km值较野生型降低76%,催化效率(Kcat/Km)提高7.55倍。蛋白质口袋内的体积和溶剂可及表面积大小(原文此处截断)。
编译者解读
本研究最大的亮点在于完全绕开晶体结构依赖,仅用序列信息就达到了与结构基方法相当的预测精度(R=0.805),这为难以结晶的酶蛋白提供了实用的理性设计工具。DeepQK通过注意力权重可视化证实模型自发学会了蛋白质-配体的空间位置关系,这一可解释性发现为后续优化提供了方向。DLFae4突变体I149G/W237H/M297C实现5.6倍酶活提升和10.1倍催化效率提升,验证了模型在实际酶工程中的指导价值。值得关注的是,模型对口袋疏水性氨基酸的识别与实验趋势高度一致,说明序列基模型确实捕获了有物理意义的特征。局限在于当前模型仍依赖PDBbind数据库的训练分布外推能力,对新型化学空间的泛化效果有待更多实验验证。
参考来源
Li S. Development of DeepPQK and DeepQK sequence-based deep learning models to predict protein-ligand affinity and application in the directed evolution of ferulic esterase DLfae4. International Journal of Biological Macromolecules, 2025. DOI: 10.1016/j.ijbiomac.2025.141790
DOI: 10.1016/j.ijbiomac.2025.141790