来源:abCRISPR: deep learning-based design of abasic gRNA sequences for specific CRISPR-Cas9 genome editing.(Bioinformatics)| 编译:DNA Lab Space
导读
CRISPR-Cas9虽已成为主流基因组编辑工具,但其脱靶切割问题始终是临床转化的关键障碍。近期发展的无碱基gRNA(ØXØ)可提升靶向特异性,但效果受序列位置背景影响。本研究提出abCRISPR——一种基于深度神经网络(DNN)的框架,通过配对训练无碱基与未修饰gRNA数据集,实现对脱靶活性的精准预测(r ≥ 0.95)。在人类基因组规模应用中,abCRISPR设计了覆盖58,875,004个CRISPR可靶向位点的ØXØ序列,显著提升靶向特异性。
研究背景
CRISPR-Cas9系统通过设计gRNA中与靶位点互补的20核苷酸间隔序列,可编程切割任意DNA序列。然而,gRNA与基因组序列的部分碱基配对可导致多达6个错配(≤6MM)的脱靶切割,这是该技术面临的核心安全问题。近期研究发现,化脓性链球菌在噬菌体感染期间,CRISPR RNA的自然无碱基氧化可降低脱靶活性。受此启发,研究者开发了无碱基修饰gRNA(ØXØ)——将gRNA第18、19位(相对PAM位置)替换为dSpacer(缺乏1′羟基的无碱基脱氧核苷酸),并延伸至第22位。作为一种仿生策略,ØXØ在增强靶向特异性方面优于其他gRNA修饰和Cas9变体等人工策略。然而,ØXØ的效果因位置序列背景而异,缺乏系统性设计方法。
研究方法
本研究开发了abCRISPR框架,用于理性设计具有最小脱靶活性的ØXØ序列。abCRISPR利用信息丰富的少样本学习策略,基于配对的无碱基与未修饰gRNA数据集进行训练。训练数据来源于高质量的随机错配靶标文库,该文库通过汇集20条不同的"掺杂"合成DNA生成(图1B),并在体外CRISPR-Cas9切割实验中对错配脱靶底物(n = 97,583)进行穷尽测序(图1C)。训练集量化了ØXØ gRNA与未修饰gRNA对脱靶序列的耗竭程度,以底物丰度(SA;相对于无gRNA对照的log2比值)作为衡量指标。

abCRISPR模型采用基于多层感知器(MLP)的多任务回归架构,包含三个隐藏层。模型输入特征考虑20-nt间隔序列的二核苷酸背景(2-nt;n = 4 × 4 × 20)、四个碱基(4-base;n = 4 × 20)以及匹配/错配布尔值(mismatch;n = 2 × 20)。模型训练使用gRNA与脱靶序列,编码时考虑20-nt间隔序列内的转换/颠换错配类型,并以SA值作为训练标签(70%用于训练,20%用于验证,10%用于测试;共进行10次迭代)。
【数据】训练集:n = 97,583;特征维度:2-nt(n = 4 × 4 × 20)、4-base(n = 4 × 20)、mismatch(n = 2 × 20);数据划分:70%训练/20%验证/10%测试;迭代次数:10
在模型评估方面,研究采用10折交叉验证,计算预测与实验SA值之间的Pearson相关系数。同时,研究使用Spearman相关系数评估预测排序一致性,并通过受试者工作特征(ROC)曲线分析比较不同模型的脱靶预测性能,脱靶定义采用SA阈值−2.17(由CRISPR-Cas9实验中切割比率为0.5时的线性回归推导)。此外,研究还进行了留一gRNA(LOO)评估以检验模型泛化能力——由于T2和EMX1分别代表最低和最高SA值分布,且两者重叠覆盖T3的SA值范围,因此使用T2和EMX1作为训练集、T3作为测试集。最终部署的abCRISPR模型通过顺序增量训练获得,并使用CIRCLE-seq实验获得的脱靶序列(≤6MM)进行独立评估,SA阈值通过10折交叉验证优化为−2.16(最大化F1分数)。
【数据】脱靶阈值:SA = −2.17;优化阈值:SA = −2.16;LOO评估:T2 + EMX1训练,T3测试
将最终部署的abCRISPR模型应用于人类基因组(hg19),研究首先使用CRISPOR程序筛选高效CRISPR可靶向位点(效率 > 55,特异性 > 50;n = 61,761,658),随后预测这些gRNA的推定脱靶序列(≤3MM;n = 747,063,488)的SA值,并比较ØXØ gRNA与未修饰gRNA的脱靶活性差异。统计分析采用配对单侧t检验(以每条gRNA为阈值,P < .05),并确认对多重检验校正的稳健性。
【数据】基因组:hg19;gRNA筛选阈值:效率 > 55,特异性 > 50;候选gRNA:n = 61,761,658;推定脱靶位点:n = 747,063,488(≤3MM);统计检验:配对单侧t检验,P < .05
研究结果
在10折交叉验证中,abCRISPR准确预测了无碱基(ØXØ)和未修饰gRNA脱靶位点的SA值,预测分布与观测分布紧密匹配(图1E),与实验数据高度相关(Pearson相关系数;r = 0.95–0.96)。由于abCRISPR同样预测未修饰gRNA的脱靶活性,研究者将其相关性值(Spearman相关系数;r = 0.95)与其他深度学习方法进行对比,这些方法表现出明显不同的预测模式(图1F)。结果显示,abCRISPR优于CRISPR-Net、DeepCRISPR、CRISPR-DIPOFF、CNN_std和CrisprDNT(Spearman相关系数分别为r = 0.34、0.17、−0.01、−0.02和−0.13)。
【数据】Pearson r = 0.95–0.96;Spearman r = 0.95(abCRISPR);对比方法r = 0.34、0.17、−0.01、−0.02、−0.13
在ROC曲线分析中(脱靶定义为SA阈值−2.17),abCRISPR的AUC值(0.98)显著超越其他预测方法(AUC = 0.45–0.68;图1G)。为提供无阈值比较,研究还评估了测试集中前k个实验验证脱靶位点(按SA值排序)的召回率,abCRISPR在所有k值下均表现出最高召回率(最高前90%;0.52–0.97对0.01–0.89),优于所有对比方法。
【数据】AUC:0.98(abCRISPR)对0.45–0.68(其他方法);召回率:0.52–0.97对0.01–0.89
在留一gRNA(LOO)评估中,abCRISPR展现优于其他方法的性能(AUC = 0.78对0.53–0.72),表明其学习模型即使在有限数量的gRNA序列训练条件下,只要提供穷尽错配序列,仍具备良好的泛化能力。
【数据】LOO评估AUC:0.78(abCRISPR)对0.53–0.72(其他方法)
独立于训练集,研究使用CIRCLE-seq实验获得的脱靶序列(≤6MM)评估最终部署的abCRISPR模型。在按读段数排序的预测脱靶累积比率分析中(图1H),abCRISPR在每个排序位置均稳健优于其他深度学习方法(开发者使用阈值:0.5),尽管这些方法部分使用了该测试集进行训练。abCRISPR持续保持高阳性预测值(abCRISPR、CNN_std、CRISPR-DIPOFF、DeepCRISPR、CRISPR-Net和CrisprDNT的平均比率:0.63、0.42、0.26、0.21、0.02和0.00;总比率:0.53、0.28、0.14、0.12、0.00和0.00)。使用与SITE-Seq重叠的高置信度CIRCLE-seq数据(图1I)时,abCRISPR表现一致(平均比率:0.60、0.27、0.22、0.19、0.02和0.02;总比率:0.49、0.13、0.12、0.14、0.01和0.01),表明其优越的准确性和敏感性。仅在高排名区间(3%–5%),CNN_std的阳性预测值与abCRISPR相当。
【数据】CIRCLE-seq评估平均比率:0.63(abCRISPR)对0.42、0.26、0.21、0.02、0.00;总比率:0.53对0.28、0.14、0.12、0.00、0.00;SITE-Seq重叠集平均比率:0.60对0.27、0.22、0.19、0.02、0.02
值得注意的是,尽管abCRISPR仅使用≤3MM序列训练,但对包含>3MM(4–6MM)脱靶的CIRCLE-seq数据集表现出泛化预测能力。当分别评估1–3MM和4–6MM的零样本推断时,abCRISPR展现优越性能,尤其在仅含零样本情况(4–6MM)下,跨不同排名阈值均表现突出。
【数据】训练错配范围:≤3MM;零样本推断范围:4–6MM
最后,研究将最终部署的abCRISPR模型应用于人类基因组中高效CRISPR可靶向位点集合(效率 > 55,特异性 > 50;61,761,658条gRNA;图1J),这些位点最初通过CRISPOR程序筛选。然而,这些gRNA序列中99.1%(n = 61,181,580)平均每条含有约12个基因组范围内的脱靶位点(≤3MM;n = 747,063,488)。abCRISPR预测,在96.2%的案例中,无碱基gRNA的脱靶位点SA值显著增加(n = 58,875,004;图1K),该结果基于与相应未修饰gRNA的脱靶活性比较(P < .05,配对单侧t检验,每条gRNA为阈值,并确认对多重检验校正的稳健性),表现为SA值差异增加(ΔSA,相对于未修饰gRNA;图1L)。其中,研究者实验验证了靶向VEGFA的两个无碱基gRNA(ØXØ)在4个脱靶位点的切割减少(体外CRISPR-Cas9切割实验)。需要指出的是,无碱基gRNA预测的验证具有支持性,但实验上(n = 2)和计算上(仅对未修饰gRNA评估)均有限。尽管这些结果可作为原理验证,但用户应注意,这些证据尚不足以支持泛化和大规模应用,尤其对于这些非常广泛的基因组规模声明。总体而言,abCRISPR提供了全面的 bona fide 无碱基gRNA(ØXØ)序列数据集,预测其可增强编辑人类基因组的靶向特异性(n = 58,875,004)。
【数据】人类基因组应用:61,761,658条gRNA;含脱靶gRNA比例:99.1%(n = 61,181,580);平均脱靶位点数:~12个/gRNA;SA显著增加比例:96.2%(n = 58,875,004);实验验证:2个ØXØ gRNA、4个脱靶位点
讨论与解读
abCRISPR通过配对训练无碱基与未修饰gRNA数据集,利用穷尽错配序列库(n = 97,583)提供稳健的ground-truth负样本,实现了高精度脱靶预测(r ≥ 0.95,AUC = 0.98)。与其他深度学习方法相比,abCRISPR在Spearman相关性(r = 0.95对−0.13至0.34)、AUC(0.98对0.45–0.68)和召回率等指标上全面领先。其核心优势在于:训练数据覆盖穷尽错配序列空间,避免了基因组范围内检测限导致的假阴性问题。此外,abCRISPR从≤3MM训练数据泛化至4–6MM脱靶预测的能力,展现了模型对序列特征的深层学习能力。人类基因组规模应用表明,96.2%的ØXØ设计可显著提升靶向特异性,为安全精准的CRISPR-Cas9编辑提供了系统化设计资源。
编译者解读:abCRISPR的独特价值在于将仿生修饰(无碱基gRNA)与深度学习预测相结合,从"修饰策略"跃升为"理性设计平台"。其少样本学习策略——用有限gRNA序列配合穷尽错配序列训练——为合成生物学中数据稀缺场景提供了方法论借鉴。但需注意,实验验证规模有限(n = 2 gRNA),且预测主要基于未修饰gRNA的评估框架,ØXØ的体内广谱适用性仍需更多验证。从应用角度看,该平台可直接嵌入现有gRNA设计流程,为基因治疗和细胞工程中的脱靶管控提供实用工具。
参考来源
Kim GD, Gu D, Park M, Chi SW. abCRISPR: deep learning-based design of abasic gRNA sequences for specific CRISPR-Cas9 genome editing. Bioinformatics. PMID: 42525385. DOI: 10.1093/bioinformatics/btaf159.
PMID: 42525385