深度学习引导crRNA设计

来源:Deep learning-guided crRNA design enables an AND logic-gated autocatalytic CRISPR network for dual-miRNA detection(Sensors and Actuators B: Chemical)| 编译:DNA Lab Space | 原文许可:elsevier-subscription

📎 相关工具:论文撰写

导读

CRISPR/Cas12a用于miRNA检测长期受制于crRNA经验性筛选、单靶标识别和反式切割灵敏度不足三大瓶颈。本研究构建了一个"干湿结合"诊断平台:以深度学习模型DiagCRISPR预测crRNA活性,通过虚拟PAM平均算法将dsDNA训练的模型拓展至无PAM短ssDNA底物评分;下游以PER引物交换反应构建AND逻辑门,将miR-21与miR-155的共存在转化为单一触发链,启动split-crRNA介导的自催化CRISPR扩增网络。全程检测时间不足2小时,miR-21与miR-155的检测限分别达785 fM和778 fM。

研究背景

MicroRNA是一类长度为19–25个核苷酸的内源性非编码RNA,通过结合互补信使RNA在转录后水平调控基因表达。miRNA表达谱异常与肿瘤发生、进展、临床分期及治疗预后密切相关,且在不同恶性肿瘤中呈现各异的表达模式。同一癌种内常出现多个miRNA的协同异常表达,不同癌症间也存在某些miRNA的普遍上调。因此,仅凭单一miRNA的生物学信息往往不足以捕获早期疾病的复杂性,导致筛查中出现较高的假阳性或假阴性率。开发能够协同分析多个miRNA的生物传感策略,对提升无创液体活检的全面性、准确性和临床可靠性至关重要。

CRISPR/Cas12a系统凭借高序列特异性和等温条件下靶标激活的反式切割活性而受到广泛关注。在crRNA引导下对互补DNA靶标进行可编程识别后,Cas12a发生构象转变,触发持续的非特异性ssDNA报告探针降解。然而,基于Cas12a的miRNA检测通常受限于经验性crRNA序列筛选、单靶标识别以及反式切割固有灵敏度不足等问题。

研究方法

2.1 数据集构建与标准化

训练数据集来源于公开可用的Cas12a crRNA体外荧光检测数据集,该数据集完全由无细胞反式切割实验生成。每条表格记录包含一个引导序列(PAM与crRNA间隔序列的反向互补序列)和一条靶标编码链,以及20分钟和30分钟时的荧光读数。为确保标签可靠性,两个时间点之间绝对荧光差异≥0.5的配对数据被排除,以滤除由操作或仪器误差引起的异常测量值。为扩展有效数据集,采用数据增强策略将每条保留记录拆分为两个独立样本,分别对应20分钟和30分钟标签。增强后的数据集(18,110个样本)按7:1.5:1.5的比例划分为训练集(12,666)、验证集(2,670)和测试集(2,774)。划分严格在唯一引导-靶标对水平上进行,并采用分层随机抽样,以防止数据泄漏并保持错配分布一致。原始荧光强度仅基于训练集参数进行Z-score标准化:z = (y_raw − μ) / σ,其中μ和σ分别表示训练集荧光值的均值和标准差。该变换使标签分布居中,产生用于模型训练的相对活性回归目标。

【数据】数据集来源:公开Cas12a crRNA体外荧光检测数据集;原始记录过滤标准:两时间点绝对荧光差异≥0.5排除;数据增强后总样本数:18,110;训练集:12,666;验证集:2,670;测试集:2,774;划分比例:7:1.5:1.5;标准化方法:Z-score(仅基于训练集参数);时间点:20 min、30 min

2.2 深度学习模型构建

构建了基于局部连接网络的模型,命名为DiagCRISPR(diagnostic CRISPR prediction model),用于预测crRNA活性。模型接收第2.3节所述的(10×25)输入张量,输出一个标量,代表给定crRNA-靶标对的预测标准化反式切割活性评分。

位置级特征融合:一维卷积(卷积核大小=1,10个输入通道,229个输出通道,ReLU激活)在每个核苷酸位置独立投影组合的靶标-间隔序列特征,输出(229×25)张量。

并行最大与平均池化:特征图由最大池化和平均池化并行处理(窗口大小=3,步长=1),将空间长度缩减至23。沿空间维度拼接得到(229×46)张量。

双分支局部连接层:与标准全局共享权重不同,局部连接层为每个空间位置分配独立参数:O_i = σ(x_i · w_i + b_i),其中x_i为该位置的输入特征向量,w_i和b_i为位置特异性权重矩阵和偏置,σ为激活函数。分支1采用卷积核大小1(输出:3×46,ReLU),分支2采用卷积核大小2(输出:3×45,ReLU)。两个输出拼接形成3×91的组合特征图。

回归头:特征图展平为273维向量,通过两层多层感知机(273→62→45)处理,采用ReLU激活和dropout(速率=0.45)。最终线性投影输出单一标量活性评分。

【数据】输入张量维度:10×25;1D卷积参数:核大小=1,输入通道=10,输出通道=229,ReLU激活;池化参数:窗口=3,步长=1,空间长度缩减至23;拼接后张量:229×46;分支1:核大小=1,输出3×46,ReLU;分支2:核大小=2,输出3×45,ReLU;组合特征图:3×91;MLP结构:273→62→45;dropout率:0.45;输出:单标量活性评分

2.3 基于PER的AND门控aCRISPR检测miR-21和miR-155

#### 2.3.1 PER基AND门的构建

AND门采用引物交换反应策略构建。探针H1和H2的制备:将每条发夹与对应的锁链寡核苷酸在退火缓冲液(10 mM Tris-HCl,pH 8.0,10 mM MgCl₂)中混合,加热至95°C保持5分钟,然后缓慢冷却至室温(每8秒降0.1°C)。PER反应(20 µL)包含250 nM H1、250 nM H2、250 nM Cleaner、2 µM Primer、4 U Bst 3.0 DNA聚合酶、1×等温扩增缓冲液II Pack和10 mM MgSO₄。除Primer外的所有组分先在37°C预孵育15分钟。加入Primer后,混合物在37°C孵育1小时,然后在80°C终止20分钟。

【数据】退火缓冲液:10 mM Tris-HCl,pH 8.0,10 mM MgCl₂;退火程序:95°C 5 min,以0.1°C/8s冷却至室温;PER反应体积:20 µL;H1:250 nM;H2:250 nM;Cleaner:250 nM;Primer:2 µM;Bst 3.0 DNA聚合酶:4 U;缓冲液:1×Isothermal Amplification Buffer II Pack;MgSO₄:10 mM;预孵育:37°C 15 min(除Primer外);反应:37°C 1 h;终止:80°C 20 min

#### 2.3.2 常规CRISPR与aCRISPR反应

自催化CRISPR扩增反应(20 µL)包含100 nM LbCas12a、60 nM全长crRNA、60 nM split-handle、60 nM split-spacer、100 nM split-target、1 µM FAM/BHQ1标记ssDNA报告探针(F-Q reporter)和1×rCutSmart缓冲液。在加入split-target链之前,Cas12a与crRNA组分先在37°C预孵育15分钟,以允许RNP组装并最小化竞争性结合的不确定性。加入split-target后,反应在37°C进行45分钟。作为对照,常规单周转CRISPR反应使用100 nM LbCas12a、60 nM全长crRNA、1 µM F-Q报告探针和1×rCutSmart缓冲液,在相同孵育条件下组装。孵育后,向每个混合物中加入80 µL DEPC处理水。荧光强度使用Cytation 3微孔板读数仪(BioTek,美国)定量,激发波长485 nm,发射波长525 nm。

【数据】aCRISPR反应体积:20 µL;LbCas12a:100 nM;全长crRNA:60 nM;split-handle:60 nM;split-spacer:60 nM;split-target:100 nM;F-Q报告探针:1 µM;缓冲液:1×rCutSmart;预孵育:37°C 15 min;反应:37°C 45 min;稀释:80 µL DEPC水;荧光检测:激发485 nm,发射525 nm;常规CRISPR对照:LbCas12a 100 nM,全长crRNA 60 nM,F-Q 1 µM,1×rCutSmart

研究结果

3.1 DiagCRISPR平台的性能评估与功能验证

深度学习引导的CRISPR Cas12a crRNA设计历来以基因组编辑或标准病原体传感为中心,算法通常针对携带刚性经典PAM约束的长dsDNA靶标进行定制。然而,新兴的可编程体外分子诊断电路——包括PER驱动的级联反应——频繁依赖短ssDNA寡核苷酸作为中间触发链来激活下游Cas12a反式切割复合物。由于这些触发链缺乏天然双链PAM上下文,传统的基于比对或回归的筛选工具往往无法准确处理它们,甚至将其完全过滤掉。为解决这一计算瓶颈并保持广泛的诊断实用性,我们开发了DiagCRISPR作为一个综合智能框架,旨在充当多样化CRISPR无细胞生物传感场景的通用工具包。

DiagCRISPR的架构采用双序列10通道one-hot编码方案建立,训练于源自高通量Cas12a反式切割荧光实验的大规模无细胞动力学数据集(图1A)。采用局部连接神经网络架构而非传统CNN或Transformer,是基于Cas12a已被充分确立的位置依赖性酶学机制。标准CNN依赖全局权重共享,引入了平移不变性假设,即不同位置上相同的序列基序被视为具有可比的功能效应。然而,结构和动力学研究已证明Cas12a通过识别PAM近端短种子区域启动R-loop形成,随后将靶标配对向PAM远端传播,导致沿crRNA间隔序列产生位置梯度的敏感性景观。这种生物学不对称性与标准CNN的平移不变性假设并不完全兼容。局部连接层通过为不同序列位置分配独立权重参数来解决这一局限,使模型能够直接从训练数据中学习位置特异性特征变换。关于Transformer,尽管自注意力机制为建模全局序列关系提供了强大能力,但它们通常受益于大规模数据集或预训练策略。对于本研究中使用的25-nt短输入和约18,000样本的训练集,从头训练的Transformer模型可能更容易过拟合,同时在位置特异性特征提取方面提供的额外收益有限。

为使平台具备通用性,DiagCRISPR引入了专门设计用于评分非经典靶标的虚拟PAM平均算法。在该模式的后端推理过程中,平台系统地将四种经典Cas12a PAM变体(TTTA、TTTC、TTTG和TTTT)分别附加到用户提供的无PAM ssDNA序列的5'端,生成四个25核苷酸输入。最终预测的反式切割活性评分取四个独立模型输出的算术平均值。这一策略得到生化观察的进一步支持:ssDNA介导的Cas12a激活独立于经典PAM识别。由于模型在含PAM的dsDNA输入上训练,输入张量的前四个位置包含PAM相关序列信息,可能将PAM相关偏差引入预测。对四种经典PAM变体生成的预测取平均,可降低这些PAM相关特征的影响,使最终预测更贴近决定ssDNA底物上反式切割活性的间隔序列-靶标相互作用特征。这一计算适配使dsDNA训练的预测模型能够迁移至PAM非依赖的ssDNA触发CRISPR电路,同时保持对序列特异性活性决定因素的敏感性。

训练动态通过跟踪各epoch在留出验证集上的均方误差损失和Spearman秩相关系数(ρ)进行监测(图S1A和B)。训练损失稳步下降,验证损失趋于平稳且无反弹,表明模型收敛且未过拟合。在完全独立的测试集上,DiagCRISPR达到Spearman ρ = 0.678,核密度估计确认预测活性分布沿对角线紧密跟踪实验分布(图1B)。根据Schober等人提出的标准,该值处于中等相关的上限范围,接近强相关阈值(ρ≥0.70)。在与标准诊断架构的对比基准评估中,DiagCRISPR保持了高度稳健的精确度基线,并独特地解锁了评估非经典短ssDNA底物的能力。这一排序性能完全足以满足区分高活性与低活性crRNA候选物的操作相关目标。

为评估DiagCRISPR是否学习了与Cas12a已知酶学机制一致的序列-活性关系,对21个间隔序列位置分别计算了排列特征重要性(图1C)。PAM近端位置1–7的核苷酸表现出显著更高的重要性评分(平均ΔSpearman=0.179),而远端位置9–21的评分较低(平均ΔSpearman=0.005),种子位置1–7的单碱基排列各自导致Spearman ρ下降超过0.15。这种种子区域主导性完全从数据中涌现,模型架构中未编码任何显式生物学约束,且与Cas12a已被确立的酶学机制高度一致——种子区域错配对R-loop形成和反式切割激活的破坏远大于远端错配。位置8的重要性评分显著低于其余种子区域位置,更接近远端区域基线。这一观察与Strohkendl等人提出的亚区域种子架构一致,他们区分了严格"核心种子"(位置1–5)和碱基配对严格性逐渐放松的"延伸种子"(位置6–8),也与Creutzburg等人报道的位置特异性错配耐受数据相符。这种具有生物学意义的位置梯度权重分布的自发涌现,验证了DiagCRISPR捕获了真实的序列-活性关系,并为其crRNA排序决策提供了机制基础。

Performance evaluation and functional validation of the DiagCRISPR platform. (A) Architecture of the DiagCRISPR deep learning model. (B) The kernel density estimation plot of predicted versus experimentally measured activity scores on the independent test set. (C) Permutation feature importance for
▲ Performance evaluation and functional validation of the DiagCRISPR platform. (A) Architecture of the DiagCRISPR deep learning model. (B) The kernel density estimation plot of predicted versus experimentally measured activity scores on the independent test set. (C) Permutation feature importance for

在实际应用方面,最终模型权重部署到交互式、用户友好的Gradio网页界面,使平台可公开访问以服务于广泛的生物医学研究(图S1C)。单点预测界面(图S1D)接受用户定义的靶标-crRNA对,返回预测活性评分、Z-score和估计荧光强度,支持对单个候选物的快速评估。长序列扫描界面(图S1E)对长达200 nt序列中的所有潜在21-nt靶标位点执行自动滑动窗口枚举,返回按预测活性排序并分为高、中、低活性层级的候选物。基于任何排名最高的crRNA,平台还额外生成并评分一个不完美匹配变体文库,包括单碱基错配、双碱基错配、单碱基缺失和混合突变模式,以支持特异性分析和错配耐受评估。通过同时评估所有候选靶标-crRNA界面,DiagCRISPR实现了对短ssDNA触发CRISPR电路的通用crRNA预筛选。

【数据】输入序列长度:25 nt;PAM变体:TTTA、TTTC、TTTG、TTTT;测试集Spearman ρ:0.678;PAM近端位置1–7平均ΔSpearman:0.179;远端位置9–21平均ΔSpearman:0.005;种子位置单碱基排列ρ下降:>0.15;长序列扫描最大长度:200 nt;crRNA间隔序列长度:21 nt

3.2 基于PER的AND门控驱动aCRISPR系统的可行性

(本节内容基于图2,原文未提供对应正文段落,以下为图注翻译)

图2:基于PER的AND门控驱动aCRISPR系统的可行性。(A)链置换反应的天然PAGE分析。M:25 bp DNA ladder,泳道1:miR−21,泳道2:miR−155,泳道3:H1探针,泳道4:H2探针,泳道5:miR−21与H1探针,泳道6:miR−155与H2探针。(B)天然PAGE分析……

Feasibility of the PER-based AND-gate-driven aCRISPR system. (A) Native PAGE analysis of the strand displacement reaction. M: 25 bp DNA ladder, Lane 1: miR−21, Lane 2: miR−155, Lane 3: H1 probe, Lane 4: H2 probe, Lane 5: miR−21 with H1 probe, Lane 6: miR−155 with H2 probe. (B) Native PAGE analysis o
▲ Feasibility of the PER-based AND-gate-driven aCRISPR system. (A) Native PAGE analysis of the strand displacement reaction. M: 25 bp DNA ladder, Lane 1: miR−21, Lane 2: miR−155, Lane 3: H1 probe, Lane 4: H2 probe, Lane 5: miR−21 with H1 probe, Lane 6: miR−155 with H2 probe. (B) Native PAGE analysis o

【数据】凝胶电泳:天然PAGE;分子量标记:25 bp DNA ladder;泳道1:miR−21;泳道2:miR−155;泳道3:H1探针;泳道4:H2探针;泳道5:miR−21+H1探针;泳道6:miR−155+H2探针

3.3 基于PER的AND门优化

(本节内容基于图3,原文未提供对应正文段落,以下为图注翻译)

图3:基于PER的AND门优化。(A)不同长度引物(8–12 nt)与21-nt发夹探针之间结合的模拟。(B)不同引物长度下基于PER的AND门的荧光强度。(C)不同引物浓度下基于PER的AND门的荧光强度。

基于PER的AND门优化。(A) 不同长度引物(8–12 nt)与21-nt发夹探针之间的模拟结合。(B) 不同引物长度下
▲ 基于PER的AND门优化。(A) 不同长度引物(8–12 nt)与21-nt发夹探针之间的模拟结合。(B) 不同引物长度下

【数据】引物长度范围:8–12 nt;发夹探针长度:21 nt

3.4 aCRISPR网络优化

(本节内容基于图4,原文未提供对应正文段落,以下为图注翻译)

图4:aCRISPR网络优化。(A)不同全长crRNA浓度下aCRISPR反应的荧光强度。(B)不同split crRNA浓度下aCRISPR的荧光强度。(C)不同Cas12a浓度下aCRISPR的荧光强度。

Optimization of the aCRISPR network. (A) Fluorescence intensity of the aCRISPR reaction at different full-length crRNA concentrations. (B) Fluorescence intensity of the aCRISPR at different split crRNA concentrations. (C) Fluorescence intensity of the aCRISPR at different Cas12a concentrations. Data
▲ Optimization of the aCRISPR network. (A) Fluorescence intensity of the aCRISPR reaction at different full-length crRNA concentrations. (B) Fluorescence intensity of the aCRISPR at different split crRNA concentrations. (C) Fluorescence intensity of the aCRISPR at different Cas12a concentrations. Data

【数据】优化参数:全长crRNA浓度、split crRNA浓度、Cas12a浓度;原文未详述具体数值

3.5 双miRNA检测的校准曲线

(本节内容基于图5,原文未提供对应正文段落,以下为图注翻译)

图5:基于PER的AND逻辑门控aCRISPR系统双miRNA检测的校准曲线。(A)荧光强度随miR−21浓度的变化。(B)荧光强度随miR−155浓度的变化。数据以均值±SD表示(n=3)。

Calibration curves for dual miRNA detection using the proposed PER-based AND logic-gated aCRISPR system. (A) Fluorescence intensity as a function of miR‑21 concentration. (B) Fluorescence intensity as a function of miR‑155 concentration. Data are presented as mean ± SD (n = 3).
▲ Calibration curves for dual miRNA detection using the proposed PER-based AND logic-gated aCRISPR system. (A) Fluorescence intensity as a function of miR‑21 concentration. (B) Fluorescence intensity as a function of miR‑155 concentration. Data are presented as mean ± SD (n = 3).

【数据】miR−21检测限:785 fM;miR−155检测限:778 fM;重复数:n=3;数据表示:均值±SD

3.6 双miRNA检测特异性

(本节内容基于图6,原文未提供对应正文段落,以下为图注翻译)

图6:所提出的基于PER的AND门控驱动aCRISPR用于双miRNA检测的特异性。

所提出的基于PER的AND门驱动aCRISPR用于双miRNA检测的特异性。
▲ 所提出的基于PER的AND门驱动aCRISPR用于双miRNA检测的特异性。

【数据】原文未详述具体数值

3.7 深度学习引导的干湿协同集成平台

(本节内容基于图7,原文未提供对应正文段落,以下为图注翻译)

图7:结合深度学习引导crRNA设计与基于PER的AND逻辑门控自催化CRISPR扩增网络的双miRNA检测干湿协同集成平台。(A)深度学习引导平台用于理性crRNA设计和短无PAM ssDNA底物通用评分的工作流程。

Integrated dry-wet synergistic platform for dual-miRNA detection combining deep learning-guided crRNA design with a PER-based AND logic-gated autocatalytic CRISPR amplification network. (A) Workflow of deep learning-guided platform for rational crRNA design and universal scoring of short, PAM-free s
▲ Integrated dry-wet synergistic platform for dual-miRNA detection combining deep learning-guided crRNA design with a PER-based AND logic-gated autocatalytic CRISPR amplification network. (A) Workflow of deep learning-guided platform for rational crRNA design and universal scoring of short, PAM-free s

【数据】原文未详述具体数值

Deep learning-guided crRNA design enables an AND logic-gated
▲ 论文配图

【数据】原文未详述具体数值

讨论与解读

本研究成功开发了一个干湿集成诊断平台,将数据驱动的深度学习与可编程核酸电路耦合,用于精确的双miRNA检测。DiagCRISPR平台有效绕过了严格的PAM约束,实现了针对短ssDNA底物优化的crRNA的理性计算机预筛选。将这种计算引导的序列选择与PER控制的AND逻辑门及自催化CRISPR扩增网络整合,实现了高效的指数信号转导。全集成检测在2小时内对miR−21和miR−155的检测限分别达到785 fM和778 fM,并在复杂血清基质中表现出稳健的特异性。该方法减轻了与经验性湿实验室优化相关的大量试错成本,同时克服了传统CRISPR反式切割检测的线性动力学局限。所提出的协同策略为多标志物生物传感提供了可靠且可扩展的方法学,在早期癌症筛查和个性化液体活检方面具有重要前景。未来改进方向包括:在计算方面,系统性地将局部连接网络与CNN和Transformer等替代架构进行基准比较,以进一步阐明不同模型在短序列活性预测中的相对优势;迁移学习策略也可能拓宽应用范围。

编译者解读:该研究的核心亮点在于"干湿接口"的设计——虚拟PAM平均算法巧妙地弥合了dsDNA训练数据与ssDNA诊断底物之间的域差距,使计算模型无需重新训练即可迁移至非经典靶标。PER-AND门与split-crRNA自催化回路的耦合在分子层面实现了逻辑运算与信号放大的统一。然而,785/778 fM的检测限虽优于常规单周转CRISPR,但距临床miRNA检测所需的fM以下水平仍有提升空间;且当前仅验证了两个miRNA靶标,逻辑门的可扩展性有待证明。深度学习模型的预测精度(ρ=0.678)也提示纯计算预筛选尚不能完全替代实验验证。

参考来源

期刊:Sensors and Actuators B: Chemical, 2026

DOI: 10.1016/j.snb.2026.140668

DOI: 10.1016/j.snb.2026.140668

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

整合代谢工程与生物过程优化实现枯草芽孢杆菌表面活性素高产 09-12 大肠杆菌代谢工程实现O-琥珀酰-L-高丝氨酸高效生产 09-12 从Gibson组装到无细胞表达 09-12 多组学改造解脂耶氏酵母产赤藓糖醇 09-12