CRISPR脱靶检测全基因组测序

来源:DNA Lab Space 实验教程 | 编译:DNA Lab Space

📎 相关工具:论文深度润色

做全基因组测序(WGS)来扫脱靶,烧钱又烧时间。结果出来一看:覆盖度不够、脱靶位点漏报、对照样本跟实验组混成一团……你是不是也卡在这儿了?别急着重新建库,很多问题根本不是测序深度的问题。这篇教程从你上机前的第一步开始,按流程拆解全基因组脱靶检测的常见故障,每一步都给你判断依据、验证办法和解决动作。按顺序来,能省一半重复实验的钱。

教程配图2:CRISPR脱靶检测全基因组测序排查流程示意
▲ 教程配图2:CRISPR脱靶检测全基因组测序排查流程示意

第一步:快速排查低级错误

这四件事,新手最容易栽,先查一遍。

1. 样本标记颠倒了。 实验组和对照组弄混,后续所有分析全错。解决:回查原始记录,确认DNA来源标签、文库index、测序下机文件名的三级对应关系。

2. 基因组DNA降解了。 电泳看到弥散带,不是清晰主带。降解的DNA做WGS,均匀性差,脱靶假阳性率飙升。解决:重新抽提DNA,确保OD260/280在1.8-2.0,取2μL跑胶确认完整性。

3. 酶切打断条件没优化。 按常规片段化程序处理不同GC含量的基因组,会得到偏长的插入片段。插入片段太长,测序读长覆盖不到断裂点。解决:用Agilent Bioanalyzer检查文库峰图,目标主峰在300-500bp,低于200bp的接头二聚体比例应小于3%。

4. 测序浓度算错了。 Qubit读数没换算摩尔浓度,上机前文库浓度过高或过低。文库浓度过高,cluster密度过大,碱基质量Q30下降;过低则数据量不够。解决:按文库平均长度计算nM浓度,qPCR或Qubit复核,上机前按平台标准稀释到2nM左右。

教程配图3:CRISPR脱靶检测全基因组测序 排查流程示意
▲ 教程配图3:CRISPR脱靶检测全基因组测序 排查流程示意

第二步:分维度系统排查

如果低级错误排除了,还是失败,按下面三个模块逐一过。

模块一:建库环节——文库质量不合格

现象1:PCR扩增循环数过多,文库出现大片段拖尾或额外杂带。

说明:脱靶检测需要高覆盖度,但建库时PCR循环数超过10次,会放大非特异扩增产物。这些非目标片段会被测序并比对到基因组上,产生虚假的脱靶信号。循环数越高,重复序列区域的偏向性越强。

解决步骤:

1. 检查建库记录,PCR循环数应控制在6-8次,根据起始DNA量调整(1μg起始用6次,500ng用7次)。

2. 纯化时两次使用AMPure XP磁珠,第一次0.6×去除大片段,第二次0.8×回收目标文库,两次均室温静置5分钟再上磁力架。

3. 用TapeStation重新评估文库分布,确认主峰无肩峰拖尾。

验证方法:取1μL未稀释文库,在高灵敏度DNA芯片上跑电泳;如果主峰后出现大于1000bp的杂带,建议重新建库,不要强行上机。

现象2:接头连接效率低,文库产量比预期低一个数量级。

说明:接头连接失败最常见的原因是接头稀释倍数错误,或连接缓冲液反复冻融导致ATP降解。连接效率低会直接导致测序reads中无插入片段,黑底白噪音一样的数据比例很高。

解决步骤:

1. 连接体系体积保持20μL,T4连接酶用量不低于1μL(2000U),接头浓度按试剂盒建议的1:10稀释,不要私自提高倍数。

2. 连接温度务必设在20°C恒温,不是室温,也不是4°C过夜。温度波动会让接头平末端连接效率下降50%以上。

3. 连接后立即进行AMPure纯化,不要在冰上存放超过30分钟。

验证方法:连接后取1μL做qPCR定量,比较同样模板量下接头连接前后的Ct值差异。正常情况下,连接后文库浓度应达到起始模板量的50%-70%。低太多,直接查接头和酶。

模块二:靶向富集或扩增子环节——怎么保证检测区域没漏

现象3:测序深度够了,但脱靶候选区域就是没覆盖到。

说明:全基因组脱靶检测通常用两种策略:一种是WGS直接测,另一种是先用sgRNA序列做生物信息学预测的候选区域扩增后再测序。后者如果引物设计失败,比如引物二聚体、错配率高于2%,就会让大量目标区域PCR产量极低,最终造成假阴性。

解决步骤:

1. 用引物设计工具重新检查每对引物,Tm值相差不要超过1°C,3'端最后5个碱基GC含量控制在40%-60%。

2. 对PCR产物跑2%琼脂糖凝胶,看是否每个区域都有清晰单一条带。有 smear 或条带大小不对的位点,重新设计引物。

3. 调整扩增循环参数:退火温度设置为引物Tm-3°C(例如Tm=60°C,退火就设57°C),延伸时间按每kb 30秒,循环数保持25个,不要加到30个以上。

验证方法:取1μg扩增后产物做Qubit定量,再用qPCR检测其中8个看家基因区域和8个脱靶预测区域的比例。如果预测区域的ΔCt值比看家基因区域高5以上,说明这些区域扩增失败,不能用于脱靶分析。

现象4:比对后看到大量reads比对到线粒体或核糖体DNA。

说明:全基因组测序中,线粒体DNA占比过高(超过5%)会浪费有效测序数据。这个问题通常不是建库,而是DNA提取时没有分离线粒体,或者使用了含质粒的细胞系。

解决步骤:

1. 用DNeasy Blood & Tissue Kit提基因组,提取时增加一步差速离心(2000×g,4°C,10分钟)沉淀细胞核,减少线粒体共沉淀。

2. 建库前用RNase A(50μg/mL,37°C孵育30分钟)去除RNA污染。

3. 如果数据已经产出,比对时用mtDNA参考序列过滤,或用bwa mem的 -M 选项配合samtools idxstats统计线粒体reads占比,超过8%做降噪处理。

验证方法:运行FastQC查看sequence duplication level和overrepresented sequences。如果出现多轮高度重复序列且比对到线粒体,重新提取DNA。

模块三:测序与数据分析环节——覆盖度分布均匀性

现象5:平均测序深度50×,但全基因组上有20%的区域深度低于5×。

说明:脱靶检测的灵敏度取决于最低深度,不是平均深度。GC偏好性会在AT-rich或GC-rich区域造成覆盖度下降,特别是sgRNA的PAM序列附近,若基因组为高GC(如拟南芥36%)或高AT(如疟原虫),问题更明显。

解决步骤:

1. 上机前追加使用PCR-free建库流程,如果起始DNA量足够(≥500ng),不要使用PCR扩增的CUT&Tag类试剂盒。

2. 在测序read长度上选择PE150,不要用SE75。双端测序能改善重复区域的mapping唯一性。

3. 数据分析时计算GCS coverage profile。如果你的样本在GC含量60%处覆盖度骤降,使用GATK的CollectGcBiasMetrics重新校准覆盖度,或者用Mosaicatcher的GC-correction模块做归一化处理。

验证方法:用samtools depth统计每条染色体窗口深度的变异系数(CV)。CV大于0.6说明覆盖度极不均匀。此时脱靶检测软件(如CIRCLE-seq的read深度法)会明显低估真脱靶位点,建议将最小深度阈值从10×降到5×,但要同步提高read比对质量MAPQ值到20以上。

第三步:进阶疑难问题

1. 阳性对照(已知sgRNA离线靶点)没有检出脱靶,但阴性对照组却报了20个脱靶。

先别急着怪软件。查一下你用的参考基因组版本。不同版本(hg19 vs hg38)的重复区域注释差异很大,一个位点在hg19里是唯一的,在hg38里可能变成多拷贝。用CRISPResso2或Cas-OFFinder比对时,必须确保参考基因组版本与比对软件默认版本一致。另外,检查阴性对照是否和实验组用了同一批细胞。如果阴性对照是HEK293T,实验组是HCT116,多态性导致的天然SNP会被误判为脱靶。解决办法:结果过滤时,按照dbSNP v153数据库剔除人群频率大于1%的变异位点。

2. 脱靶位点被验证为真实存在的,但PCR验证时总是扩增不出来。

这大概率是脱靶位点位于基因组装配的gap区域或高度重复区。你用了什么验证引物?对着UCSC Genome Browser看该位点的架构。如果重复元素覆盖超过50%,标准Taq聚合酶无法跨过。改用高保真长片段聚合酶(如TaKaRa LA Taq,配套buffer含Mg²⁺浓度为2.5mM),退火温度降低到52°C,延伸时间加长到每kb 1分钟。验证前先跑一个温度梯度PCR(从55°C到48°C,每梯1°C)。

3. 测序质量Q30达标,但两个生物学重复样本的脱靶列表重叠率不足50%。

问题出在生物信息分析的read过滤参数。不同重复样本的reads在断裂位点周围比对时,要允许错配数不一致。很多软件默认允许错配2个碱基,如果sgRNA错配超过2个的位点,在一个样本中被过滤,另一个样本中只错配1个被保留。做法:统一使用最小比对上得分(AS≥90),使用`BamUtils`进行read硬度过滤(duplicate removal),再去比对进行突变检测,最后用`bedtools intersect`计算列表重叠。若重叠率仍低,检查sgRNA序列本身是否同源——比如20bp的sgRNA,其前12bp与基因组重复区域高度同源时,脱靶本质是随机事件,低重复性也算正常。

避坑总结 + 实操建议

三条核心结论:

  • 脱靶检测失败,优先查建库接头和序列比对参数,这俩占故障原因的70%。
  • 脱靶分析是一个“深度越均匀,结果越准”的过程。平均50×深度而均匀性差,不如35×但均匀性好的数据。
  • 所有验证实验,阳性对照必须和实验组同批次处理——包括细胞传代次数、转染试剂批次。

两条日常好习惯:

  • 每次建库前跑一个10μL的微量反应测试,只验证接头连接效率和PCR扩增循环数,不要直接拿所有DNA去试错。
  • 所有数据在下机后24小时内做FastQC和multiqc汇总,看到Adapter含量超过5%立刻标记,别等全套分析做完再回头看。

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

MALDI质谱峰抑制基质结晶优化 09-12 生物传感器响应漂移参比电极维护 09-12 蛋白冻干塌陷赋形剂配比优化 09-12 支原体检测假阴性样本富集改进 09-12