基因编辑脱靶检测全基因组测序

来源:DNA Lab Space 实验教程 | 编译:DNA Lab Space

📎 相关工具:高级引物设计工具

全基因组测序做脱靶检测,跑完生信流程却拿到一堆乱数据——假阳性高得没法看,或者关键位点一个都没测出来。这种情况你急不急?反正带过的学生里,十个有八个卡在这关。问题往往不在最后那步分析,而是前面建库、测序、比对某个环节埋了雷。这篇教程按排查顺序来,从最简单的低级错误到进阶疑难,一步步带你找到那个“凶手”。

教程配图2:基因编辑脱靶检测全基因组测序 排查流程示意
▲ 教程配图2:基因编辑脱靶检测全基因组测序 排查流程示意

第一步:快速排查低级错误

别急着怀疑生信流程或者试剂盒有问题,先花五分钟排除下面几个新手最容易翻车的地方。

1. gDNA定量虚高,上样量根本不对。 核酸定量仪测的是总核酸,RNA和降解片段也算数。脱靶检测建库要求gDNA起始量精确到±10%,你如果拿Nanodrop测的数值直接建库,实际投入量可能只有标称的一半。解决:用Qubit荧光定量复核,建库前再跑一次琼脂糖凝胶确认完整性。

2. 接头浓度没按片段分布优化。 全基因组测序的插入片段是随机分布的,接头与DNA摩尔比直接决定连接效率。别照抄说明书上的固定值,片段化后先跑Bioanalyzer看主峰位置,再计算接头用量。主峰在300 bp和500 bp,接头用量差着1.5倍。

3. PCR循环数贪多求稳。 建库最后一步扩增,循环数多两轮确实能多拿点文库,但duplication rate会飙升。PCR重复序列直接干扰脱靶位点的定量判断。标准操作:扩增6-8个循环,测序后duplication率控制在10%以下。超过15%,你的脱靶信号基本没法看了。

4. 把文库浓度和文库摩尔浓度搞混。 Qubit测出来的是质量浓度,上机前需要换算成nM。一个400 bp的文库和一个600 bp的文库,同浓度下分子数差了50%。上机用量按nM算,别拿ng/μL直接套公式。

第二步:分维度系统排查

低级错误排除后还没解决,按下面五个模块逐个过。每一步都给你判断方法、验证手段和具体参数。

模块一:片段化步骤出了问题

现象描述: 测序数据中reads的插入片段长度分布出现双峰,或者主峰严重偏离预期范围(比如做400 bp文库,主峰却跑到200 bp以下)。比对后全基因组覆盖均匀性差,GC含量高的区域覆盖率掉到平均值的一半以下。

原理说明: Covaris超声片段化依赖机械力随机打断,打断效率和DNA的浓度、体积、buffer成分直接挂钩。DNA浓度太高(超过200 ng/μL)、或者管壁残留有EDTA,都会导致打断不充分。DNA起始量越低,片段化偏差越明显。

解决步骤:

① 用Qubit精确测定gDNA浓度,调整到50-100 ng/μL之间,总体积100 μL;

② 确认Covaris参数:peak power 175 W,duty factor 10%,cycles per burst 200,处理时间55秒(针对550 bp目标片段);

③ 打断后立即取2 μL跑凝胶电泳,看弥散条带是否在预期区间内。

验证方法: Bioanalyzer 2100检测片段分布,主峰范围±10%之内算合格。如果主峰偏移超过50 bp,重新打断。

模块二:末端修复和加A尾效率不足

现象描述: 比对结果中reads的比对率正常(>95%),但insert size偏短,而且接头序列在reads前几个碱基频繁出现。脱靶位点检测软件输出的候选位点,有一半以上落在重复序列区域。

原理说明: 末端修复酶把DNA末端补平并磷酸化,加A尾则是为了适配T载体接头的粘性末端。这两个步骤共用同一buffer体系,但酶活性对温度极度敏感。温度低了加A效率直线下降,温度高了会造成末端降解。很多自动建库仪在这个步骤容易因热盖温度不准导致失败。

解决步骤:

① 严格执行Thermocycler程序:20°C末端修复30分钟,65°C加A尾30分钟;

② 热盖温度设为105°C,防止管盖冷凝水稀释反应体系;

③ 如果手工操作,注意加酶时枪头不要打出气泡,酶要完全打入液面以下;

④ 用带A尾的阳性对照DNA(比如试剂盒自带的control DNA)同步操作,最后跑qPCR对比Ct值。

验证方法: 取等量建库产物,用接头引物做qPCR扩增,Ct值差异超过1个循环说明加A效率有偏差。也可以直接送Sanger测序看接头连接边界是否干净。

模块三:PCR扩增引入偏向性

现象描述: 测序深度分布不均匀,某些区域覆盖深度是平均值的3倍以上,另一些区域(特别是高GC区)几乎测不到。duplication rate正常低于10%,但脱靶候选位点在两个重复样本间重复率不到一半。

原理说明: PCR扩增会系统性偏向GC含量适中的片段。高GC区(>65%)的模板链不易解开,DNA聚合酶容易提前解离;低GC区(<40%)则容易产生非特异性扩增。全基因组脱靶检测通常要扩增12-16个循环,前6个循环引入的偏差会被后续循环指数放大。

解决步骤:

① 换成支持高GC扩增的聚合酶混合物,比如KAPA HiFi GC Buffer,在PCR反应中加入5% DMSO(终浓度,v/v);

② 降低退火温度:60°C降到58°C,延伸时间从30秒延长到45秒;

③ 把循环数从12降到8,用更多建库起始量换取更少循环数;

④ PCR产物纯化后跑凝胶电泳,确认无大片段拖尾。

验证方法: 用同一文库做两次独立PCR,测序后比较两组的GC偏向曲线是否一致。偏差过大的话直接重做PCR,别在这一步省钱。

教程配图3:基因编辑脱靶检测全基因组测序 排查流程示意
▲ 教程配图3:基因编辑脱靶检测全基因组测序 排查流程示意

模块四:测序上机参数配置失误

现象描述: 测序产量远低于预期,Q30比例低于80%,或者测序Read 1和Read 2的长度差异超过10 bp。脱靶检测分析时因read质量低被过滤掉30%以上的数据。

原理说明: 全基因组脱靶检测对测序质量要求比普通WGS更严格,因为脱靶信号通常是低频突变(0.1%-1%等位基因频率)。测序质量不够,真实信号直接淹没在测序错误里。常见问题是上机文库摩尔浓度算错,导致flow cell上簇密度过高或过低。

解决步骤:

① 上机前用KAPA Library Quantification Kit做qPCR定量,不用Qubit的粗略值;

② 仔细校准文库摩尔浓度:文库平均片段大小用Bioanalyzer峰值的加权平均,不用算术平均;

③ 上机用量按Illumina推荐值的80%加载,宁低勿高——簇密度高了后Q30会崩得很难看;

④ 如果测序平台是Novaseq 6000,推荐用SP flow cell跑单lane,2×150 bp双端测序。

验证方法: 测序下机数据用fastp做质控,Q30>85%、平均错误率<0.1%才达标。达不到的话,重新上机而不是强行分析。

模块五:比对和变异过滤参数不匹配

现象描述: 用相同数据跑两遍分析流程,每次输出的脱靶位点都不一样。用GATK HaplotypeCaller和FreeBayes两种caller分别分析,交集为0。

原理说明: 低频脱靶信号的检测依赖比对参数。bwa mem的默认参数适合普通WGS,但脱靶检测要求更严格的比对质量过滤。mapQ < 30会被系统性地排除掉——但许多真实脱靶位点恰恰落在mapQ不太高的重复序列侧面。另一方面,宽松的参数又会把比对错误的多态性位点当成脱靶信号。

解决步骤:

① 比对时用bwa v0.7.17+,参数:-k 19 -r 1.5 -T 30 -B 4;

② 比对后用samtools view过滤掉mapQ < 30、正向反向配对异常的reads;

③ 变异检测用两套caller做交叉验证:最少需要三个不同algorithm检出,其中一个必须是基于贝叶斯模型的caller;

④ 过滤掉的窝点建一个BED文件备查——如果同一位置在三组实验中被多次提到,即使单独一次没过阈值

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

蛋白冻干塌陷赋形剂配比优化 09-12 MALDI质谱峰抑制基质结晶优化 09-12 生物传感器响应漂移参比电极维护 09-12 数字PCR液滴生成不均表面活性剂 09-12