来源:CRISPR编辑脱靶全基因组测序验证(DNA Lab Space 实验教程)| 编译:DNA Lab Space
你做CRISPR编辑脱靶的全基因组测序验证,拿到一堆数据,却分不清是真实脱靶还是实验噪声。别急。本文从样本提取到数据分析,按失败频率排序,给你一套可直接照做的排查流程。覆盖常见低级错误、核心步骤瓶颈和三类疑难Bug。
第一步:快速排查低级错误
新手最容易在这四个点翻车。每一点都先自查,别急着怪试剂。
1. 样本标签弄混。现象:两个编辑株的脱靶位点完全一致。解决:提取DNA前重新核对培养皿和管壁编号,用八连排时每加一管换一次枪头。
2. 接头污染。现象:测序数据里大量短片段长度完全一样。解决:文库制备后跑2%琼脂糖凝胶,切胶回收前确认片段分布,禁止出现单一尖峰。接头浓度从1:20降到1:50,重新连接。
3. 测序深度不够。现象:高置信脱靶位点的reads数低于30。解决:全基因组脱靶检测至少保证肿瘤样本30X,最低别低于20X。上机前用Qubit定量,文库浓度低于2 ng/μL就重新扩增。
4. 参考基因组选错。现象:比对率低于80%。解决:下载与细胞系背景对应的参考基因组版本,人类细胞用GRCh38,小鼠用GRCm39,别用hg19去比GRCh38的数据。

检查完这四步,数据还异常?往下走。
第二步:分维度系统排查
核心流程分四个模块:gDNA质量、文库构建、测序下机数据、脱靶分析参数。按顺序过。
模块一:gDNA质量不过关
现象:测序中GC含量偏移,或比对率忽高忽低。你可能用了蛋白或RNA污染严重的样本。
原理:全基因组测序对模板纯度极敏感。蛋白残留会抑制文库接头连接,RNA会占掉测序通量。
解决步骤:
1. 提取后取1 μg DNA,跑0.8%琼脂糖凝胶,看主带是否完整且大于10 kb。
2. 测OD260/280,控制在1.8-2.0之间。低于1.8说明蛋白污染,加蛋白酶K到终浓度200 μg/mL,55°C消化30分钟后重新纯化。
3. 用RNase A处理:加RNase A至终浓度100 μg/mL,37°C孵育30分钟,再纯化一次。
验证方法:处理后取2 μL跑凝胶电泳,主带清晰且无弥散,再上Qubit,dsDNA浓度应在50 ng/μL以上。
模块二:文库构建环节出问题
现象:测序reads比对后,insert size分布异常,或出现大量duplication。最常见是PCR循环数过高。
原理:全基因组文库需要保持片段多样性。PCR扩增超过10个循环,重复率高企,脱靶等低频变异会被掩盖。
解决步骤:
1. 建库投入量改成400 ng gDNA,打断时间用Covaris设置450 bp峰值,持续50秒。
2. PCR循环数固定为6-8个循环,不要超过10个。
3. 扩增后立即用Ampure XP磁珠纯化,磁珠与文库体积比1:1,洗脱用25 μL EB缓冲液。
验证方法:取1 μL文库在Bioanalyzer上跑High Sensitivity DNA芯片。理想的片段峰值在500 bp左右,浓度不低于10 nmol/L。

模块三:测序数据质量参差
现象:Q30低于80%,或read长度衰减。这可能不是你的问题,是flowcell上样量偏了。
原理:cluster密度过高导致信号叠加,碱基读取错误率上升。
解决步骤:
1. 上机前用Qubit精确测量文库摩尔浓度,按仪器说明书计算上样量。NovaSeq X平台,25M reads的文库上样浓度通常是150 pM,别凭感觉。
2. 加5% PhiX对照文库,平衡低多样性的样本。
3. 如果测序已经开始,且Q30明显恶化,立即终止实验,重新制备flowcell。
验证方法:下机后跑FastQC,重点看Per-base quality plot,30个循环后拐点早于30 bp即为异常。
模块四:脱靶分析参数不匹配
现象:软件跑出几千个候选位点,但PCR验证全部阴性。这是假阳性爆炸。
原理:全基因组测序的脱靶检测依赖比对和