来源:DNA Lab Space 实验教程 | 编译:DNA Lab Space
CRISPR文库筛选是功能基因组学的大杀器,但很多人卡在第一步——文库构建。明明质粒浓度测出来挺高,送测序一看,覆盖度只有设计值的30%,甚至更惨。这意味着你的筛选结果是偏倚的,阳性基因可能漏掉,阴性对照可能假阳性。别急,这个教程按「低级错误→流程分模块→进阶疑难」的顺序,带你用具体参数和操作一步步揪出覆盖度低的真凶。每个环节都给了解决步骤和验证方法,照着排查就行。
第一步:快速排查低级错误
先别急着怀疑试剂和仪器,新手最容易栽在这几个地方:
1. 电转感受态效率不够 —— 用错了感受态或保存不当。解决:必须使用电转级(>1×10^10 CFU/µg)的专门感受态,分装后-80℃保存,每次取用后立即放回,液氮速冻,绝不能在冰上反复冻融。
2. 质粒量加少了 —— 文库构建需要足够多的独立克隆。解决:按每个文库拷贝数至少保证100×覆盖度计算,例如1×10^7的文库需要至少1µg高质量质粒(以3kb质粒计约3×10^11拷贝),电转时单次转化量不要超过1µg,分多次电转合并。
3. 抗生素浓度搞错 —— 筛选压力不对导致背景菌落过多或文库丢失。解决:核对你的抗性基因是Amp还是Kan,氨苄青霉素终浓度100µg/mL,卡那霉素50µg/mL,新鲜配制,防止降解失效。
4. 把OD600当成了活菌数 —— 培养过久导致菌落过度生长、质粒丢失率上升。解决:在OD600=0.6-0.8(对数中期)收获细胞,不要超过1.0。

第二步:分维度系统排查
如果低级错误都排除了,覆盖度还是低,就按实验流程从上游到下游逐模块剖析。
1. 文库质粒本身的均一性差
现象描述:测序结果显示某些sgRNA丰度极高(占>5%),而另一些sgRNA序列完全缺失或只有极低reads数;重复建库后,偏倚的sgRNA模式类似。
原理说明:CRISPR文库通常是数万到数十万条sgRNA的混合质粒。如果每个sgRNA的质粒拷贝数差异大,后续所有步骤都会放大这种不均一性。根源在于化学合成oligo池的合成误差、PCR扩增偏倚、以及连接效率差异。
解决步骤:
1. 拿到商品化或自建的质粒文库后,先做转化验证——取100ng质粒电转,涂板计数,算出实际库容量,应达到设计sgRNA数的50-100倍以上。
2. 用下一代测序(NGS)直接对原始质粒文库进行扩增测序,分析每个sgRNA的reads分布。计算skew ratio(前10%高丰度sgRNA的reads占总reads的百分比,正常<20%,若>40%说明严重偏倚)。
3. 如果原始质粒库不好,不要直接进细胞,建议重新扩增:按单菌落/孔接种,每个克隆单独培养后混合,减少生长竞争偏倚;或者用无偏倚的PCR酶(如KAPA HiFi)重新扩增sgRNA插入片段,再重组克隆到载体。
验证方法:扩增后的文库再测一次NGS,确认skew ratio下降,且低丰度sgRNA的reads数提升到均值的一半以上。
2. 电转参数不合适,转化效率瓶颈
现象描述:电转后克隆数远低于预期,文库覆盖度只有设计值的10-30%;菌落大小不均,甚至有卫星菌落。
原理说明:电转效率受电场强度、时间常数、细胞浓度、质粒盐浓度影响。最常见的问题是质粒含盐量高,导致电转时电弧放电、细胞大量死亡;或者电转杯重复使用,内壁损伤降低效率。
解决步骤:
1. 质粒乙醇沉淀后用70%乙醇洗涤两次,再溶于无核酸酶水,确保OD260/230>1.8,<2.0(盐离子会拉高OD260/230)。
2. 电转前调整细胞浓度,理想是每电转杯含50-100µL感受态(浓度约1×10^10 cells/mL),DNA体积不超过感受态体积的1/10(即≤5µL)。
3. 优化电转参数:伯乐Gene Pulser建议2mm电转杯,电压2.5kV,电阻200Ω,电容25µF;时间常数应在4-5ms。如果时间常数<4ms,说明盐离子过高,重新纯化DNA;如果>5ms,可能细胞浓度过低。
4. 电转后立即加入37℃预热的SOC培养基(不含抗生素),1:10稀释后转入复苏管,在37℃、220rpm摇床复苏1小时(不超过1.5小时,防止细胞二次分裂竞争)。
5. 每次电转使用新的无菌电转杯,或至少用70%乙醇浸泡、紫外线照射30分钟,并干燥。
验证方法:取10µL复苏菌液梯度稀释涂板,次日计数,计算总克隆数。若总克隆数达到目标文库容量的5倍以上,说明覆盖度足够,可以继续;否则重复电转合并。

3. 细胞文库扩增中的生长偏倚
现象描述:从电转菌液到最终冻存的文库,NGS测序发现sgRNA多样性逐步萎缩,特别是某些靶向必需基因的sgRNA丰度显著下降。
原理说明:细菌群体生长过程中,插入sgRNA可能影响质粒拷贝数或表达毒性蛋白,导致携带该sgRNA的细菌生长变慢;此外,文库中每个克隆的理论起始细胞数太少,随机漂移也会导致丢失。覆盖度越低,漂移越明显。
解决步骤:
1. 电转后所有菌落应全部刮下,不要只挑部分。用含抗生素的LB培养基将菌落从平板冲洗下来,充分混匀。
2. 将菌液接种到新鲜培养基中,维持足够大的培养体积。原则:接种后初始OD600应在0.05-0.1,当OD600达到1.0时,要求每个sgRNA对应的细胞数至少1000个。比如文库含1×10^5个sgRNA,则总细胞数需≥1×10^8,相当于100mL OD600=1.0的菌液(约1×10^8 CFU/mL)。所以每代扩增至少需要200mL以上体积。
3. 严格控制传代次数,不超过2-3代(即从刮板到冻存只经历1-2次稀释培养)。每次传代时,接种量要足够大,避免瓶颈效应。
4. 收获菌液时离心、弃上清,用含10%甘油的培养基重悬,分装后-80℃冻存。冻存前取100µL做质粒提取、NGS质检。
验证方法:对最终文库质粒进行深度测序,每个sgRNA至少希望有50-100×reads覆盖。计算覆盖度(实际检测到的sgRNA数/设计sgRNA总数)和均匀性(通过Gini系数或P20/P80比值评估,P20/P80最好在0.5-2之间)。
4. 连接或重组步骤引入偏倚
现象描述:在构建初始文库(从oligo池到质粒)的过程中,某些sgRNA序列因GC含量高或存在回文结构而连接效率低,导致这些sgRNA在整个库中缺失。
原理说明:oligo池合成时,GC含量极端(<30%或>70%)或存在连续碱基重复的序列会被合成酶偏向性影响,同时PCR扩增时高GC区域难变性,连接时粘性末端出现二级结构也会降低效率。
解决步骤:
1. 使用高保真PCR酶(如Q5或KAPA HiFi),并在反应体系中加入GC增强剂(如DMSO终浓度3-5%,或商品化GC缓冲液),退火温度通过梯度PCR优化(建议60-72℃梯度)。
2. PCR扩增循环数控制在18-22个循环,避免过度扩增产生偏向。
3. 连接反应使用3:1(插入片段:载体)摩尔比,T4 DNA连接酶用量不超过1U/µL,在16℃连接4小时或4℃过夜,避免室温连接导致的多连体。
4. 连接产物转化前,纯化去除多余的连接酶和盐,推荐使用PCR纯化柱或凝胶回收试剂盒,洗脱体积控制在20µL。
验证方法:对连接后未经转化的质粒进行菌落PCR,随机挑24个克隆,测序查看sgRNA插入率;如果插入率>90%,说明连接良好;同时统计插入片段多样性,如果出现多个相同序列,提示扩增偏倚。
5. 靶细胞转导效率是不是被忽略
现象描述:最终在细胞筛选阶段发现覆盖度骤降,但质粒文库质量没问题。常见于慢病毒或转座子文库转导时MOI太低或细胞数量不足。
原理说明:哺乳动物细胞文库筛选要求每个细胞只整合一个sgRNA(通常MOI=0.3-0.5),同时要保证每个sgRNA有足够多的细胞事件(如500-1000个细胞/sgRNA)。如果病毒感染效率只有5%,那么大量sgRNA没有细胞载体,覆盖度自然掉。
解决步骤:
1. 先用报告基因(如GFP)慢病毒测定靶细胞的转导效率,确保在不影响细胞活性的前提下,转导效率>30%;若低于20%,应使用转导增强剂(如polybrene 8µg/mL,或RetroNectin纤维连接蛋白包被)。
2. 根据转导效率调整病毒体积:假设MOI=0.3,细胞数需达到 sgRNA数 × 1000 / 转导效率。例如1×10^5 sgRNA文库,需要约3.3×10^8个细胞。
3. 转导后48小时,加入筛选药物(如嘌呤霉素1-10µg/mL,需预实验确定致死曲线),持续筛选7-10天,将未转导细胞完全杀灭。
4. 筛选后细胞样本提取基因组DNA,PCR扩增sgRNA区域,深度测序计算覆盖度。
验证方法:在转导前留取部分细胞,提取基因组DNA,PCR检测sgRNA阳性率;转导后、筛药后各取样一次,比较前后sgRNA丰度分布。若筛药后覆盖度显著下降,说明转导初期细胞覆盖不够。
第三步:进阶疑难问题
1. 长片段sgRNA文库(如双载体系统)的组装错误
如果你构建的是双sgRNA或sgRNA+筛选标签的长片段文库,除了常规偏倚,还会出现片段间错误组装(嵌合体)。原因在于PCR重叠延伸时,两个片段非特异性互补。解决:改用Golden Gate组装,使用BsaI/BsmBI等IIS型限制酶,每个片段两端设计不同粘性末端,连接产物用外切酶处理去除未连接片段,再转化。验证:单克隆Sanger测序检查嵌合率,嵌合体应<5%。
2. 重复序列导致的缺失或重组
文库中若含有高同源性序列(如同一基因的多个sgRNA,或反向重复序列),在大肠杆菌扩增时会因重组而丢失。解决:使用重组缺陷型感受态(如Stbl3或SURE),在30℃培养,不要超过37℃;质粒提取时使用低pH裂解液,避免剪切力破坏。验证:将质粒文库转化Stbl3,对单个克隆进行限制性酶切分析,检查片段大小是否与预期一致。
3. 测序深度不够导致的假性覆盖度低
最后一步NGS文库测序时,如果测序reads总数不足,即使实际文库覆盖度正常,统计结果也会显示低。解决:计算需要的reads数——设计sgRNA数 × 期望每sgRNA reads数。例如1×10^5 sgRNA,期望每个sgRNA至少100 reads,则总reads需要1×10^7,考虑测序质量损失,至少上机1.2×10^7;并且使用文库特异i5/i7引物减少样本间交叉污染。验证:对同一文库重复测序两次,若覆盖度一致,说明不是随机测序偏差;若不稳定,增加测序深度再分析。
避坑总结+实操建议
3条核心结论:
1. 覆盖度低的第一瓶颈通常在电转和扩增阶段,质粒均一性和电转效率不值钱,值得花时间验证再往下走。
2. 所有步骤都要留样,原始oligo池、初始质粒库、菌液库、细胞库,每步都做NGS质检,才能精准定位丢失环节。
3. 宁可多准备几倍细胞/菌液,也不要卡着最低覆盖度做,因为后续筛选会有各种损耗。
2条日常好习惯:
- 每次电转前用1µg已知超螺旋质粒(如pUC19)做对照转化,效率低于1×10^9 CFU/µg时,立即更换感受态批次或电转杯。
- 所有NGS文库添加至少1%的PhiX对照作为测序质量校正,同时用已知丰度的独立sgRNA作为内参,监控批次间差异。
文末工具引导
覆盖度低很多时候也源于引物或sgRNA序列设计不佳——比如GC含量过高、连续碱基、脱靶率高等。你可以直接使用站内的工具,输入基因名或基因组区域,自动生成高特异性的sgRNA序列并评估覆盖度风险;如果需要构建表达载体,工具还能同步优化密码子、预测蛋白可溶性。做完设计再拿本教程对照排查,你的文库覆盖度想低都难。需要时,试试「sgRNA设计」和「密码子优化」两个模块吧。