来源:单细胞转录组文库扩增偏倚线性化(DNA Lab Space 实验教程)| 编译:DNA Lab Space
新手看条带,老手看分布。单细胞转录组文库扩增,最怕的不是“没产物”,而是“产物有了,数据全偏”。PCR循环数一多,稀有基因被稀释,高表达基因占据绝对优势——这叫扩增偏倚。你花了大半天分选细胞、建库,最后在扩增这一步把数据搞成“幸存者偏差”,冤不冤?
别急着优化程序。先按下面三步排查,大概率能找出问题根源。覆盖范围:从PCR前的反应体系,到循环数设定,再到酶选择和特殊模板处理。总共12个排查点,按顺序走。
---
第一步:快速排查低级错误
新手翻车,九成栽在细节上。这4个问题,直接回答“是/否”即可。
1. cDNA模板量是不是超了? 反应体系里模板超过100 ng,聚合酶会“忙不过来”,低丰度转录本直接被跳过。解决:用Qubit精确量化,控制在1-50 ng。
2. 引物浓度对不对? 终浓度超过0.5 μM,引物二聚体跟你抢dNTP。解决:按说明书算好体积,不要凭感觉加。
3. 退火温度有没有按引物Tm值调? 你还在用通用的55°C?Taqman探针和随机引物需要的温度完全不同。解决:梯度PCR摸条件,别省这1小时。
4. 模板是不是有二级结构? mRNA的5'端发夹结构会导致逆转录提前终止,扩增出的片段长短不一。解决:RNA变性(65°C热激5分钟后立刻冰浴)这一步别省略。

图片说明:单细胞文库扩增问题排查总览流程图,从cDNA合成到PCR扩增依次定位偏倚来源。
---
第二步:分维度系统排查
低级错误排除了,问题还在?直接看下面的分模块排查。按实验流程走,从cDNA合成开始,到PCR仪结束。
模块1:逆转录(RT)阶段——扩增偏倚的起点
1. RNA模板质量差或含量低
- 现象描述:扩增产物集中在高分子量区段,小片段(<300 bp)稀少。你测的RNA完整性值(RIN)低于7,或RNA总量低于1 ng。
- 原理说明:逆转录酶是“忠实”的,但它需要完整的poly(A)尾和RNA模板。模板断裂了,cDNA合成会从断裂处重新起始,产生截短的cDNA片段。这些截短片段在后续PCR中扩增效率各不相同,导致文库大小分布偏离预期。
具体参数:RNA完整值(RIN)<7建议弃用;<5直接重提。
- 解决步骤:
1. 将反应体系中RNA模板量调整到1-100 ng。
2. 加入RNase抑制剂(终浓度1 U/μL),防止降解。
3. 延长逆转录时间到50°C孵育50分钟,再85°C热灭活5分钟。
- 验证方法:取1 μL cDNA产物跑Agilent Bioanalyzer高灵敏度DNA芯片,看片段大小分布是否在300-1500 bp呈现正态分布。若主峰<200 bp,说明RNA降解严重。
2. 逆转录引物设计不当——oligo(dT) 长度不够
- 现象描述:扩增产物5'端序列大量缺失,表现为基因体覆盖度(gene body coverage)5'端显著下降。具体表现:5'端reads数只有3'端的30%以下。
- 原理说明:oligo(dT)引物过长(>30 nt)或过短(<15 nt)都会影响锚定效率。过短导致非特异性结合,过长则形成自身二级结构,阻碍退火。
通用原则:18-20个T加2个锚定碱基(如5'-AAGCAGTGGTATCAACGCAGAGTACTTTTTTTTTTTTTTTTTTTTTTTTTTTTT-3')。
- 解决步骤:
1. 检查你用的引物序列,确保锚定碱基在3'端。
2. 计算Tm值:目标Tm值在55-60°C范围内。
3. 若用随机引物,改为N6(6个随机碱基)或N8。
- 验证方法:比对扩增产物与参考转录本的5'端覆盖度。用IGV可视化,5'端reads掉崖式下降就说明引物锚定有问题。
3. 逆转录酶活性受抑制
- 现象描述:所有样本的Ct值一致延迟3个循环以上,或文库产量低于100 pg/μL。但RNA质控又是好的,你怀疑人生。
- 原理说明:逆转录酶对溶剂、盐浓度和pH极其敏感。乙醇残留(>0.5%)、EDTA浓度偏高(>1 mM)、盐浓度过高等因素都会让酶活性下降。
别小看这个问题。你从提取试剂盒里拿到的RNA,如果洗脱液含EDTA,最终RT体系中EDTA浓度可能达1.5 mM。这时候MgCl₂(推荐终浓度2.5 mM)就压不住EDTA的螯合作用,酶直接罢工。
- 解决步骤:
1. RNA溶解用无核酸酶的水,别用含EDTA的TE缓冲液。
2. 加入RT反应体系前,将RNA样品做1:10稀释(降低抑制物浓度)。
3. 在RT体系中提高MgCl₂终浓度到3 mM,这一步能挽回不少活性。
- 验证方法:用qPCR检测两个诊断性基因(如ACTB的3'端和5'端各设一对引物),比较ΔCt。正常ΔCt<2;若ΔCt>4,说明逆转录效率低。

图片说明:RT阶段cDNA合成全长率判定标准:目标基因5'端/3'端Ct差值示意及片段分布曲线。
模块2:PCR扩增阶段——偏倚的放大器
4. 循环数太多,扩增进入平台期
- 现象描述:qPCR曲线显示Ct在8-12之间已进入平台期,但你硬是扩了18个循环。结果:高丰度基因被过度扩增,低丰度基因丢失。
- 原理说明:PCR每循环一次,理想状态下产物量翻倍。但实际扩增效率常在70-90%。超过平台期(产物浓度>10 ng/μL),聚合酶底物耗尽、焦磷酸盐累积,扩增效率急剧下降。此时各基因的相对比例被扭曲,即出现偏倚。
- 解决步骤:
1. 设置平行qPCR,首次做标准曲线确定最佳循环数——目标产物量在0.1-1 μg范围的最小循环数。
2. 推荐值:10 ng cDNA起始扩增,建议不超16个循环;100 ng起始不超12个循环。
3. 时间参数:延伸温度72°C,时间按产物长度每kb 30秒设定。例如目标产物1.5 kb,延伸45秒即可。过长延伸时间不解决问题,只产生非特异条带。
- 验证方法:对扩增产物进行qPCR相对定量,比较低丰度基因(如CD34)和高丰度基因(如GAPDH)的Ct差。如果扩增前后两个Ct差超过3,说明偏倚明显。扩增前Ct差为12,扩增后应为12左右才算线性。好,这个环节讲清楚了。
5. 高GC含量区域扩增失败
- 现象描述:在转录组比对结果中,GC含量高于70%的外显子区域reads数显著低于低GC区域。差异可达10倍以上。
- 原理说明:高GC区域富含氢键(G-C配对为3个氢键,比A-T多1个),模板解链困难。聚合酶在GC-rich区域容易“滑脱”,导致扩增提前终止。当GC含量>65%时,Taq酶的扩增效率下降50%以上。
- 解决步骤:
1. 加入GC增强剂:甜菜碱(终浓度1-2 M)或DMSO(终浓度2-5%)。例如,5% DMSO可将高GC模板的Tm降低3-5°C。
2. 提高变性温度:从95°C升到98°C,变性时间缩短到10秒(针对GC-rich模板)。
3. 改用两步法PCR:不设退火步骤,直接72°C延伸(同时起到退火和延伸作用)。
- 验证方法:用qPCR扩增一段已知GC含量为72%的序列,确认Ct值在合理范围(<30)。若扩增仍然失败,考虑更换DNA聚合酶。
6. 聚合酶选择错误——普通酶而非高保真酶
- 现象描述:扩增后Sanger测序,1000 bp中超过2个碱基突变。或者在低频突变检测中,检出率异常。
- 原理说明:Taq DNA聚合酶缺乏3'→5'校对活性,错误率约为1×10⁻⁴/碱基/回合。1000 bp片段经过20个循环,累计突变率约17%。当然,这个问题对转录组比对影响很小,你自己掂量一下。但酶选择错误会造成扩增偏倚:普通Taq对模板序列有一定偏好,某些基序上效率会显著不一样。
- 解决步骤:
1. 更换为高保真酶(如Q5、Phusion或KAPA HiFi)。但注意:高保真酶对低丰度模板(<1 ng)的扩增灵敏度低于Taq,需要增加起始模板。
2. 遵循“两酶策略”:第一轮扩增用高保真酶(低循环数),第二轮增加少量巢式PCR(如果非要不可)。
3. 扩增体系体积控制在50 μL:酶量1 U/50 μL(Taq)或0.5 U/50 μL(高保真酶),不要超额加酶。
- 验证方法:对扩增产物进行配对末端测序,统计reads的重叠区域中碱基不一致率。若>0.1%,换酶没商量。
7. 退火条件不当——非特异性产物竞争底物
- 现象描述:电泳出现涂布状条带(smear范围>1 kb)或引物二聚体明显(<100 bp的亮带)。
- 原理说明:退火温度过低,引物与模板的非完全匹配位点也结合;延伸时间不够或过长,都导致产物不均一。这实际上相当于多个模板位点在竞争引物和底物,特异性产物虽不受绝对抑制,但总产物的比例会失衡。
- 解决步骤:
1. 梯度PCR测试:58°C-68°C范围设8个梯度,选择条带最特异、亮度最高且涂布最小的温度。
2. Touchdown PCR策略:从65°C开始,每个循环降0.5°C,降到58°C后再固定循环。这能保证产物专一性。
3. 严格控制MgCl₂浓度:终浓度2 mM为通用值;如果引物二聚体增加,降到1.5 mM。
- 验证方法:取扩增产物5 μL跑2%琼脂糖凝胶电泳(120V,25分钟),观察条带分布。若涂布范围集中在目标产物附近(±300 bp),可接受;若涂布覆盖宽泛(>1 kb),需要优化退火温度。
8. 延伸时间不足或过长
- 现象描述:产物长度出现双峰分布,或大片段区域产量增加但小片段未按比例扩增。
- 原理说明:延伸时间是按最长大片段产物设定的,但如果在同一反应管中大小差异过大(如300 bp和2 kb共存),短片段会率先完成延伸,随后在每一步变性过程中被“稀释”——不是降解,而是作为一个完整模板单独竞争引物,可能产生额外复制。这会导致短片段过度扩增。
- 解决步骤:
1. 设定延伸时间为“每kb 1分钟”的保守值,但不超过2分钟/循环。
2. 如果产物大小范围在300-800 bp,72°C延伸20秒足够。
3. 同时检查:PCR仪的热盖温度设置是否过高(≥105°C会导致反应液蒸发,浓缩样品加剧偏倚)。
- 验证方法:实时收集不同循环数的产物——在第12、14、16、18个循环各取5 μL,Agilent TapeStation检测片段分布。如果分布形态随循环数改变过大,说明延伸时间不合理。
图片说明:不同循环数下的文库片段分布变化图,展示何时出现偏倚“拐点”。
---
第三步:进阶疑难问题
按上述步骤排查后没有起色,考虑以下特殊情况。这几点有门槛,建议有一定基础后再操作。
特殊情况1:全长cDNA扩增中的模板转换(template switching)人为偏差
Smart-seq2等全长扩增方案依赖模板转换OLigo(TSO)捕获第二链合成的起点。如果TSO与引物在3'端形成非特异性退火,产物会大量出现在转录本的3'UTR区域。这不是普通的扩增偏倚,而是cDNA合成机制上的人为限制。
怎么判断:比对结果显示转录本3'UTR区域的reads占比超过60%,而CDS区域占比不到30%。怎么验证:用RT-qPCR检测同一基因的3'UTR和CDS区域的表达比,若CDS/Ct值显著更高,确认存在TSO捕获偏差。怎么解决:优化TSO浓度至终浓度1 μM,并在逆转录体系中加入10% PEG 8000(增加分子拥挤效应可提高模板转换效率)。
特殊情况2:UMI(唯一分子标识符)的随机引物序列偏好
如果你用的是含UMI的建库方案,UMI本身可能是偏倚来源。某些UMI序列(如全部为A/T或G/C的)会导致扩增效率差异。简单来说,UMI相当于每条cDNA的“条码”,但不同条码对聚合酶来说相当于不同的引物序列,效率自然有差异。当然,大家通常用UMI校正这种偏倚,没大问题。
有什么好办法?确实有的。若要排查UMI相关扩增偏倚,方法是检查各UMI家族的大小分布,若某些UMI家族比预期大(>10个reads),说明该UMI序列扩增效率偏高。可用的调整手段是在读段校正时按UMI序列拆分统计,不选用有序列偏倚的UMI(连续同聚物>4 bp的)做分析。
特殊情况3:低起始量样本(<100 pg)的非线性放大
单个细胞的总RNA约10 pg,这远低于常规建库的起始量要求(建议1 ng以上)。此时需要多轮PCR扩增,每轮都引入偏倚。近年来,5'端模板转换结合多重退火及环化延伸(LIANTI)是替代方案