单细胞测序cDNA扩增偏好校正

来源:DNA Lab Space 实验教程 | 编译:DNA Lab Space

📎 相关工具:代谢通路设计

做单细胞测序,最怕的不是细胞数少,而是好不容易建好的文库,一看数据——扩增偏好(amplification bias)严重,基因覆盖度稀碎,UMI重复率反常,或者干脆某些高表达基因占比爆炸。你可能会怀疑是试剂批次问题,或者仪器校准失灵,但其实很多偏差源头早在cDNA扩增阶段就已经埋下。本文结合我多年实验培训经验,帮你按顺序排查从体系构建、PCR循环到纯化回收的每一个环节,每一条都配有现象、原理、操作和验证,确保你能直接照着检查。

第一步:快速排查低级错误

新手最常栽在以下几个地方,先花5分钟排除,别一上来就调程序:

1. 引物浓度算错或稀释混匀不彻底:典型现象是扩增产量低且各样本差异极大。解决:用无核酸酶水稀释引物后涡旋5秒再瞬时离心,并用Nanodrop复核浓度,确保终浓度落在0.1–0.5 µM范围内。

2. PCR仪热盖未预热或压力不够:反应体积10 µL以下时,热盖不紧会导致蒸发,盐浓度升高直接抑制聚合酶。解决:开机预热至少5分钟,确保热盖温度105℃并压紧管盖/封膜。

3. cDNA模板量超载:模板总量超过100 ng时,扩增曲线提前进入平台期,后续偏好显著放大。解决:定量后按推荐范围上样,严格控制在10–50 ng(视试剂盒而定)。

4. 酶Mix反复冻融导致活性下降:扩增偏向AT富集区就是典型症状。解决:分装成单次使用量,置于-20℃保存,融化后30分钟内上机。

教程配图2:单细胞测序cDNA扩增偏好校正 排查流程示意
▲ 教程配图2:单细胞测序cDNA扩增偏好校正 排查流程示意

第二步:分维度系统排查

按实验流程从cDNA合成、PCR扩增到产物纯化三个模块逐一排查,每一环节都有明确的现象与对策。

模块一:逆转录与模板切换效率不均

现象:某些转录本(尤其是高GC或长转录本)的cDNA产量系统性偏低,导致后续扩增偏好被放大。你可能会看到样本的基因检出数低于预期,且UMI归一化后,长基因的表达量明显低于真实水平。

原理:逆转录酶在合成第一链cDNA时,从RNA模板上脱落,而模板切换(template switching)效率受RNA二级结构、分子浓度和反转录酶活性影响。若逆转录温度不稳或反应时间不足,短转录本更易被完全逆转录,长转录本则提前终止。

解决步骤

1. 核对逆转录条件:42℃反应30分钟,之后85℃失活5分钟。如果使用Smart-seq2或类似体系,可将温度改为42℃ 90分钟,以提升全长cDNA比例。

2. 增加RNA酶抑制剂:RNase抑制剂终浓度保持1 U/µL,防止RNA降解造成5'端缺失。

3. 优化模板转换引物(TSO):终浓度从0.5 µM调整到1 µM,同时确认3'端最后3个碱基为LNA或锁核酸修饰,否则模板切换效率会打五折。

4. 验证方法:取1 µL逆转录产物进行2100生物分析仪检测,看cDNA大小分布。理想图谱应呈现连续弥散带,主峰在1–2 kb;如果峰集中在200–500 bp,说明逆转录不完整,需要提高TSO浓度或延长反应时间。

模块二:PCR扩增循环数与聚合酶选择不当

现象:扩增偏好最常见的表现是,高表达基因(如线粒体基因)占比超过总reads的20%,而低丰度转录本几乎降为零。此外,如果不同样本的UMI复制率差异巨大(从5%到50%),也属于典型扩增偏好。

原理:PCR扩增过程中,不同模板片段的扩增效率存在细微差异,主要受GC含量和片段长度影响。当循环数过高或聚合酶保真度不足时,短片段和高GC片段会被优先扩增,指数级放大初始偏差。KAPA HiFi、Phusion这类高保真酶具有更强的复制能力,但仍需控制循环数。

解决步骤

1. 将PCR循环数限制在10–12次。如果cDNA起始量极低(低于1 ng),也不要超过14次,否则偏好无法逆转。

2. 使用聚合酶建议的退火温度,通常会比引物Tm低3–5℃。例如KAPA HiFi的推荐两步法:98℃变性20秒,65℃退火加延伸3分钟,不再单独设退火温度,减少非特异结合。

3. 加大延伸时间:片段最长可达4 kb,按酶说明书每kb延伸20–30秒,建议设为3分钟。切勿为了节省时间缩短延伸,否则长转录本会被系统性丢失。

4. 验证方法:取扩增产物进行qPCR定量(使用SYBR Green),比较目标基因(如ACTB)和长转录本(如TSC1,长度>5 kb)的Cq差。正常差应小于3;若大于5,则存在长度偏倚,需调整延伸时间或改用专为长片段设计的聚合酶。

5. 如果偏好仍存在,尝试两步扩增法:第一轮做8个循环,纯化后取1 µL产物再做4个循环。这种“预扩增+二次扩增”模式可以稀释酶偏好带来的影响。

教程配图3:单细胞测序cDNA扩增偏好校正 排查流程示意
▲ 教程配图3:单细胞测序cDNA扩增偏好校正 排查流程示意

模块三:cDNA纯化回收步骤引入额外偏差

现象:纯化后产量正常,但文库质检显示片段分布变窄,长片段明显减少。最终数据中,基因体(gene body)覆盖度3'端偏重,5'端覆盖度流失,这说明纯化过程中丢失了长cDNA。

原理:AMPure磁珠(或类似SPRI磁珠)对DNA的回收范围由PEG/NaCl浓度决定。如果磁珠与样品体积比偏高,比如用了1.2×或更高量,小片段回收增加,但大片段(>3 kb)也会吸附,但若结合缓冲液处理时间不足或洗脱体积过小,长片段不易完全洗脱,造成偏好性丢失。

解决步骤

1. 按cDNA长度选择磁珠比:对于全长cDNA(最大5 kb),建议使用0.6×磁珠先去除小于200 bp的短产物,再补加0.3×(即共0.9×)收集长片段。如果必须保留300 bp以下片段,可使用0.8×单次分选,但需接受轻微长片段损失。

2. 磁珠与cDNA混合后室温孵育至少5分钟(推荐8分钟),确保长片段充分结合;然后置于磁力架上静置3分钟,切勿提前吸走溶液。

3. 洗脱时使用0.1×TE缓冲液或10 mM Tris-HCl(pH 8.0),体积不少于20 µL,并在室温孵育2分钟后再吸出,否则长片段可能仍贴在磁珠上。

4. 验证方法:使用高灵敏度DNA芯片(如Agilent High Sensitivity DNA kit)检测纯化后和纯化前样本。比较500 bp以下和3 kb以上区域的荧光信号,如果3 kb以上信号降低超过30%,说明磁珠比或洗脱流程需要优化。

模块四:UMI回帖与定量归一化中的计算偏差

如果你已经优化了以上所有湿实验步骤,但数据仍然显示“偏好”,那么问题可能出在数据分析阶段的UMI处理上。

现象:检出基因数正常,但不同基因的UMI计数与预期的摩尔比不符,特别是高表达基因的UMI数量被过度校正或校正不足。

原理:UMI是随机序列,用来标记每一个原始mRNA分子。但如果PCR扩增引入错误(例如聚合酶在重复区域发生滑移),同一个UMI可能被误认为两个不同UMI,从而低估表达量;反之,两个不同UMI如果由于测序错误变成相同序列,又会高估表达量。

解决步骤

1. 使用支持UMI校正的比对工具,如STAR solo或Cell Ranger,设置允许一个碱基错配(expected OMM=1)。不要只用唯一比对策略。

2. 对于cDNA扩增偏好校正,推荐运行UMI-tools的“directional”方法,利用UMI在转录本上的位置(即基因的5'端或3'端)来解决因模板切换不完整造成的UMI重复。

3. 验证方法:绘制UMI计数与reads数的散点图。如果数据点呈非线性分布(特别是低表达区),说明存在UMI合并或拆分问题,需要调整UMI比对参数。

第三步:进阶疑难问题

疑难1:样本间扩增偏好差异与细胞活性相关

有时同一个批次,细胞活力高的样本没有偏好,活力低的样本扩增偏好严重。根本原因是死亡细胞释放RNA酶,导致mRNA断裂、polyA尾丢失,逆转录效率下降。对策:上机前用荧光染料(如AO/PI)确认细胞活力>90%;若低于80%,建议增加cDNA扩增循环数至12–14,并适当延长模板切换反应时间(42℃ 120 min),可以在一定程度上恢复低活力样本的3'端覆盖。

疑难2:高GC转录本系统性缺失,但全转录组平均GC含量正常

这类偏好属于“区域差异”而非“全局差异”。原因是高GC区二级结构稳定,逆转录酶容易脱落。此时推荐添加甜菜碱(终浓度1 M)或DMSO(终浓度5%),并同时降低逆转录温度至40℃反应60分钟。PCR扩增阶段,使用含GC增强缓冲液的聚合酶(如KAPA HiFi GC Buffer),并采用“两步法”退火延伸(65℃ 3分钟),成功率高很多。

疑难3:扩增后出现非特异性大片段(>5 kb),且偏好完全随机

可能原因是TSO引物自连形成二聚体,随后被基因组DNA污染作为模板扩增。解决:使用DNase I处理细胞裂解液,或者严格使用oligo-dT引物逆转录(不要随机六聚体)。验证:取产物跑1%琼脂糖凝胶,若出现明显的高分子量拖带,则可判定为基因组污染,需重新提取RNA并在逆转录前加一步DNase消化。

避坑总结+实操建议

核心结论:

1. 扩增偏好的根源多半在逆转录阶段,而不是PCR循环——先检查TSO浓度和温度时间,再调整循环数。

2. 磁珠纯化不是机器自动就正确——0.6×+0.3×分选和室温孵育8分钟是关键细节,别省时间。

3. 数据分析中的UMI校正与湿实验同等重要——运行UMI-tools directional模式,允许1个错配,能帮你挽回大量“假偏好”。

日常好习惯:

1. 每次实验前在反应体系中加入一个“内参”——例如20 pg的ERCC RNA Spike-In,可以量化全长cDNA回收效率和扩增偏好系数,下次对照结果就知道问题出在哪一步。

2. 建立一份“批次-细胞活力-循环数-磁珠比”对应表,记录每次实验的偏差表现。当你看到新批次数据异常时,先查这个表,能快速定位是批次问题还是操作问题。

如果你已经被cDNA扩增偏好折磨得头疼,建议下次实验前使用我们平台上的引物设计工具,自动评估TSO引物和PCR引物的二聚体风险;同时可以用密码子优化功能检查高GC区段,手动选择酶切位点或调整尾序列。这些工具都能辅助降低偏好,节省你反复摸条件的时间。动动手指,把你的序列粘进去,几分钟就能得到优化建议——实验前多花这五分钟,胜过失败后重来一整周。

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

MALDI质谱峰抑制基质结晶优化 09-12 生物传感器响应漂移参比电极维护 09-12 蛋白冻干塌陷赋形剂配比优化 09-12 支原体检测假阴性样本富集改进 09-12