转录组测序比对率低rRNA去除效率

来源:DNA Lab Space 实验教程 | 编译:DNA Lab Space

📎 相关工具:论文深度润色

你辛辛苦苦提了RNA、建了库,上机测序回来一看比对率——不到50%。数据废了大半,生信同事把锅甩给rRNA去除,但真的是这样吗?大概率是,但不全是。rRNA残留高是常见元凶,可文库浓度、接头二聚体、参考基因组不匹配,甚至RNA降解,全都能把比对率压到让你怀疑人生的水平。

这篇文章从操作台到命令行,按流程顺一遍,把每个查错点、验证方法和顺手就能用的解决手段全给你捋清楚。别急着重新提RNA,先花十分钟按下面几步走。

第一步:快速排查低级错误

很多"比对率低"其实死于操作台,不是死于科学原理。先看这四件事:

1. 样本RNA降解了没?

跑个胶看28S/18S亮度比。小于1.5?别往下做了。降解的RNA片段丢失了真转录本全长,reads读不出来。重新提RNA。

2. rRNA去除试剂加对了没?

Ribo-Zero和RiboCop的操作细节完全不同。你缓冲液加错体积,或者磁珠没涡旋混匀,直接等于没做去除。对照说明书逐行核对,尤其注意磁珠需要彻底重悬。

3. 建库试剂盒过期或批次不对?

接头、逆转录酶、连接酶,任何一个失活都会导致文库产量低、扩增偏好性大。确认有效期,别赌它"还能用"。

4. 参考基因组选对了吗?

你的RNA是人源的,比对用的却是小鼠基因组?或者使用了带有污染序列的组装版本?比对率低是必然的。下载Ensembl/GENCODE官方构建,比对前用STAR生成索引时加 `--sjdbOverhang 149`,读长150bp就设149。

图2 转录组测序比对率低、rRNA去除效率排查流程示意
▲ 图2 转录组测序比对率低、rRNA去除效率排查流程示意

第一步先说这些,都是看一眼就能解决的事。如果都正常,往下系统性排查。

第二步:分维度系统排查

从RNA抽提到比对完成,全流程有五个模块,按顺序查。每个原因给你判断方法、背后的原理、解决步骤和精确验证手段。

1. RNA提取与质检模块:核酸纯度和完整度决定底层数据质量

现象: 260/280远低于1.9,或者RNA完整度数值和实际跑胶结果对不上。

原理: 260/280低提示蛋白质或苯酚残留,抑制逆转录酶和连接酶。但这些残留物虽然抑制酶,真正致命的是RNA本身降解。片段化后reads连不上内含子区域,比对的失败率高。

解决:

  • DNase I处理:37°C孵育10分钟,然后EDTA终止。
  • 重新沉淀纯化:加入1/10体积的3M醋酸钠(pH 5.2)和2.5倍体积无水乙醇,在-80°C沉淀30分钟,4°C 13000 × g离心20分钟。弃上清后务必用70%乙醇洗涤两次,别省这一步。

验证: 取2μL样本跑Agilent 2100,RNA完整度值≥7且28S/18S比值≥1.8。若完整度低于7,直接放弃重抽,没有捷径。

如果胶上出现弥散而完整度数值正常,重点检查试剂盒洗涤液是否残留——2100会算进去。

2. rRNA去除模块:操作细节决定残留比例

这一模块是核心。按不同试剂盒分步说。

现象A(探针杂交法,如Ribo-Zero): 最终文库中rRNA reads占比超过5%。

原理: 探针杂交要求特定的温度和时间,体系温度不对或者孵育中断,探针就不能高效结合核糖体RNA。

解决:

  • 把RNA和探针的杂交体系在95°C变性2分钟,然后以0.1°C/s的速率缓慢降温至65°C,保持5分钟。快速冰浴会导致非特异性杂交,切记用梯度降温。
  • 磁珠使用前在室温涡旋至少10秒,取用后立即放回。磁珠量加倍(如原体系用50μL,改到100μL)通常能改善回收效率,但会增加非特异损失,不建议常规操作。
  • 杂交结束后清洗磁珠三次,每次用200μL洗脱缓冲液,37°C孵育2分钟再磁分离。然后加20μL无核酸水洗脱RNA。

验证: 取建库前的小样跑qPCR(引物设计在18S和28S保守区)或对最终文库跑FastQC,看Overrepresented sequences里是否有rRNA序列富集。

教程配图3:转录组测序比对率低rRNA去除效率 排查流程示意
▲ 教程配图3:转录组测序比对率低rRNA去除效率 排查流程示意

现象B(酶切法,如NEBNext): rRNA去除不完全,且出现大量小片段RNA丢失。

原理: RNase H消化依赖DNA探针代替RNA双链形成DNA-RNA杂合链。温度低于37°C,酶活下降,未消化的rRNA链会干扰后续连接。

解决:

  • 酶切温度恒定在37°C,时间严格保持在35分钟(NEBNext v2规格),超时会导致转录本降解,不足则rRNA残留增加。
  • 反应完立即加DNase I(1μL,37°C 15分钟),去除DNA探针。这一步不能省,残留探针会被当成模板扩增,产生大量非特异性产物。

验证: 文库跑High Sensitivity DNA芯片看片段分布。若主峰低于200bp且出现大片拖尾,确认是RNase H过消化。

3. 建库与扩增模块

现象: 文库浓度不低(≥20ng/μL),但比对率低且插入片段异常短。

原理: 扩增循环数过多或接头连接效率低导致的PCR偏好性。RNA片段的两端必须同时连接上接头才能被有效扩增和比对。循环数多会让小片段(包括接头二聚体)被指数放大。

解决:

  • PCR循环数控制在12-15个,根据起始RNA量调整。起始量1μg做13个循环,500ng做14个循环。
  • AMPure XP磁珠双轮纯化,第一轮用0.8×体积去除大片段,第二轮用1.0×体积去除引物二聚体。注意磁珠与DNA比例必须精确,宁可用加样枪多次慢吸,不要一次吸半管造成误差。
  • 上机前对文库跑Agilent Bioanalyzer。片段主峰在280-350bp之间才算正常。主峰小于200bp,多半是连接失败,重新建库。

验证: 比对后用Picard CollectInsertSizeMetrics查看插入片段分布。如果中位数小于200bp,文库质量不合格。

4. 上机与数据产出模块

现象: 碱基质量值低(Q30低于75%),比对率直接崩了。

原理: 上机pooling比例不对导致簇密度过高。每条flow cell的小簇互相重叠,信号采集时无法区分边界,碱基识别错误率升高。

解决: 确认库浓度用qPCR而不是Nanodrop,Nanodrop会把游离核苷酸和单链DNA算进去,浓度通常偏2-3倍。上机浓度严格按平台规格:NextSeq 550 PE150推荐1.8pM,MiSeq v2试剂盒推荐12-15pM,具体看试剂盒批次说明。用qPCR标准品做标准曲线,再按曲线计算实际摩尔浓度。

验证: 上机结束后,Illumina分析界面看Cluster Density数值。超出推荐范围1.2倍以上,下次稀释两倍。

5. 参考基因组与比对参数模块

现象: 比对率低,但rRNA reads占比正常(低于3%)。RNA质检也合格。

原理: 问题出在比对环节。使用STAR比对时参数设置太严或索引版本太旧会导致错配率升高,尤其在低复杂度区域。还有更隐蔽的情况——参考基因组里有多条与你的样本来源物种高度相似的标记序列(如线粒体假基因),这些序列截获了大量reads。

解决:

  • 用STAR默认参数加以下调整:`--outSAMmapqUnique 60 --outFilterMismatchNoverLmax 0.05 --outFilterMultimapNmax 20`。允许足够多比对比对而不会让低质量reads混入。
  • 比对时加入 `--outSAMtype BAM SortedByCoordinate`,同时生成unmapped reads文件。比对后查看unmapped BAM的序列,用BLASTN检索,看看是不是被已知而基因组中缺失的序列截获了。如果是这种问题,换更全的基因组版本或补充转录组注释文件。

验证: STAR输出日志里的 `Uniquely mapped reads %` 字段作为指标。跑完BAM后用samtools flagstat确认总比对率。如果uniquely mapped低于60%,排查上述步骤。

第三步:进阶疑难问题

三个情况不常见,但遇到了让人头疼:

1. RiboCop和Ribo-Zero外显子覆盖度不均匀

现象:使用RiboCop时发现mRNA覆盖度5'端比3'端低2倍以上,而Ribo-Zero无此问题。原理是RiboCop使用RNase H消化rRNA,其设计可部分穿过内含子区域,但在转录起始位点处可能有酶切切偏。RiboCop的批间差异和探针特异性比Ribo-Zero严格。解决:换用Ribo-Zero Plus做平行对照,确认rRNA去除效率和比对率的差异。如果RiboCop确实有问题,考虑换试剂盒,不要反复调体系。

2. 跨物种比对导致rRNA残留虚高

很多人在做非模式物种转录组时,使用人类rRNA参考序列做比对滤除。但如果该物种rRNA序列差异太大(如酵母或植物),你的rRNA depletion reads可能无法正确匹配到人类rRNA参考,导致实际rRNA残留被严重低估。解决:直接用物种特异rRNA参考序列过滤,或者用一次性比对到注释的rRNA数据库,如Silva数据库(LSU/SSU Ref)做滤除,再计算真实残留率。

3. 核糖体RNA残留呈现链特异性偏差

使用链特异性建库时,某些试剂盒(如TruSeq Stranded Total RNA加上Ribo-Zero)对rRNA的链偏向性处理不好,导致rRNA去除只去掉一条链,留下另一条链,reads占比在3.5%左右。解决:检查文库的链方向配置是否与试剂盒规格匹配。STRANDED选项设置为 `--outSAMstrandField intronMotif`,并确认最终数据中sense链和antisense链的比例。如果出现严重偏向,查看试剂盒说明书里对"second strand"处理的指引。

避坑总结+实操建议

三条结论:

1. rRNA去除失败后,后续任何补救手段都不能让数据起死回生,需返工至rRNA去除步骤。前面所有步骤的优化都是为了这一步能正常运转。

2. 比对率低不等同于rRNA去除失败。先看rRNA占比,再看quality值,最后才动参考基因组参数。顺序别乱,避免浪费时间。

3. 磁珠操作、QC检查、qPCR定量,三处细节做到位,已经能避免一半以上的"科学未解之谜"。

两条日常习惯:

1. 每张flow cell都保留一份去接头前的文库样本(-20°C保存至结果通过QC),排查问题时可以直接回溯,不用重新建库。

2. 每次建库记录一个核心参数表格,内容包含起始RNA完整度值、rRNA占比、延伸循环数、最终文库浓度、Cluster Density——按批次对比,趋势异常就是问题在开始积累的信号。

看,排查比对率问题的每一步都像做PCR:有体系、有阴性对照、有特异性验证。如果你在探索多组学方案,需要快速拿目标物种的高质量转录本数据来验证参考基因组选择,站内提供的引物设计工具和密码子优化器能帮你做针对性验证。需要调整RNase H探针长度?引物设计模块可以直接输出可用的探针序列。如果蛋白表达层面也顺便需要优化,站内还集成了蛋白可溶性分析工具,一次注册,建库和分析的完整武器库都齐了。

延伸阅读:更多代谢通路设计、多基因组装等合成生物学工具,可访问 DNA Lab Space

📎 相关文章

MALDI质谱峰抑制基质结晶优化 09-12 生物传感器响应漂移参比电极维护 09-12 蛋白冻干塌陷赋形剂配比优化 09-12 支原体检测假阴性样本富集改进 09-12