来源:蛋白表达量低密码子偏好优化(DNA Lab Space 实验教程)| 编译:DNA Lab Space
诱导条件调到最优,菌长得挺好,可目标蛋白就是不出量。跑完SDS-PAGE,目的条带淡得像没吃饭。你换过载体、换过菌株、试过不同温度,产量依旧是老样子。别急着怀疑人生——大概率是密码子偏好这个隐形杀手在捣乱。稀有密码子像路上的减速带,每经过一个,核糖体就卡一下。卡得多了,翻译提前终止、蛋白降解、包涵体堆积,产量自然上不去。本文从最基础的实验操作排查,一路拆到密码子优化的底层逻辑,用一套可落地的6步方法,帮你把蛋白产量从“勉强可见”提到“条带发黑”。

第一步:先别怪密码子,查这4个低级错误
新手最容易踩的坑,往往不是密码子,而是手滑。
1. 诱导时机太晚或太早。OD600到0.6-0.8再加IPTG,这是常识,但很多人用分光光度计读数时没稀释,测出来是虚高。验证方法:诱导前取1ml菌液,稀释5倍再测OD600,控制在0.6-0.8。解决:直接重新摇菌,别心疼那点时间。
2. IPTG浓度搞错。0.5mM是常用浓度,但不同载体系统要求不同。pET系统用0.1-1mM都可以,但如果你用的是T7表达系统,IPTG浓度过高反而会抑制生长。解决:做一个小梯度(0.1/0.3/0.5/1.0mM),37°C诱导4小时,跑胶看哪个浓度条带最亮。
3. 收菌时间点没卡准。很多人习惯过夜诱导,但有些蛋白在长时间诱导后会被宿主细胞降解。验证方法:诱导后每隔2小时取1ml菌液,离心取沉淀,跑胶对比。目的蛋白通常在诱导后3-6小时达到峰值。
4. 样品处理太粗暴。超声破碎时功率太大、时间太长,蛋白会变性聚集。200W功率,超声3秒停5秒,总时长不超过10分钟,全程冰浴。破菌后取上清和沉淀分别跑胶,确认蛋白到底在哪个组分。
排除完这些,如果你的蛋白还是低表达,密码子偏好才需要被真正摆上台面。
第二步:分维度系统排查(核心)
进入正题。密码子偏好问题不能只盯着CDS序列看,它是宿主、载体、序列、培养条件四维联动的结果。按下面的顺序排查,每条路径都给到验证方法。
1. 确认你的基因里有多少稀有密码子
现象描述:序列比对显示你的基因含有大量大肠杆菌稀有密码子(如AGA/AGG精氨酸、CGA精氨酸、AUA异亮氨酸、CUA亮氨酸),尤其是N端前30个氨基酸内集中出现多个。
原理说明:大肠杆菌基因组中,某些密码子对应的tRNA丰度极低。当核糖体遇到这些稀有密码子时,需要等待对应tRNA扩散到位,翻译速率骤降。连续多个稀有密码子会造成核糖体“交通拥堵”,前一个核糖体还没走,后一个已经撞上来,最终引发翻译提前终止或mRNA降解。
解决步骤:
1. 用在线工具(如GenScript Rare Codon Analysis Tool)分析你的序列,看CAI值(Codon Adaptation Index)。CAI低于0.8就需要认真考虑优化。
2. 重点关注N端30个氨基酸——这是翻译起始区域,核糖体在这里的通过效率决定了整个蛋白的合成速率。单点稀有密码子可耐受,连续2个以上就需要处理。
3. 如果稀有密码子散布在序列中段,先尝试共表达稀有tRNA质粒(如pRIL、pRIPL),成本低且快。
验证方法:共表达pRIL后重新诱导,SDS-PAGE对比目的条带是否增亮。如果产量提升显著(>2倍),问题基本锁定。

2. 区分“个别稀有”还是“整体不匹配”
现象描述:序列中稀有密码子数量并不多,但整体GC含量偏高(>65%)或偏低(<35%)。
原理说明:密码子偏好不只是单个密码子的问题。GC含量影响mRNA二级结构稳定性。GC过高,mRNA 5'端容易形成强发卡结构,核糖体无法有效结合;GC过低,mRNA容易被RNase降解。另外,某些密码子虽然不稀有,但对应tRNA在生长快速期会被竞争性消耗——比如高表达宿主在37°C快速生长时,某些tRNA的再充电速度跟不上。
解决步骤:
1. 在优化时同时考虑GC含量,目标范围40%-60%。
2. 如果GC偏高,优先把5'端前15个密码子的GC含量降下来,用同义密码子替换为富含AU的编码序列。
3. 降低诱导温度到25°C或30°C,延长诱导时间至8-12小时,给核糖体更多“塞车”后的疏通时间。这招对于轻微密码子不适配的情况往往立竿见影。
验证方法:25°C诱导过夜后取样跑胶,与37°C 4小时的结果对比。如果25°C下可溶蛋白比例明显提高,说明问题不单是密码子,还有折叠速率和翻译速率的博弈。
3. 排除mRNA二级结构的干扰
现象描述:密码子分析显示优化程度很高,但表达量依然低。这时候你需要看一眼5'端mRNA的折叠自由能(ΔG)。
原理说明:即使所有密码子都是高频密码子,mRNA自身的序列也可能折叠成稳定的二级结构,让核糖体结合位点(RBS)被“藏”起来。SD序列周围的序列如果形成发卡结构,核糖体30S亚基无法有效锚定,翻译起始效率直接打对折甚至更低。
解决步骤:
1. 用mFold或RNAfold预测5'端50个核苷酸的二级结构,看ΔG值是否低于-10 kcal/mol。如果低于这个值,说明结构太稳定。
2. 在不改变氨基酸序列的前提下,替换5'端密码子,破坏发卡结构。
3. 注意不要动RBS序列本身(通常是AGGAGG或GAAGGAGA),但可以优化RBS与起始密码子之间的间隔序列(5-9个核苷酸)。
验证方法:修改后重新构建载体,做一个小量表达测试(10ml体系,37°C诱导3小时),快速判断是否有改善。
4. 看看N端是否“太滑”或“太黏”
现象描述:表达产物总是一条比预期分子量小的带,或者蛋白在沉淀里,上清根本看不到。
原理说明:N端氨基酸的性质影响翻译起始效率和共翻译折叠。N端含有大量疏水氨基酸时,新生肽链会过早结合到信号识别颗粒(SRP)上,被引导进入膜或周质空间;N端带强正电荷时,可能与核糖体出口通道相互作用,拖慢翻译。更常见的情况是——N端连续出现2个以上的脯氨酸,直接让核糖体“刹车”,产量断崖式下跌。
解决步骤:
1. 检查N端前10个氨基酸,如果脯氨酸超过2个,考虑用丙氨酸或甘氨酸替换(这两个氨基酸最小,对结构影响低)。
2. 如果N端区域有强疏水段,尝试添加MBP或GST标签。融合标签不只是纯化用的,它们能提供强启动翻译的5'序列,同时帮助折叠。
3. 不要一开始就做全基因合成。先用定点突变改N端密码子(3-5个位点),低成本试错。
验证方法:突变后跑胶看两条带(融合蛋白和切标签后的目的蛋白)。如果融合蛋白表达量正常,切完标签后目的蛋白消失不见,说明问题不在表达而在蛋白稳定性——需要考虑加稳定性标签或在低温下纯化。
5. 别忽视培养条件对密码子偏好的放大效应
现象描述:小量培养时表达量还行,一放大到2L甚至5L发酵罐,产量反而掉下来。
原理说明:密码子偏好的影响在特定生长速率下会被放大。LB培养基在富氧条件下细菌生长快,tRNA消耗大;而TB培养基的甘油成分让细菌代谢路径改变,某些氨基酸的合成效率随之波动。另一个隐藏变量是诱导时的pH——大肠杆菌在发酵过程中产酸,pH跌破6.0时,氨基酸转运系统效率下降,稀有密码子对应的tRNA更显不足。
解决步骤:
1. 放大培养时选择TB或2×YT培养基,而不是LB。TB的缓冲能力强,pH更稳定。
2. 诱导时补加0.2%葡萄糖(注意,这会让pH更酸,需要配合MOPS缓冲液,浓度50mM,pH 7.0-7.4)。
3. 诱导前调整通气量,保证OD600在诱导后仍能持续增长至少1-1.5个单位,说明细胞没有进入稳定期早期——这会加剧密码子不适配导致的翻译停滞。
验证方法:小规模(100ml)和中等规模(1L)各做一次,同样诱导条件,取样跑胶对比。如果产量差异显著,问题大概率在培养条件的pH或溶氧控制,而不是密码子本身。
第三步:进阶疑难问题
基础排查都做完了,还是不行?这几种情况更棘手。
1. 膜蛋白或分泌蛋白的密码子陷阱
膜蛋白的跨膜区富含疏水氨基酸,对应的密码子往往恰好是大肠杆菌非偏好性的。这是信号肽和靶向通路的耦合效应。解决思路:如果信号肽区的密码子CAI值低于0.6,不要犹豫,直接对信号肽做全密码子优化。磷酸化修饰或糖基化位点附近的序列,在序列比对时容易被忽略,但这些区域的翻译停顿会触发蛋白酶降解(是的,大肠杆菌也有质量控制系统,知道你不是故意的)。用ExPASy的ScanProsite工具扫描你的蛋白序列,标记所有潜在翻译后修饰位点,然后只改变这些位点周围的密码子。
2. 共表达蛋白复合体时的偏向冲突
当你同时表达两个亚基(比如抗体轻链和重链),它们各自的密码子偏好可能完全不同。单独表达没问题,共表达时稀有tRNA被竞争性抢用。解决思路:优先优化分子量较小或表达量低的那条链——通常重链是大胃口,轻链容易被饿死。另一个做法是两个亚基用不同的启动子系统(比如一个T7,一个araBAD),用不同诱导剂在不同时间点分别诱导,错峰表达。
3. 长期传代后的表达量“神秘衰减”
冻存菌株在重新划线培养后表达量断崖式下跌,很多人以为是质粒丢失,但检查后发现质粒还在。真正原因可能是宿主细胞在生长过程中发生了基因组重组,导致tRNA基因拷贝数变化。这不算常见,但确实存在。解决思路:用抗生素压力筛选后重新挑取单个克隆,挑3-5个,小量诱导做蛋白印迹(Western blot)对比。如果所有克隆都低表达,直接用含有稀有tRNA基因的菌株重新转化。
避坑总结+实操建议
1. 先改菌株和诱导条件,再做密码子优化。共表达pRIL/pRIPL是操作门槛最低、试错成本最小的方案,半天就能出结果。如果这步有效,说明你的基因确实受稀有密码子限制,再考虑全基因合成。
2. 优化时不要只盯单个密码子频率。CAI值+GC含量+N端30bp二级结构三个指标一起看。全基因合成的价格已经降了很多,但别因为设计得不够聪明而花两次冤枉钱。
3. N端永远是第一优先级。N端前30个密码子的优化价值占整个基因优化的60%以上。如果预算只够改一段序列,就改N端。
两个日常好习惯:
- 建立“表达失败档案”:每次做小量表达测试,把菌株、载体、诱导OD、温度、时间、IPTG浓度、结果照片存档。积累20个样本后你会发现规律,比临时翻笔记本靠谱得多。
- 每次优化只改一个变量:改了密码子就别同时换启动子。否则出了问题,你永远不知道是哪个动作救了你还是害了你。
蛋白表达量低的问题,密码子偏好只是其中一个可能原因,但它是性价比最高的排查起点——因为其他优化手段(换载体、改标签、调培养条件)都绕不开序列本身。序列和宿主之间的“兼容性”,是用最少的钱、最短的时间能撬动最大杠杆的因素之一。
你的基因序列发来过——先做一次密码子适应性分析,拿到CAI值再决定下一步往哪个方向走。