重组蛋白在大肠杆菌或哺乳动物细胞里表达不出来,很多团队的第一反应是换诱导条件、换载体、换菌株。但在排查这些因素之前,有一件事值得先看:编码区序列本身是否适合表达宿主。密码子偏好性、GC 含量、重复序列这些序列层面的变量,都可以在基因合成之前通过密码子优化在线工具处理掉,成本远低于一轮轮表达试错。
密码子优化是什么,在线工具做什么
密码子优化是在不改变氨基酸序列的前提下,根据表达宿主的密码子使用偏好重新设计编码区序列的过程。密码子优化在线工具把这件事程序化:输入目的蛋白的氨基酸序列或 DNA 序列,选择宿主和约束条件,工具输出一条兼顾多个参数的优化序列,供基因合成或点突变使用。
优化的前提是氨基酸序列不变
无论工具给出多少候选序列,第一条核对永远是回译比对:把优化后的 DNA 序列翻译回氨基酸,与原始蛋白逐位比对,确认完全一致。工具输出本身也需要被验证,这是使用任何优化工具的基本习惯。
不同宿主不能共用一套优化结果
大肠杆菌、酵母、CHO 细胞的密码子使用偏好差异很大,同一段蛋白在不同宿主中的优化序列通常不同。换表达体系时,应当按新宿主重新优化,而不是直接沿用旧序列。
工具实际在平衡哪些参数
密码子优化不是把稀有密码子全部换成高频密码子那么简单,工具在幕后同时平衡多个相互制约的目标。理解这些参数,才能看懂工具的输出和报告。
| 参数 | 作用 | 使用时的注意点 |
| CAI(密码子适应指数) | 衡量序列与宿主高频密码子的匹配程度 | 并非越高越好,极端追求高 CAI 可能引入大量重复序列 |
| GC 含量与分布 | 影响合成可行性与稳定性 | 整体和局部 GC 都要看,避免出现局部高 GC 窗口 |
| 同源多聚物与重复序列 | 连续相同碱基或重复片段会增加合成与突变风险 | 关注工具提示的 poly 结构和串联重复 |
| 限制酶位点 | 为后续克隆预留或去除位点 | 按克隆方案提前声明需要去除的酶 |
| mRNA 二级结构提示 | 工具会提示 5' 端等区域的发夹结构倾向 | 仅作参考,不同工具的预测结果可能不一致 |
五步使用流程与每步的检查动作
第一步,确认输入:用氨基酸序列作为输入比 DNA 更稳妥,可以从源头避免带入原始物种的密码子偏好。第二步,选择宿主与参数:宿主、目标 GC 区间、需要避开的酶切位点,都在这一步声明。第三步,生成并比较候选:多数工具会给出多个候选序列,对比 CAI、GC 曲线而不是只看第一个。第四步,回译核对:确认氨基酸序列一致、起始密码子和终止密码子符合载体设计。第五步,归档参数:把宿主选择、约束条件和最终序列一起存档,方便日后解释这段序列为什么长这样。
三个容易被忽视的核查点
功能区域的序列要保守对待
同义突变并非在所有位置都无关紧要。已有研究提示,某些区域(如信号肽编码区、跨膜区附近以及带有调控作用的稀有密码子簇)的密码子使用可能影响翻译节奏和蛋白折叠。对这类区域,可以要求工具降低优化强度或分段处理,而不是整条序列一律激进替换。
别让优化破坏了克隆设计
如果载体构建方案依赖某个酶切位点或融合标签的连接处序列,优化时必须把这些位点声明为保留项,否则工具可能把它们一并"优化"掉,克隆设计要推倒重来。
保密项目先看数据政策
未公开的靶点序列上传到任何在线工具前,都应确认工具的数据处理政策。对保密要求高的项目,可考虑本地化部署的设计环境。衍因智研云的智研分子(yanMolecule)支持在统一平台内完成序列设计、密码子优化相关参数记录与序列库归档,序列数据在团队权限体系内流转,便于涉密项目管理。
常见问题
密码子优化后表达量一定会提高吗?
不一定。表达结果受折叠、启动子强度、培养条件、蛋白毒性等多因素影响,密码子优化解决的是序列层面这一个变量。它的价值在于排除常见序列问题,让后续条件优化建立在更可靠的基础上。
优化序列需要人工检查什么?
至少检查四项:回译后氨基酸序列与原始一致、阅读框完整、克隆所需酶切位点保留、无连续重复或局部高 GC 窗口。关键项目建议双人复核。
大肠杆菌里表达哺乳动物蛋白,直接用哺乳动物优化序列行吗?
不建议。两个体系的密码子偏好和 GC 水平差异较大,应按实际表达宿主重新优化;如果计划先在大肠杆菌验证再回哺乳动物细胞表达,两个版本的序列都要分别设计与归档。
不同工具给出的优化序列不一样,听谁的?
优化本身没有唯一解,不同算法的权重不同。可行做法是用同一套核查标准(氨基酸一致性、GC 分布、位点保留)去评估各自的输出,选择更符合克隆与合成需求的版本。
优化后的序列需要保存哪些信息?
保存原始蛋白序列、宿主与参数设置、工具或算法版本、最终序列及其用途(合成订单、载体编号),保证两年后仍能回答"这条序列为什么是这样"。
如果团队经常在基因合成前做序列设计与复核,可以考虑把密码子优化结果、载体图谱和质粒库放在同一平台管理,减少序列版本混乱带来的返工。