测序或组装结果丢进比对窗口,相似度 98% 以上,打开变异表却对不上文献位点:有的差一个氨基酸编号,有的整段缺口把后面突变全部推移。这时继续提高匹配分数没有用,先要问本地比对的参考、模式和坐标是不是和报告用的是同一套。
比对分数描述的是两段字符有多像,不保证你正在看的那个碱基就是论文或方案里的那个位置。衍因智研分子 yanMolecule 提供序列编辑与比对,适合把参考版本、比对假设和当次结论留在一起;它不能把错误参考自动改成正确坐标。下面三处建议在导出变异表之前改完。
先确认“对的是哪一条参考”
同一基因常有转录本、基因组坐标和质粒图三套编号。本地文件若用转录本 CDS,报告却引用基因组 g. 坐标,相似度可以很高,位点永远对不齐。记录里先写:参考序列的来源、版本或登录号、编号体系是 CDS、基因组还是质粒图。
不要用“常用参考”四个字代替版本号
组内口头上的“标准参考”可能是去年下载的 FASTA,和今天数据库页面上的条目已经分叉。比对前把参考文件的哈希或下载日期写进记录。换过参考却沿用旧变异表,会出现“分数更高、位点更乱”。
本地比对最容易把位点看错的三处
| 先改哪里 | 常见错法 | 改完怎么验收 |
| 参考序列版本 | 用了同源异构体或旧构建号 | 用方案写明的登录号重对一次,看关键位点是否归位 |
| 比对模式 | 局部比对把侧翼丢掉,或全局比对硬拉缺口 | 目标是找点突变用局部;要看全长覆盖用半全局,并记下缺口位置 |
| 坐标起点 | 有人从 ATG 计 1,有人从 mRNA 5' UTR 计 1 | 在记录里写清 +1 对应哪个碱基,再把变异表映射过去 |
缺口和链方向会把“高分”变成假变异
缺口罚分过低时,比对会插入一串 mer 来保住总分,变异表上出现一堆 indel,测序峰图上却没有。链选反时,互补链上的碱基会被当成新突变。导出前先看:缺口是否落在低质量区、查询序列是否需要先反向互补。这两项都应写在参数栏,而不是只保存默认配置。
分数高只说明像,不说明位点已确认
建议在记录中分开写两句:比对所用参数(参考版本、模式、缺口、链),以及“该变异是否在峰图或原始 reads 上复核”。第二句不能用第一句代替。若实验室用智研笔记 yanNote 记实验,可把参考登录号和坐标规则做成固定栏,避免位点结论只出现在比对软件的默认工程文件里。
跨软件传递结果时,不要只复制一条高亮序列。应同时带走参考标识、查询序列方向和 +1 规则。缺任何一项,下一班的人都会按自己的习惯重对,旧表立刻作废。
常见问题
比对覆盖率接近 100%,为什么文献位点仍对不上?
覆盖率高只说明两端都能贴上。若参考是不同转录本,中间外显子编号会整体平移。先核转录本再核覆盖率。
氨基酸编号和核酸编号混用怎么办?
在记录里分两列写 c. 与 p.,并注明翻译起点。不要在同一格里写“E123K / 367A>G”却不说明 367 从哪开始数。
短读长比对基因组,位点总是偏几个碱基?
先看软剪切和同源重复区。重复区边界的比对可以滑动,分数几乎不变,坐标会跳。应回到原始 reads 看支持该滑动的证据,而不是只信共识序列。
质粒图和线性比对的坐标差一圈,怎么处理?
先统一原点。环形分子从任意点线性化都会让下游位点加减一截。记录应写明本次线性化从哪个特征开始。
能不能只看软件标红的差异?
不能。标红依赖阈值。阈值一变,昨天的“无差异”会变成今天的“有突变”。关键位点要在峰图或原始文件上再看一眼,并留下查看人。
小结
比对分数高但位点对不上,先改参考版本、比对模式和坐标起点,再解释变异。高分不是位点证明。若希望参考标识、参数和当次判断落在同一套记录里,可以了解衍因智研分子与智研笔记如何把比对复核写成可对照字段,而不是只导出一张高亮截图。