人类基因长度差异极为悬殊,从几百个核苷酸的小基因到几百万个核苷酸的大基因不等,这种跨度给测序技术带来了截然不同的挑战。应对这一难题,行业形成了短读长测序与长读长测序互补的技术路线:短读长测序以高通量和低成本见长,适合大规模筛查;长读长测序则能跨越重复序列和复杂结构变异,负责解析短读长难以拼接的“疑难区段”。
基因长度差异为何是测序难题
人类基因组约有30亿对核苷酸,其中仅约2%的DNA能够编码RNA或蛋白质,这些片段即基因。在人类基因组上,共有20000~25000个编码基因,不同基因之间长度差异很大,有些基因只有几百个核苷酸,而有的基因却有几百万个核苷酸。
这种长度差异直接决定了测序策略的选择。短基因(几百核苷酸)用短读长即可完整覆盖;而长达几百万核苷酸的基因,其内部往往包含大量重复序列和结构变异,需要更长的读长才能跨越这些“暗区”,否则拼接时容易产生错误或缺口。
短读长与长读长的分工逻辑
短读长测序(高通量测序/NGS) 的核心优势在于大规模并行。高通量测序技术可一次对几百万到几十亿条核酸分子进行序列测定,别名叫做大规模并行测序或下一代测序技术。其原理是先把DNA序列打成碎片,再同时并行读取每一个碎片的序列,最后像拼图一样还原成完整长段DNA。这种路线通量高、成本低,适合全基因组范围内的变异筛查和群体研究。
长读长测序则弥补了短读长的短板。面对几百万核苷酸的大基因,长读长技术能直接跨越重复区域和复杂结构,减少拼接歧义,更准确地还原基因全貌。两者的关系并非替代,而是按需分工:短读长负责“广撒网”,长读长负责“深挖洞”,在临床诊断和科研中常组合使用。
技术演进与成本趋势
基因测序成本正以“超摩尔定律”的速度下降。第一代测序技术(Sanger法)读长可达1000bp,准确性高达99.999%,但成本高、通量低。进入高通量时代后,人类全基因组测序成本出现断崖式下跌:从早期的千万美元级,逐步降至千美元级,再到百美元级。官方资料显示,华大智造发布的超高通量测序仪DNBSEQ-T20×2,每年可完成高达5万例人全基因组测序,单例成本低于100美元。
成本的持续下探,使得“短读长广筛查+长读长精解析”的组合策略在临床上越来越可及。随着测序通量继续提升,基因长度差异带来的技术门槛正在被逐步填平。
常见问题
短读长测序能测长基因吗?
能测,但存在局限。短读长测序通过“打碎-并行读取-拼接”的方式可以覆盖长基因,但遇到重复序列或复杂结构变异时,拼接容易出错。对于几百万核苷酸的大基因,通常需要结合长读长测序来保证完整性。
长读长测序会取代短读长吗?
短期内不会。长读长测序在解析复杂区域上优势明显,但短读长在高通量、低成本和成熟流程上仍不可替代。实际应用中两者互补,按研究目的和成本预算灵活组合。
测序成本下降对技术路线选择有何影响?
成本下降让更多机构有能力同时部署短读长和长读长平台。当单例全基因组测序成本进入百美元级,组合策略的性价比大幅提升,推动测序技术从“选一种”走向“按需混搭”。