长读长测序正凭借其超长读长与无需扩增的独特优势,在基因组组装、结构变异检测等场景中开辟出短读长技术难以替代的应用空间,从而重塑基因测序下游需求结构。2022年4月,端粒到端粒联盟(T2T)利用长读长测序技术完成了首个真正完整的人类基因组序列,补齐了此前人类基因组计划遗留的最后8%空白区域,这一里程碑事件标志着长读长测序从基础研究走向关键应用的核心转折点。随后,国际顶级期刊《Nature Methods》将长读长测序评选为“2022年度最佳技术”,进一步印证了其在基因测序下游应用中的战略价值。

长读长测序的不可替代场景

长读长测序(即第三代测序,单分子测序)的技术核心在于无需PCR扩增、直接对单条DNA分子从头读到尾。这一特性使其在以下下游应用中具备短读长无法比拟的优势:

  • 从头基因组组装:短读长测序将DNA切成不超过200bp的片段读取后再用算法还原,面对基因组中常见的重复序列时容易丢失或错配;长读长测序则可跨越高重复区域实现完整组装,这正是T2T联盟补齐完整人类基因组序列的关键手段。
  • 结构变异精准检测:长读长测序能直接跨越较大范围的基因组结构变异区域,避免短读长因片段过短而导致的变异漏检或误判。
  • 重复序列区域测序:以歌曲类比,短读长测序如同将一首歌切成三字片段再复原,遇到重复段落(如“嘻唰唰”唱了多少次)难以计数;长读长测序则从头唱到尾,重复次数一目了然。
  • 单倍型分型与全长转录本测序:长读长可直接对RNA进行测序,避免逆转录扩增引入的偏向性及突变,为转录本异构体解析提供完整信息。

短读长与长读长的分工互补

两类技术并非替代关系,而是构成新的需求分层。短读长测序(二代测序)凭借低成本与高通量,在常规变异检测、表达定量等大样本场景中仍是主力;长读长测序则聚焦于短读长“读不了、读不准”的复杂区域,如重复序列、结构变异、单倍型解析等。在临床转化端,截至2022年底,贝瑞基因累计服务三代测序检测样本量突破10万人份,服务终端客户超过1500家,检验医学国际期刊《CLINICAL CHEMISTRY》曾发表编辑部文章,认为三代测序技术为复杂单基因病的分子诊断带来全新机遇。这种“短读长做广度、长读长做深度”的分工,正推动下游需求从单一变异检测向复杂基因组解析升级。

常见问题

T2T联盟完成完整人类基因组序列意味着什么?

这是人类基因组计划发起30年后的又一重大里程碑。T2T联盟利用长读长测序技术补齐了此前参考基因组中最后8%的空白区域,而这些区域恰恰富含重复序列和结构变异,正是短读长测序长期无法覆盖的“暗区”。该成果证明了长读长测序在填补基因组空白中的不可替代价值。

长读长测序与短读长测序如何选择?

取决于应用场景。短读长测序适合大规模、低成本的标准变异检测与表达定量;长读长测序则适合需要完整跨越重复区域或精准解析结构变异的研究,如从头组装、单倍型分型、全长转录本测序等。两类技术互补共存,共同构成基因测序下游应用的完整工具链。

长读长测序的准确率如何?

长读长测序当前的主要技术挑战在于单碱基准确率,官方资料显示其准确率目前仍只能做到95%。但其读长优势可部分弥补碱基错误——通过跨越多轮重复区域或结合算法校正,仍能在复杂基因组区域获得短读长无法实现的解析结果。