二代测序(短读长)与三代测序(长读长)的取舍,本质上是在读长、准确率与成本之间寻找平衡:二代测序读长不超过 200BP,靠算法拼接还原序列,单碱基准确率高但容易在重复序列区域“迷路”;三代测序无需扩增、可从头读到尾,能直接跨越重复区,但单次准确率约 95%,且成本更高。两者并非简单的代际替代,而是各守壁垒、互为补充,融合方案正成为演进方向。
短读长与长读长的核心差异
业内常用歌曲作比:二代测序是把一首歌切成三个字的片段唱出来,再用算法复原;三代测序则是从头唱到尾。这带来截然不同的能力边界:
| 维度 | 二代测序(短读长) | 三代测序(长读长) |
|---|---|---|
| 读长 | 不超过 200BP | 原则上无长度限制,目前最长读长可达 2.4M |
| 扩增 | 需 PCR 扩增 | 无需扩增,直接对 DNA/RNA 测序 |
| 准确率 | 高 | 约 95% |
| 短板 | 重复序列难以精准测出 | 易产生单碱基错误 |
二代的短板在于基因组中常见的重复序列——好比把《嘻唰唰》切成三字片段,很难数清“嘻唰唰”重复了多少次,若此处出错,算法可能直接忽略。三代则能完整跨越重复区,但可能把“嘻唰唰”唱成“喜剧刷”。
技术壁垒与市场格局的演变
过去十年,二代测序凭借高准确率和成本优势占据最大市场份额,三代测序市占率不到 10%,应用多局限于基础科研。但长读长的独特价值正被重新认识:2022 年 4 月,端粒到端粒联盟(T2T)利用长读长技术完成首个真正完整的人类基因组序列,补齐了此前缺失的 8%;2023 年初,Nature Methods 将长读长测序评选为“2022 年度最佳技术”。
产业端同样在加码:illumina 宣布推出长读长产品 Infinity;华大智造、Element Biosciences、Ultima Genomics 等均有布局;专注纳米孔长读长测序的齐碳生物完成了 7 亿元融资;贝瑞基因截至 2022 年底累计服务三代测序检测样本量突破 10 万人份。行业普遍观点认为,单分子测序技术即第三代测序技术,而所谓“第四代”更多是商业代际概念。
未来方向:融合而非替代
准确率与读长的取舍并非零和游戏。HiFi 测序等融合方案试图兼顾两者——通过三代长读长获得完整结构,再借助二代高准确率数据进行校正。这种“长读长搭骨架、短读长填细节”的思路,正在成为复杂基因组研究和临床转化的主流路径。
常见问题
三代测序会完全取代二代测序吗?
短期内不会。三代测序准确率约 95%,且成本更高,在需要高精度单碱基判定的场景中,二代仍具优势。两者更可能长期共存,形成互补组合。
为什么说三代测序在重复序列区域有优势?
二代测序读长短,遇到基因组中的重复序列时,算法难以确定重复次数;三代测序可从头读到尾,直接跨越重复区域,因此 T2T 联盟完成完整人类基因组序列时,三代测序起到了不可替代的作用。
长读长测序的准确率问题如何解决?
目前准确率约 95%,主要依赖提高测序深度来校正,或与二代高准确率数据结合使用。随着 HiFi 等融合技术成熟,准确率与读长的兼顾程度正在提升。