T2T联盟能补齐人类基因组最后的8%,核心靠的是三代长读长测序技术——即以 PacBio 和 Nanopore 为代表的单分子测序路线,用超长读长直接跨过二代短读长无法逾越的重复序列区域。这项技术的壁垒,恰恰集中在读长、精度与建库三个环环相扣的环节上。

三代测序如何“从头唱到尾”

要理解T2T的突破,先看两代技术的本质差异。二代测序(NGS)需将 DNA 扩增后切成不超过 200BP 的短片段读取,再用算法拼接还原;三代单分子测序则无需 PCR 扩增,直接对单条 DNA 分子从头读到尾。行业有个形象的比喻:二代是把一首歌切成三字片段再复原,遇到重复段落(如《嘻唰唰》中反复出现的歌词)就容易拼错或忽略;三代则是从头唱到尾,天然规避了重复序列带来的组装歧义。

单分子测序内部有两条技术路线:PacBio 技术利用荧光标记的碱基与 DNA 聚合酶在纳米孔底部反应,通过荧光信号差异识别碱基;Nanopore 技术(Oxford Nanopore 发明,常被误称“第四代”)则让单链 DNA 穿过蛋白纳米孔,通过不同碱基引起的电流变化来判读序列。两条路线共同撑起了长读长测序的能力边界。

壁垒一:读长与精度的“跷跷板”

三代测序的第一个壁垒在于读长。单分子测序原则上对长度没有限制,官方资料显示目前最长读长可达 2.4M(即 2.4 兆碱基),这是二代测序数百碱基读长无法想象的跨越能力。但长读长带来的代价是精度——三代测序目前的准确率仍只能做到 95%,远低于二代。这构成了技术路线的核心矛盾:读长越长,单次越难保证碱基判读的正确性

正因如此,T2T 联盟的完整基因组组装并非依赖单一技术,而是超长读长(用于跨越重复区域)与高精度数据(用于纠错)的结合。如何用算法把 95% 的单次准确率修正到可完成无缺口组装的水平,是长读长技术真正隐性的壁垒所在——它比拼的不是单一指标,而是读长、错误率与纠错算法的系统工程能力。

壁垒二:建库的生物学难题

比仪器更难的,是样本准备。长读长测序要发挥“从头读到尾”的优势,前提是提取出足够长且完整的 DNA 分子——如果 DNA 在提取或建库过程中断裂,再长的读长能力也无从发挥。超长 DNA 分子的提取、纯化与建库,涉及对物理剪切力、酶活性和样本质量的精细控制,属于典型的生物学实验难题。这也是为什么三代测序虽早在 2010 年前后即有商业化机型,却在过去十年中被二代打得“市占率不到 10%”——长读长的价值释放,受限于上游样本质量与下游算法成熟度的双重瓶颈

常见问题

三代测序和“第四代测序”是什么关系?

行业普遍共识是:单分子测序技术就是第三代测序技术。所谓“第四代”多指 Oxford Nanopore 的纳米孔技术,但业内人士认为这属于商业代际的人为划分,并无实质技术代差。

三代测序会取代二代测序吗?

短期内不会。二代测序便宜且准确率高,三代测序读长长但单次准确率仅 95%,两者当前是互补关系——二代负责广度筛查,三代负责攻克二代无法解决的重复序列与结构变异区域

长读长测序的商业化进展如何?

产业端正在加速。国际巨头 illumina 已宣布布局长读长产品;国内方面,专注纳米孔测序的初创公司齐碳生物在资本寒冬中完成 7 亿元 C 轮融资;应用端老牌企业贝瑞基因截至 2022 年底累计服务三代测序检测样本量突破 10 万人份。从基础研究走向临床转化,是长读长测序当前的明确趋势