三代测序(单分子测序)的准确率之所以被认为卡在 95% 左右,核心在于其“长读长、免扩增”的测序原理本身:无需 PCR 扩增意味着信号直接来自单分子,噪声更大;而读长越长,单次读取中累积的碱基识别错误也就越多。PacBio 与 Nanopore(纳米孔)两条技术路线采用完全不同的信号识别机制,其纠错路径也因此分野——PacBio 依赖聚合酶动力学与环化共识测序(CCS)模式,Nanopore 则依赖马达蛋白牵引与电流信号的模式识别算法,目前尚无官方数据证明哪条路线已率先突破单碱基分辨的准确率门槛。

两条技术路线的纠错机制差异

PacBio 技术利用零模波导(ZMW)捕获单个 DNA 聚合酶分子,通过识别 4 种不同荧光标记的 dNTP 在掺入时产生的荧光信号差异来读取碱基序列。其纠错策略在于对同一 DNA 模板进行多次环化读取,通过生成共有序列(CCS)来校正单次读取中的随机错误。

Nanopore 技术则通过蛋白纳米孔对膜两侧施加电压差产生电流,当马达蛋白(motor protein)牵引 DNA 单链穿过纳米孔时,不同碱基引起不同的电流干扰,再通过模式识别算法将电流信号翻译为碱基序列。该路线的纠错更依赖算法层面的信号解码优化,以及通过读取同一分子的两条链来提高一致性。

对比维度PacBio 路线Nanopore 路线
信号来源荧光标记 dNTP 的荧光信号碱基穿过蛋白纳米孔时的电流变化
核心部件DNA 聚合酶 + 零模波导(ZMW)马达蛋白 + 蛋白纳米孔
纠错思路环化共识测序(CCS),多次读取取共识电流信号模式识别算法优化

读长优势与“唱错”难题

三代测序被称为“长读长测序”,其核心优势在于无需扩增、可从头读到尾,理论上对测序长度没有限制,目前最长读长可达 2.4 M。这一特性使其在攻克基因组重复序列、完成完整人类基因组组装等场景中不可替代——2022 年 T2T 联盟完成的首个真正完整的人类基因组序列,以及 Nature Methods 将长读长测序评选为“年度最佳技术”,都印证了这条技术路线的独特价值。

然而,正如业内通俗比喻所言:二代测序是把歌切成三字片段再算法复原,三代测序是“从头唱到尾”,但容易“唱错字”。目前三代测序的准确率仍只能做到 95%,这一瓶颈直接限制了其在临床诊断中对单个碱基变异的高精度要求。要突破这一门槛,两条路线都需要在降低单分子信号噪声与提升碱基识别算法精度上持续迭代。

产业端的多方突围

围绕准确率瓶颈,产业端已呈现多条突围路径。行业巨头 illumina 在收购 PacBio 失败后,于 2022 年初宣布推出自己的长读长产品 Infinity,外界普遍猜测其将采用“合成长读长”的变通方式。华大智造、Element Biosciences、Ultima Genomics 等厂商也计划或已经开始布局长读长测序领域。

国产厂商方面,专注于纳米孔长读长测序的齐碳生物于 2022 年完成 7 亿元 C 轮融资;应用端老牌选手贝瑞基因则持续发力三代测序的临床应用转化,截至 2022 年底累计服务三代测序检测样本量突破 10 万人份。谁先突破单碱基分辨难题,最终仍需以各厂商后续公布的技术数据及第三方独立实测为准。

常见问题

PacBio 和 Nanopore 谁的单碱基准确率更高?

官方尚未公布两者在单碱基准确率上的直接对比数据。PacBio 依靠环化共识测序降低随机错误,Nanopore 则依赖电流信号算法优化,两条路线各有其纠错逻辑,具体表现需以第三方独立评测为准。

三代测序准确率 95% 的瓶颈会影响临床应用吗?

会影响。95% 的准确率使其在基础科研(如完整基因组组装)中表现出色,但在需要精确识别单个碱基变异的临床诊断场景中仍受限。这也是 illumina、华大智造、齐碳生物等厂商持续投入研发以提升准确率的核心动因。

国产厂商在三代测序领域处于什么位置?

以齐碳生物为代表的国产厂商专注于纳米孔长读长测序路线,2022 年完成 7 亿元 C 轮融资;贝瑞基因则在应用端推动三代测序的临床转化,截至 2022 年底累计服务检测样本量突破 10 万人份。国产力量正从设备制造与临床应用两端同步切入这一赛道。