news 2026/10/2 7:40:06

三代测序怎么选?一文读懂Illumina、PacBio HiFi与Nanopore

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
三代测序怎么选?一文读懂Illumina、PacBio HiFi与Nanopore

做基因组研究的人,几乎都被同一个问题缠住过:我手上的样本到底该用什么平台测?大约五年前,这个问题的答案还算单纯——要低成本变异检测,上 Illumina 短读长;要组装基因组,就往 PacBio 或 Nanopore 上投钱硬扛。但这几年格局变了很多:PacBio HiFi 把长读长的准确率拉到了 Q30 量级,Nanopore 的 R10 化学也冲上了 Q20+,Illumina 依旧在短读长领域不可替代。同一个项目,三种测序平台都能出报告,但预算、时间、下游分析和可发表性完全不同。这篇文章我就把“三代测序选型”这件事从原理、核心指标到应用场景完整捋一遍,也加上这些年做项目踩过的坑,给正在写方案、报预算、选平台的你一条相对清晰的决策路径。适合生信工程师、实验室负责人和刚接触测序的研究生收藏着慢慢看。

1. 三种测序平台到底在测什么:从原理看底层差异

1.1 Illumina 短读长:把海量短片段堆出统计学意义

Illumina 的原理是边合成边测序,英文简称 SBS。文库制备时,DNA 会被打断成 300 到 500 bp 左右的片段,两端接上通用接头,然后在 flow cell 上做桥式 PCR,把每一个单分子扩增成几千个拷贝的 DNA 簇。接着加入带荧光标记的可逆终止碱基,聚合酶每延伸一个碱基,仪器就扫一次荧光,四色信号对应四种碱基,一轮一轮读下去,读到 150 bp 或 250 bp 就自动终止,再读另一头,得到双端读长。

这种模式的本质是“大量短读长 + 高精度”,靠测序深度堆出统计学结论。单碱基错误率非常低,通常 Q30 以上,也就是每千个碱基错不到一个。它最大的短板有两个:一是对 GC 含量有偏好,高 GC 或低 GC 区域的扩增和测序效率都会下降;二是人类基因组和植物基因组里有大量重复区,当重复单元比读长还长时,短读长无法唯一比对,变异检测和组装到这里基本束手无策。

1.2 PacBio HiFi:同一段 DNA 反复读十几次再投票

PacBio 走的是单分子实时测序路线。SMRT 平台上每个 ZMW(零模波导)都是一个纳米级小孔,孔底固定一个 DNA 聚合酶。文库不是线性片段,而是 SMRTbell 环状结构:DNA 两端接上发卡接头,形成一个闭环。聚合酶在这个环上不停地滚环复制,同一段模板会被反复读很多圈。CCS(Circular Consensus Sequencing)算法把所有 subread 合并、比对、投票,最后输出一条高准确率的一致性序列,这就是 HiFi read。

关键点在于:原始单分子读长的准确率并不高,早年只有 85% 到 90%,但因为错误是随机的,多轮共识之后错误被互相纠正,最终准确率能到 99.9%,也就是 Q30。这就真正实现了“长读长”和“高准确率”兼得。HiFi 读长通常在 15 到 25 kb,比短读长长两个数量级,同时全程没有 PCR 扩增,GC 偏好几乎可以忽略。我自己的体验是,HiFi 下游分析很少需要“救火”,比对、组装、变异检测都有成熟流程,是三套平台里最省人工的一种。

1.3 Nanopore:让单链 DNA 直接穿“门”而过

Nanopore 是另一种思路,直接物理读序列。Oxford Nanopore 把蛋白质纳米孔嵌入一张电阻膜里,DNA 单链在电机驱动下穿过纳米孔。四种碱基以不同方式影响流过孔的离子电流,仪器记录电流波动,再通过 basecalling 算法翻译成碱基序列。既然是物理方式,读长理论上只受文库 DNA 片段长度限制,几 Mb 的超长读长已经不算新闻。

Nanopore 最亮眼的两个特性是实时测序和便携:MinION 只有移动硬盘大小,接在笔记本上几分钟就能出第一个读长。同时,电流信号本身就携带修饰碱基的信息,5mC、5hmC、6mA 可以直接测,不需要重亚硫酸盐处理。短板则是单读长准确率:R10.4.1 化学配上 Q20+ 试剂盒,raw read 准确率能到 99% 左右,比早期进步巨大,但错误模式主要是插入和缺失,同聚物区域尤其容易数错个数。想获得短读长那种 Q30 级别的单读长准确率,通常要靠 duplex 模式,或者组装和抛光后的 consensus。

平台核心机制一句话理解
Illumina桥式 PCR 扩增成簇 + 边合成边测序把一条 DNA 复制成很多拷贝,每次读一个碱基,眼睛够亮但看不清远处
PacBio HiFi单分子聚合酶在 ZMW 中滚环复制环状模板,CCS 多次共识同一段 DNA 反复读十几次再投票,读得长又读得准
Nanopore单链 DNA 穿过蛋白质纳米孔,碱基逐个改变离子电流让 DNA 链从门缝挤过去,边挤边“听”声音辨碱基

所以核心结论是:三套技术从物理原理上就不一样。Illumina 是多拷贝 + 短读长,Nanopore 是单分子 + 超长读长,HiFi 是单分子 + 滚环共识 + 长读长。它们不是“同一件事的三种套餐”,而是各自解决不同的问题。

2. 关键指标硬核对比:读长、准确率、通量与成本

2.1 读长:为什么三代总把读长挂在嘴边

读长为什么总是第一个被拿出来比?因为它直接决定两件事:能不能跨越重复区,以及组装和比对时能不能把远距离信息串起来。人类基因组大约 50% 到 70% 是重复序列,植物只会更高。如果重复单元比读长还长,比如卫星 DNA、转座子元件,短读长就无法跨越,组装时 contig 会在那里断掉,变异检测时 reads 只能随机落位。

读长越长,片段在基因组上的落点越唯一,组装越容易形成长 contig。T2T 联盟用超长读长攻克着丝粒就是最好的例子。着丝粒区域全是重复单元,短读长根本拼不上去,只有几百 kb 到 Mb 级的超长读长才能横跨过去。因此,项目里只要出现“从头组装”“结构变异”“单倍型定相”这些字眼,读长就是第一优先级。

2.2 准确率与错误模式:Q20、Q30 背后的“脾气”

先把 Q 值讲清楚:Q30 表示错误概率千分之一,准确率 99.9%;Q20 表示错误概率百分之一,准确率 99%。看起来只差一个数量级,但对单碱基变异检测影响非常大,因为真实突变频率在人群中往往只有百分之几到千分之几,测序错误如果高于这个水平,假阳性会淹没真信号。

短读长错误率最低,Illumina 单 read Q30+ 很常见,错误以替换为主。HiFi 的 consensus 也在 Q30 量级,注意这里的 Q30 指一个长读长的一致性准确率,不是单次聚合酶读数的准确率。Nanopore raw read 目前 Q20 左右,主要错误是 indel,同聚物区尤其容易出错;但经过组装或者 duplex 模式纠错,也能接近 Q30。

错误模式决定下游分析算法。GATK 是为短读长替换错误调校的,直接拿 Nanopore 的 indel 错误去跑,很容易满屏假阳性。长读长变异检测要用 DeepVariant、Clair3、Sniffles2 这类匹配错误模型的工具。这也是很多只做过 Illumina 的团队换平台后栽跟头的地方。

2.3 通量与成本:不是越贵越好,而是越匹配越好

  • Illumina NovaSeq X单次运行可以达到 Tb 级,一个 run 顶得上早期一个测序中心一年的产出,短读长的规模优势无人能比。
  • PacBio Sequel IIe单 SMRT Cell 的 HiFi 产量在数十 Gb 水平;新出的Revio整机单次运行能到 Tb 级,一个 run 可以覆盖几十个人类全基因组 HiFi。
  • Nanopore单张 PromethION flow cell 一般是 100 到 200 Gb,MinION 更低,但胜在灵活,flow cell 可以随时停,可以只跑一点点样本。

成本的大致规律是:短读长每 Gb 成本最低,长读长已经大幅下降但仍是短读长的数倍。还要注意资本开支:NovaSeq 和 Sequel 都是大型专用设备,需要独立机房和稳定供电;MinION 入门只要几千块人民币,PromethION 是几十万量级。如果实验室预算有限,Nanopore 的入场门槛明显最低。

不过必须提醒一句:“每 Gb 单价”不等于“项目总成本”。长读长建库对 DNA 质量要求高,生信要吃 CPU 和 GPU,数据存储也占地方,这些都要提前盘进预算。

维度Illumina 短读长PacBio HiFiOxford Nanopore
读长PE100/150/250 bp15~25 kb(HiFi 模式典型值)数 kb 至 1 Mb+,超长文库可达 Mb 级
单 read 准确率>99.9%(Q30+)>99%(Q20+),多数样本可达 99.9%(Q30+)R10.4.1/Q20+ 约 99%;Duplex 可达 99.9%
主要错误类型替换错误、GC 偏好随机错误插入/缺失为主,同聚物区需警惕
单 run 通量NovaSeq X 可达数 TbSequel IIe 单 cell 数十 Gb;Revio 整机 Tb 级MinION 数十 Gb;PromethION 单 flow cell 100~200 Gb
场地要求大型/中小型台式机大型专用设备从 U 盘级到整机级,部署灵活
单 Gb 成本最低中等(Revio 后大幅下探)中等偏高
实时输出否否是
原生修饰检测需要重亚硫酸盐等前置处理可检测动力学信号,灵敏度有限可直接检测 5mC/5hmC/6mA 等

2.4 时效性:能不能“边测边看”

Illumina 和 PacBio 都要跑完整轮运行,中途虽然可以取样检查,但真正可用的数据基本得等到结束。Nanopore 是真正的实时输出:测序一开始,fastq 就往硬盘里持续写,跑到能回答当前问题的最低深度就可以叫停,甚至可以关掉 flow cell 下次再用。

几年前我拿到一个突发不明原因感染的样本,用 MinION 十几个小时就拿到了能分类的 reads,换成 Illumina,光上机周期可能就要一天多。所以只要项目包含“紧急”“现场”“临床决策”这些关键词,Nanopore 的实时优势几乎是压倒性的。

3. 选型逻辑:不同应用场景的最佳方案

3.1 基因组从头组装:从细菌到 T2T 人类基因组

细菌基因组组装,现在最舒服的方案是 HiFi 30x:一条染色体基本一个 contig 闭合,质粒也常见单独环。Nanopore + Illumina 混合组装也可以用,flye 搭骨架、短读长抛光,步骤多一道,质控多一层。如果预算特别紧,纯 Nanopore 组装加 medaka 抛光也能出结果,只是重复区和同聚物要多花人工检查。

大基因组的主流方案是 HiFi + Hi-C。近两年发表的高质量动植物参考基因组,几乎都是 HiFi 底座,BUSCO 完成率轻松上 97% 以上。如果目标是 T2T 级别,就要再加 Nanopore 超长读长,专攻着丝粒、rDNA、大片段串联重复;Hi-C 负责把 contig 挂到染色体。组装项目的选型原则我总结过一句话:先保准确率再拉读长,HiFi 打底,Nanopore UL 补极端复杂区,短读长做最终抛光。

3.2 变异检测:SNV、SV 与定相的侧重点

如果项目只做 SNV/Indel 的大队列筛选,Illumina WGS 从成本到工具生态都无可动摇。短读长流程太成熟了,GATK、DRAGEN 都是标准操作,假阳性控制得很好。这时候硬上长读长,有点像拿杀鸡刀打蚊子,预算和时间都不划算。

但一旦涉及结构变异,短读长就非常吃力。50 bp 以上的插入、缺失、倒位、串联重复,短读长经常测不到或者测不准。长读长,尤其是 HiFi,能同时保证单碱基准确度和跨结构变异的能力,一个平台把 SNV 和 SV 一起解决。Nanopore 的超长读长在检测大片段 SV、STR 异常扩增时有独特优势。

另外别忽略单倍型定相。长读长天然能看到同一染色体上的连锁标记,一个人的两个单倍型可以直接分开,这对遗传病研究非常关键。短读长定相要么靠统计推断,要么靠额外加测父母样本,麻烦得多。

3.3 表观遗传与全长转录本:甲基化、异构体怎么测

甲基化研究,如果想要单碱基分辨率又价格可控,WGBS(重亚硫酸盐测序)依然是金标准,Illumina 平台生态成熟。Nanopore 的优势是免转化、直接对原生 DNA 测序,能同时保留 5mC、5hmC、6mA 等多种修饰信息,并且可以和变异检测共用一套数据。PacBio 平台也能从动力学信号推断修饰,但 HiFi 模式下的灵敏度不如专门检测,通常只适合顺带观察。

RNA 方面,常规转录组定量用短读长没毛病。但如果课题需要看全长转录本异构体、融合基因或可变剪接全貌,PacBio Iso-Seq 是标准方案。Nanopore direct RNA sequencing 能直接把转录本测出来,避免反转录步骤,代价是通量和成本都不便宜。这类课题建议根据你究竟要“定量”还是“看全长结构”来选。

3.4 病原检测、宏基因组与临床现场

Nanopore 在病原检测领域几乎是现象级的存在。实时测序加便携设备,把以前必须送检样本到中央实验室的场景,变成了现场直接输出。突发疫情、院内感染、食物中毒、ICU 不明原因感染,都能在几小时内从原始样本到菌种鉴定、分型判断甚至耐药基因筛查。不少医院的临床 mNGS 也已经把长读长作为补充方案。

如果目标是病原体全基因组闭合和精细分型,HiFi 更合适,准确率高,耐药基因定位和 MLST 分型结果可以直接拿去发文章或进数据库。宏基因组学要分开说:定量和物种丰度分析,Illumina 短读长是主力,便宜且偏差小;但从复杂群落里拼出完整的 MAG,长读长明显更能扛。

3.5 单细胞与空间转录组:为什么还是 Illumina 的天下

单细胞转录组、空间转录组,目前主力还是 10x Genomics + Illumina。原因很简单:通量匹配。10x 建库的本质是短片段扩增产物,让长读长来测没有任何优势,成本还翻倍。虽然有个别团队用 Iso-Seq 做单细胞全长转录本,那也属于特定课题,不是通用路径。这类项目直接按 Illumina 定方案即可,不用纠结三代还是二代。

4. 实操选型流程、成本估算与组合策略

4.1 一套可复用的选型决策流程

我内部经常用下面这套流程,不复杂,适合大多数实验室:

  1. 先写清楚要回答的生物学问题,落到可检测的信号:是拼基因组、找 SNV、查 SV,还是看甲基化。
  2. 看样本量:队列几十上百个,长读长可能贵;单个或家系样本,长读长更可能值得。
  3. 看参考基因组:有高质量参考,短读长可以直接比对;物种没有参考,长读长从头开始更快。
  4. 算总账:设备折旧、试剂、人力、生信、存储,不要只看试剂盒报价。
  5. 考虑时间:病样本、现场、临床决策,Nanopore 实时优势明显。
  6. 确认生信能力:长读长组装、比对、变异检测都要单独的软件栈,团队没经验就要预留学习周期。
  7. 最后检查是否需要多平台组合:纯短读长解决不了的,尽早让长读长进来,别等项目做一半再补。

总结成一句话:组装和复杂结构变异用长读长,队列、定量和单细胞用短读长,现场和紧急场景用 Nanopore;预算舒适就 HiFi 打底,预算紧张就先 Nanopore + Illumina。

4.2 常见应用的成本估算参考

下面的价格不是合同价,是近两年常见报单的大致区间,不同地区、不同代理商差异很大,关键是看相对关系。

应用推荐平台与方案单样本成本(美元,粗略)备注
人 WGS 30xIllumina NovaSeq X300~800队列规模越大单价越低
人 WGS 30x HiFiPacBio Revio500~1000官方目标已向 500 美元看齐
人 WGS 30x 长读长Nanopore PromethION700~2000视文库质量、flow cell 数量
细菌基因组闭合PacBio HiFi150~400通常一条 contig 完成
细菌基因组混合组装Nanopore + Illumina100~250流程长,多一道质控
细菌基因组纯短读长Illumina50~100难闭合,重复区易缺
16S 全长扩增子Nanopore MinION低一次 run 可混多样本
靶向 panel / WESIllumina10~100成熟流程,自动化程度高

举个例子算一笔账:细菌基因组闭合。方案 A 纯 HiFi,建库后多个样本 pooled 上 cell,单样本成本 150 到 400 美元,人工很少,开箱即用;方案 B 混合组装,Nanopore 一张 flow cell 加上 Illumina 补充,试剂和人力摊下来可能 100 到 250 美元,但要多写两套 QA/QC 流程。究竟是花钱省事还是花时间省钱,跟团队人力状态直接相关。

4.3 混合策略:长读长、短读长如何搭配

组合一:短读长 + Nanopore,经典省钱方案。Illumina 负责高准确率,Nanopore 负责长距离骨架。对大肠杆菌这类 GC 均匀的物种,flye 加短读抛光已经很成熟;但超高重复度物种要小心,抛光可能引入假变异,需要人工检查。

组合二:HiFi + Hi-C,大基因组染色体级组装的通用解。HiFi 造准确的长 contig,Hi-C 把 contig 串到染色体,结构上接近参考基因组水平。

组合三:HiFi + Nanopore UL,T2T 级方案。HiFi 保证整体准确率,UL reads 专门穿着丝粒和 rDNA,Hi-C 再做染色体挂载。这个组合产出的质量,已经接近目前顶刊参考基因组项目的水平。

下面给几个最常用的命令,都是可以直接抄的:

# Nanopore basecalling,GPU 加速,具体模型参数以 dorado 官方文档为准 dorado basecaller sup <run_dir> > reads.fastq # 长读长比对 minimap2 -ax map-ont -t 32 ref.fasta reads.fastq | samtools sort -@ 8 -o reads.bam # HiFi 组装,hifiasm 是当前主流组装器 hifiasm -o sample -t 32 HiFi_reads.fastq # Nanopore 组装,适合细菌或小基因组 flye --nano-raw reads.fastq --out-dir flye_out --genome-size 5m

不要低估 basecalling 和组装的硬件需求。dorado 推荐用 NVIDIA GPU,没有 GPU 的话,200 Gb 的长读长数据纯 CPU 跑可能要好几天,项目排期里要留出这个时间。

5. 常见问题、避坑经验与个人体会

5.1 高频问题速查

问题我的建议
预算有限但想体验长读长?先做 Nanopore 小基因组;PacBio 更适合经费充足、追求一次性高质量的场景
HiFi 和 Nanopore 到底选哪个?组装、变异精度优先选 HiFi;超长读长、实时、便携选 Nanopore
三代数据能不能直接进 GATK?不建议,用 DeepVariant、Clair3、Sniffles2 这类匹配错误模型的工具
长读长建库对 DNA 有什么要求?需要高分子量 gDNA,片段化会毁掉读长
组装项目要不要加 Hi-C?染色体级组装建议加;T2T 级别可考虑更多长程数据
甲基化应该选哪家平台?常规单碱基定量用 WGBS;需要原生多修饰、想跟变异共用数据选 Nanopore
数据存储怎么做?原始数据建议上传公共数据库,预算里留出存储费,长读长数据量不小

5.2 实操中踩过的坑

第一个坑是 DNA 质量。长读长建库对高分子量 DNA 的要求非常高,MinION 上测到一半发现读长断了,十有八九是提取时剪切力太大。提取后一定要用脉冲场凝胶或 Fragment Analyzer 检查片段分布,不要只看 Nanodrop 浓度。

第二个坑是用 CPU 跑 Nanopore basecalling。早期 Guppy 还能忍,现在 dorado 推荐 GPU 加速,数据量大之后 CPU 方案会拖垮整个项目周期。另一个是模型选错,例如做细菌甲基化研究却用默认无修饰模型,下游根本看不到修饰信号。

第三个坑是组装后不质控。不管用哪个平台,组装完一定要跑 BUSCO 和 QV 评估,再用 Bandage 看 contig 图。攒了一个月的数据,最后组装结果因为重复区错误拼接被审稿人质疑,那才是最心痛的。

第四个坑是忽略了存储和备份。一个人 HiFi WGS 30x 的原始数据加比对文件,轻松到几百 G;Nanopore raw 信号文件更是存储杀手。项目开始前没有扩容 NAS 或对象存储,测序仪一开,硬盘很快就满。

5.3 最后说点个人体会

做了这么多年测序项目,我的最大体会是:平台没有绝对的高下,只有适不适合当前问题。Illumina 像高速公路上的标准货车,运量大、成本低,但不能下公路;HiFi 像精装修的越野车,舒适稳定,能跑复杂地形;Nanopore 像一台灵活摩托,随时出发,但载重有限。很多项目不需要一开始就追求“最好”的平台,而是先想清楚终点在哪里。

最后再分享一个小建议:无论最后选了谁,先在公开数据集上跑一遍完整流程再下单。HG002、CHM13 这些参考样本都有公开的 HiFi 和超长读长数据,花一两天把比对、组装、变异检测全部验证一遍,远比听厂商介绍有用。数据质量、工具版本、生信服务器配置这些细节,才是决定你真实体验的因素。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/2 7:39:51

COMSOL网格剖分核心原理与BAW/锂电池高效建模实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/2 7:38:51

智能车差速转向与PID控制:从运动学基础到调参实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/2 7:38:42

ACPI电源问题内核调试:用断点定位服务器随机唤醒实战

手头这台代号 server03 的服务器最近凌晨固定掉电式重启&#xff0c;翻事件日志只能看到内核电源 41&#xff0c;没有蓝屏 dump。电源和 BIOS 那边的固件说明也很模糊&#xff0c;只说“睡眠状态下有 GPIO 唤醒事件持续触发”。这种问题放在系统层面分析基本是盲人摸象&#xf…

作者头像 李华
网站建设 2026/10/2 7:38:11

自建GitLab完整教程:服务器部署、内存优化与常见故障排查

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/2 7:38:10

带HALL传感器的BLDC六步换相控制:从硬件到软件全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/10/2 7:37:43

Spark真实业务落地:从伪分布式到SQL报表交付全链路

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华