三代测序 vs Illumina怎么选?从读长、准确率到成本的全方位选型指南

发布时间:2026/10/2 1:42:35
三代测序 vs Illumina怎么选?从读长、准确率到成本的全方位选型指南 手里预算够想直接上三代把Illumina彻底换掉——这个想法我几乎每个月都会从不同实验室的PI口中听到。PacBio HiFi和Nanopore这几年进步实在太快了特别是HiFi读长做到15kb以上还能保持Q30级别的准确率ONT的ultra-long读长动不动就冲上Mb级别乍一看二代测序确实没什么翻身余地。但真到了写项目方案、做平台选型的时候你会发现事情远没有“谁参数好就选谁”这么简单。这篇选型指南想写给三类人正准备建立自有测序平台的课题组负责人要做新项目、但被各家销售和技术支持说得越来越晕的研究者以及需要长期维护测序流程、对稳定性和数据质量负责的从业者。我会把PacBio HiFi、Oxford Nanopore、Illumina三种平台的工作原理、数据特征、成本结构和适用场景放在一起对照并给出可以直接参考的决策顺序。这里先给一个核心结论三代测序和二代不是替代关系而是各自占据不同生态位选型的第一步是搞清自己需要什么样的“数据形态”而不是在宣传参数里做单选题。1. 为什么“三代”这个词容易误导人Illumina 才是最稳定的参照系1.1 三代测序到底改了什么生物学实验室里常说的“第一代测序”是指Sanger双脱氧链终止法“第二代”指以Illumina为代表的边合成边测序SBS高通量平台而“第三代”通常被概括为单分子测序包含PacBio的单分子实时测序和Nanopore的纳米孔测序。这个代际分类本身就有历史包袱它暗示着“新的一定会取代旧的”但实际技术逻辑完全不是线性更替。三代测序真正改写的不是“读得更长”这个表面特征而是从原理上去掉了PCR扩增这个环节。Illumina测序前必须在芯片表面做桥式扩增形成DNA簇每一个荧光信号本质上是成千上万条相同模板的集体信号。PCR扩增本身有偏好性高GC区域、低复杂度区域、回文结构都会被不同程度地“歧视”这些偏差最终会以测序深度不均和错误的形式呈现在数据里。PacBio的SMRT技术和Nanopore都是直接对单条DNA分子进行“物理读取”没有扩增步骤所以天然绕开了这类偏置同时还能观察到单个分子上的碱基修饰信息。这也解释了为什么很多做结构变异和重复区域研究的团队会对三代测序“上瘾”不是因为三代数据更漂亮而是因为只有单分子测序才能跨过那些Illumina永远看不透的复杂区域。1.2 对比要先看“数据形态”而不是宣传口号选平台之前我习惯先让合作者看一张最简单的数据形态对比表而不是看任何一家的官方宣传页。因为三代测序里的PacBio和Nanopore虽然都被归类为单分子测序但它们输出的数据形态、准确率结构、以及后续分析策略几乎是完全不同的物种PacBio HiFi产出的是“又长又准”的共有序列单条read的准确率就能达到Q30以上不需要像老式长读长那样依赖后期的纠错步骤Nanopore产出的是极长的单分子reads长度上限能够覆盖人类基因组里最顽固的重复区但单条read的准确率仍然需要靠测序深度、链测序或者组装后的polish来弥补Illumina产出的是极短的成对reads单条read准确率高、总量便宜但读长天花板就摆在那里。把三种平台放在同一张表格里横向比“准确率”是没有意义的因为它们的准确率定义和可用场景根本不在一个维度上。选型的正确姿势是先确认你的下游分析到底依赖读长、依赖准确率、还是依赖总通量数据维度PacBio HiFiONTNanoporeIllumina典型读长15–25 kbHiFi模式数kb到1 Mb以上ultra-long记录可达Mb级50–300 bp最常用2×150 bp单read准确率99.9%Q30部分可达Q40R10.4孔最新basecaller约Q20单read质量高常见Q30共有序列准确率极高单分子多圈共识序列取决于深度和polish策略可接近Q40极高但有扩增偏置单run通量量级Revio约90 Gb HiFi/run数十Gb到数百Gb/run依设备而定NovaSeq可达6 Tb以上/run核心优势长读长高准确率无PCR偏置最长读长实时测序便携直接测修饰高通量、成本低、生态成熟核心瓶颈仪器和单碱基成本高需要高分子量DNA单read错误率仍需深度矫正读长短重复区与结构变异识别困难这张表不是用来选“最好的平台”而是用来定义“你的项目能容忍哪种短板”。接下来我从原理层面把三家的技术特征拆开讲透理解了原理之后那些销售话术里的“神奇参数”就不会再干扰你判断了。2. 三种平台的核心技术差异读长、准确率、通量如何取舍2.1 PacBio HiFi为何能同时拿到长读长和Q30PacBio的SMRTSingle Molecule, Real-Time技术核心是一个叫做零模波导孔ZMW的纳米级小孔结构。每个ZMW相当于一个极小的反应室底部固定一个DNA聚合酶分子当一条经过发卡接头环化后的单链DNA模板SMRTbell结构进入时聚合酶会一边复制一边发出荧光脉冲信号。由于ZMW的孔径比激发光的波长短只有靠近孔底的区域才能被照亮所以即使反应体系里只有一条DNA分子在合成信号也能被清晰地采集到。HiFiHigh-Fidelity读长的关键不在ZMW本身而在于SMRTbell的环形结构。建库时DNA片段两端会被接上一个发卡型接头形成闭合的环状单链模板。聚合酶读取这个环状模板时会绕着一圈一圈地复制读一遍、再读一遍、又读一遍。测序仪把同一个分子多次pass产生的子读段合并成一个共有序列Circular Consensus Sequencing简称CCS这个任务交给平台内置软件处理后输出的就是HiFi read。用一个生活化的类比你让一个人听一段很长的电话录音只听一遍可能记错几个词但如果把同一段录音循环播放十遍让他把每次听到的内容对照着写下来最后得到的版本就会非常可靠。HiFi就是让机器对同一个DNA分子“听”多遍再综合判断。多轮共识的过程将随机错误摊薄了所以才能做到单条read就有99.9%以上的准确性同时保留15kb到25kb的可观读长。对选型的直接意义是HiFi适合那些既需要跨过较长重复区、又不想在后期投入大量纠错工作的项目。比如一个哺乳动物基因组的从头组装用HiFi数据跑一遍Hifiasm得到的contig N50动辄几十MbBUSCO完整度通常能到95%以上这在几年前是难以想象的。代价则是仪器贵、单碱基成本目前仍显著高于Illumina。2.2 Nanopore读长上限与单分子信号的代价Nanopore的路线和PacBio完全不同。ONT在技术上不依赖光学成像而是把一种经过改造的蛋白纳米孔嵌入电阻膜上孔道两侧施加电压形成稳定的离子电流。当DNA分子穿过纳米孔时不同的碱基组合会对电流产生特征性的扰动测序仪把这些电流变化记录下来再由basecaller算法常见的是Dorado把电信号翻译成碱基序列。这个机制带来三个显著特征。第一没有“合成”这一步所以聚合酶的速度不构成读长限制。DNA分子只要能完整地穿过孔道就能被读下来所以ONT的读长上限只取决于你怎么提取和制备DNA。我见过用Nanobind这类大分子量提取方案做出来的ultra-long文库最长reads超过2Mb把人类染色体上几万bp的串联重复区域一次跨完。这对重复序列的组装非常重要也是ONT在T2T完成图中不可替代的原因之一。第二电信号比荧光信号“脏”。DNA通过纳米孔时的速度并不完全均匀碱基修饰也会干扰电流模式所以单read准确率一直比HiFi低一个档次。虽然R10.4化学版本配合最新basecaller已经能稳定跑到Q20但遇到均聚物比如连续一串A和甲基化修饰区域错误依然集中。实际项目里ONT数据通常需要30x以上的覆盖深度来支撑组装一致性或者用链测序duplex来提高单分子准确率。第三电流信号本身携带修饰信息。纳米孔直接把甲基化胞嘧啶5mC等修饰对电流的影响记录下来了所以ONT可以在测序的同时“顺手”给出表观修饰图谱不需要像Illumina那样做单独的亚硫酸盐转化文库。对想在同一批数据里既看序列、又看甲基化的研究者来说这能省掉大量成本和建库时间。选型上ONT最不可替代的场景是**“需要超长读长”和“需要实时/便携”**这两类。它的劣势也很明确如果项目目标是海量样本的常规变异筛查让它和Illumina拼单位成本的准确碱基产出目前依然不划算。2.3 Illumina通量和成本碾压级短板也来自同一源头Illumina的边合成边测序可以概括为四个步骤建库时把DNA片段两端接上接头与芯片表面的寡核苷酸互补杂交经过桥式扩增在局部形成几千到几万条相同序列的DNA簇随后向反应体系中加入带有可逆荧光基团的核苷酸每轮只延伸一个碱基合成后对芯片拍照记录荧光颜色再把荧光基团切除进入下一轮。这套体系最大的优势是极度成熟的工业化和极度低廉的碱基成本。NovaSeq 6000一次run可以产出6Tb以上的数据一个人全基因组30X的试剂成本已经被压到几百到一千美元量级这是PacBio和ONT目前都做不到的。Illumina的测序错误率也很低主流平台单read Q30比例通常在85%到95%以上处理SNP和InDel这类小变异时表现极稳。但成也簇生成、败也簇生成。Illumina的读长受限于桥式扩增效率和可逆终止子化学反应的同步性目前商业平台最多做到2×300 bp绝大多数用户稳定使用的是2×150 bp。这个读长决定了它根本不可能跨越Alu元件、LINE1、segmental duplication这类几百bp到几十kb的重复结构。同时簇生成阶段PCR扩增带来的GC偏置无法根除极端GC区域深度容易塌陷这些区域想靠增加测序深度去“硬补”往往事倍功半。所以Illumina在选型中的位置其实非常稳固需要高通量、低单价、群体级的常规变异检测与转录组定量它是默认起点。只有当你明确知道自己的研究问题跟重复区、结构变异、全长转录本或单倍型分相有关时才需要考虑引入长读长平台。3. 不同应用场景的最优平台怎么选3.1 基因组组装完成度目标的等级决定了平台组合组装思路里有一个经验法则你定的组装目标等级直接决定了长读长平台的占比。如果只是想拿到一个物种的scaffold级别参考基因组过去用Illumina 光学图谱也勉强能拼出来但现在几乎没有新项目还会这么干了。细菌基因组组装是目前长读长门槛最低的入口一个大肠杆菌基因组大约5MbONT一条ultra-long read就能覆盖整个基因组长度跑一轮组装就能把环状染色体闭合掉再用Illumina短读长或者PacBio HiFi做一遍polish纠错得到的完成图质量已经足够发表。如果预算够而且追求“一把过”直接用HiFi也完全可以不仅准确率高建库和分析流程还更省心。到了真核基因组情况就复杂了。鸟、鱼、哺乳动物这类基因组我的默认组合是PacBio HiFi Hi-C。HiFi负责生成高质量的contig骨架Hi-C数据负责把contig排序、定位到染色体水平。如果物种基因组里有特别顽固的重复区比如着丝粒、rDNA簇、片段重复等大概率还得额外补一部分ONT ultra-long数据来跨越这些gap。T2T端粒到端粒级别的项目更是直接把“ONT ultra-long加HiFi”作为标配因为只有ONT的极长读长才能把那些几十kb乃至上百kb的同向串联重复区连接起来。植物基因组的选型还要多考虑一件事倍性和杂合度。高杂合植物基因组里两个单倍型之间的差异常常超过1%短读长组装会被绕晕HiFi因为有足够长的上下文反而能把两个单倍型清晰分开再用 trio binning 或 strand-seq 辅助分型组装质量会大幅提升。所以组装场景的选型口诀是小基因组看ONT就行复杂真核放HiFi做主力极端重复区补ONT ultra-long最后用Hi-C把所有contig锚定到染色体。3.2 变异检测SNP、InDel、SV、STR的偏好完全不同做变异检测的人最容易踩的坑是把所有“变异”都当成一个东西来选平台。实际上SNP、InDel、结构变异SV和短串联重复STR对读长和准确率的需求天差地别。SNP和50bp以内的小InDel是目前Illumina统治力最强的领域。全基因组关联分析GWAS动辄几千上万个样本只有Illumina能把成本压到可行范围内。即使在一个位点层面短读长也能凭借高深度获得足够的置信度。但如果样本量很小、目标是罕见病诊断级别又希望把每个变异位点都“钉死”我会更倾向于用HiFi或者至少用长读长做覆盖验证因为单分子Q30数据在杂合突变和复杂区域的直接可解释性远优于短读长。结构变异是长读长真正拉开差距的领域。SV的定义就决定了短读长在它面前很无力一段超过1kb的插入短读长根本不知道它插在哪、插了多少一段倒位或者大片段缺失短读长的断点信号常常是模棱两可的。ONT ultra-long和HiFi都能直接跨过SV全长看清完整的序列上下文。如果项目关注的是断点的碱基级精确性HiFi表现更稳如果项目关注的是一些异常巨大的重复扩增比如脆性X综合征里FMR1基因的CGG重复数ONT的超长读长是更合适的选择因为它能把整个重复区完整读下来数清楚重复次数而不会像短读长那样在扩增区域直接断裂。3.3 转录组与表观遗传全长转录本、isoform、甲基化分别该信谁转录组方向的选型其实已经非常分化了。做基因表达量差异分析最成熟、性价比最高的还是Illumina RNA-seq。这是几万个实验积累下来的标准化数据处理流程定量准确、背景噪音低、价格便宜。用三代测序去做表达定量属于“拿着大炮打蚊子”既贵又未必更准。但如果目标是搞清楚“某基因到底有多少种剪切异构体isoform”Illumina的短读长就无能为力了。PacBio的Iso-Seq技术可以直接测全长cDNA一条read就是一个完整的转录本序列它绕过了短读长拼接转录本的难题可以不依赖参考基因组或者矮参考注释准确鉴定出新的isoform结构。ONT的direct RNA测序更进一步直接读取RNA分子本身意味着可以检测RNA上的碱基修饰代价是通量偏低、建库需要较多起始RNA。表观遗传方面常规全基因组甲基化分析WGBS目前还是Illumina的主场亚硫酸盐转化加短读长的组合流程成熟且定量稳定。但如果不想破坏DNA模版想在单分子层面看原生修饰状态ONT是直接读数最方便的方案PacBio的动力学信号也能提供甲基化信息但通常需要更高覆盖度才能把修饰位点定位准。我的经验是转录组和表观项目的核心不是“测序平台酷不酷”而是“修饰信息、isoform结构、定量精度这三者里你到底保哪一个”。把需求优先级排清楚平台自然就出来了。3.4 宏基因组与临床快速检测速度和准确率也该分场景宏基因组测序有一个Illumina用户天天都在怀念、却永远等不到的特性实时出结果。Nanopore的MinION插在笔记本电脑上就能跑电信号边测边转成碱基序列测到第2个小时可能就能看到某类病原体的信号这个特性对感染类样本的临床快速判断和野外现场检测是压倒性的优势。很多医院检验科和疾控中心现在配置ONT设备并不是因为它比Illumina便宜而是因为“快”本身在临床上就是价值。宏基因组组装又是另一回事。如果目标是拿到一批高质量MAG宏基因组组装基因组深入研究微生物群落功能我认为HiFi是目前更合适的主力平台。宏基因组样本里包含几十甚至上百种微生物序列之间高度混杂如果单独依靠低准确率的长reads组装软件的纠错负担会急剧增加。HiFi的高准确率让组装结果更干净binning之后得到的MAG完整度和污染率指标通常更好。当然ONT ulta-long也可以作为宏基因组组装的bridge reads帮助连接contig之间的gap很多高完整度MAG项目就是HiFi加ONT的配合打法。所以宏基因组实际的选型不是“选一个”而是先问自己“我要的是速度还是组装质量”。应用需求首选平台备选/辅助平台选择理由细菌基因组闭合ONT ultra-longIllumina纠错 / HiFi长读长轻松覆盖完整复制子并确认环状结构复杂真核基因组组装PacBio HiFi Hi-CONT ultra-longHiFi准确度高Hi-C锚定染色体ONT跨极端重复大规模人群SNP/InDel筛查IlluminaHiFi小样本高精度通量和成本优势无可替代结构变异/STR研究ONT ultra-long / HiFiHiFi用于断点精确定位长读长直接跨越变异和重复单元全长转录本与isoform鉴定PacBio Iso-SeqONT direct RNA可测全长cDNA或RNA单分子分辨剪切体常规转录组定量Illumina RNA-seq无成熟、稳定、深度高、成本低全基因组甲基化定量Illumina WGBSONT / PacBio亚硫酸盐方案成熟三代方案可见原生修饰感染/现场快速检测ONT无实时测序可便携边测边分析宏基因组MAG组装PacBio HiFiONT ultra-long准确长读长利于拼接和binning4. 成本账里最容易忽略的四笔钱4.1 单碱基成本之外的“有效数据率”很多课题组在听销售介绍时只会听到一个词“单碱基测序成本”。但真实项目里比单碱基成本更重要的指标是有效数据率——你付钱的那些碱基里有多少最终能真正进入后续分析。Illumina单碱基成本极低但对组装项目来说如果只能产出150bp短reads它在重复区和复杂结构上能提供的信息极其有限那些数据在组装里几乎等于废数据。ONT看起来单碱基成本不算特别高MinION的入门设备甚至只要几千美元但低准确率决定了你需要更高覆盖度来换取一致序列的可靠性而且basecalling、纠错、polish这几道工序的算力和人力成本比你想象中大得多。HiFi的单碱基价格目前还是三者里最高的但它的数据“用起来省心”——单read达到Q30意味着很多分析不再需要额外纠错环节一次成功的run就能直接支撑高质量的组装和变异检测。我在多个项目里总结下来真实项目的总成本排序通常是这样的HiFi ONT Illumina但“单位有效信息量成本”的差距远没有名义碱基价格那么大。选型时不要被“便宜”两个字带跑先算算多少倍覆盖度是你项目真正需要的。4.2 建库与样本质量三代对DNA质量的要求远超预期这也是目前送测项目里返工率最高的环节。Illumina对DNA质量相对宽容降解严重的样本也常常能凑合出数据——虽然质量会有折扣但好歹有数据可用。三代平台就不一样了尤其ONT的ultra-longDNA的完整性直接决定读长上限。我见过一个极端案例合作方提取DNA时用了常规涡旋混匀还多次冻融结果常规手法下ONT读长中位数还能有20kb这批样本最终读长N50掉到3kb以下。原因就是高分子量DNA在物理剪切力下断裂得厉害而ONT本身能读多长全看文库里的分子有多长。做ultra-long文库要用宽口枪头避免涡旋轻轻颠倒混匀提取方案优先选Nanobind磁珠法或者优化的酚氯仿法提取完后一定要跑脉冲场电泳或TapeStation确认片段大小分布主带不明显就宁可重新提取也不硬上。PacBio HiFi建库虽然没有ONT对超长片段那么极端但SMRTbell建库的环化效率对DNA纯度、盐离子残留都很敏感。RNA污染、糖原残留、某些勾兑型DNA提取试剂盒里的杂质都会让连接效率降低最终表现为文库产量低、测序数据量不够。我现在的习惯是所有长读长项目在正式建库前先拿1μgDNA跑一遍Qubit和片段分布确认纯度合格后再进入正式流程。这一步花不了多少钱却能避免整个批次返工。4.3 生信分析是隐藏成本预算表上最容易少写的一项不是测序本身而是生信。三代数据的分析再不费力也远没有到一个浏览器插件能搞定的程度。Illumina这边工具链成熟度最高从比对到变异检测再到注释每个环节几乎都有被验证过无数次的GATK最佳实践流程普通服务器就能跑存储压力可控。ONT那边需要认真考虑的是计算资源和存储。basecalling这一步用CPU跑速度极慢最好有NVIDIA GPU跑Dorado原始数据的pod5或fast5文件体积很大加上basecalled后的FASTQ、比对文件、组装中间文件一个run下来吃几个TB存储非常正常服务器满了才发现根本来不及重测。PacBio HiFi的分析反而相对干净主流的Hifiasm、pbmm2、DeepVariant长读长模块对硬件要求也不算离谱但一次大基因组组装还是要准备至少256GB内存的机器尤其是杂合基因组项目内存不够时会频繁卡死在graph construction阶段。所以我给项目算成本从来不看测序报价单而是把“测序费建库返工风险生信人力和服务器”一起打包估算。只盯着测序单价做决定很可能在最后一步因为分析不过关导致推倒重来。4.4 仪器采购与凑样压力还有一个常被忽略的财务问题是“要不要自己买设备”。MinION让很多人误以为长读长门槛很低但如果你手里的样本量达不到“稳定高频上机”买设备反而比送测序服务更费钱。Illumina NovaSeq一次run的通量巨大凑不够样本就得等或者为别人家的样品“填坑”也在无形中增加单样本的周转成本。PacBio Revio这类设备采购和维保费用都很高小课题组自购基本不现实更多是放到测序中心或者大型平台去共享。我自己给Lab的建议很简单年样本量没有达到让设备至少每月运转一轮就不要想着自购老老实实找靠谱的中心或者商业平台送测。把固定成本转移成按项目付费资金使用效率要高得多。5. 实战打法HiFi、ONT、Illumina 混搭的经典框架5.1 T2T基因组HiFi Ultra-long ONT为什么是最经典的组合T2T端粒到端粒完成图是近几年基因组组装的最高目标而几乎所有公开的T2T级别物种项目都选择了HiFi加ONT ultra-long的组合这背后有非常清晰的逻辑。HiFi的优势是准确率高、GC偏置小但它的单条read长度在15到25kb左右遇到人类基因组里那些几十kb甚至上百kb的同向串联重复区域还是会被重复单元之间的“迷宫”绕晕无法确定reads之间的重叠关系。ONT ultra-long动辄几百kb到Mb级别的读长可以一把抓住一个完整的重复区域直接跨越过去从而解决组装中最后也是最难的一段“拼图”。这两个平台组合起来一个负责全局的准确骨架一个负责突破最硬的重复区间再配合Hi-C数据把contig锚定到染色体最后剩下极少数复杂区域再用遗传图谱或光学图谱辅助整套流程已经是公认的T2T标准路线。如果预算有限又非要挑战T2T我只用ONT ultra-long做超深覆盖也是能出结果的但需要极高的计算代价而且最终准确率很难达到HiFi加持后的水平。就我实际经验来看HiFi加ONT的方案能省下大量组装后的纠错工作整体项目周期反而更短。5.2 细菌基因组ONT Illumina纠错 vs 单平台 HiFi细菌基因组组装是很多实验室第一个接触长读长的场景它的成本敏感度也很高所以这里通常有两个选择。第一种是预算友好型ONT跑一个ultra-long文库覆盖度不需要太高30到50x已经足够把基因组闭合拿到组装草图之后用一份便宜的Illumina数据做polish把ONT reads里的碱基错误修正掉。这套打法的单样本成本可以压到很低流程也成熟缺点是多了一道Illumina建库和数据分析的工序。第二种是省事型直接用PacBio HiFi测一个细菌样本一轮run可以混合很多样本做barcoding得到的数据准确率极高组装之后几乎不需要额外纠错直接就是一个闭合完整的环状基因组。单价确实比第一种贵但省下来的分析和试错时间对很多追求高通量的微生物组学平台来说是值得的。我个人的建议是如果团队只是偶尔做几个细菌基因组选ONT加Illumina的互补方案更划算如果细菌基因组是长期稳定的业务流HiFi的效率和可重复性更值得投入。PacBio的自动化建库流程现在做得已经相当成熟操作人员的上手成本远低于几年前。5.3 大型人群队列短读长做初筛长读长做验证大型人群队列的基因组研究有一个绕不开的现实样本量动辄几千到几十万如果都上HiFi或者ONT预算会直接爆炸。所以在队列里正确的做法是分级策略。第一阶段用Illumina全基因组测序对所有样本做统一标准的高通量初筛重点获取SNP、小InDel以及已知可识别的拷贝数变异信号并建立样本级的变异数据库。第二阶段针对初筛中发现的候选结构变异、复杂STR区域、或者单倍型分相不确定的位点挑选有代表性的样本用HiFi或ONT做长读长验证或局部区域的高深度测序。这种打法的核心收益是短读长覆盖“面”长读长解决“点”。它既保证了整体队列的通量和成本可控又在关键区域获得了长读长的决定性地基序列。现在很多大型国家基因组计划实际上就是这么设计的。如果你手头也有一个中等规模的队列项目不必纠结于“全用三代测序”把长读长当作一个精准补充和验证工具投入产出比要高得多。6. 我的选型决策顺序与踩坑记录6.1 我每次做新项目都会先问自己五个问题这些年做了很多次平台选型之后我固化出一套自己的判断顺序分享出来可以直接套用第一问我的生物学问题需要“长度”、需要“深度”还是需要“通量”这个答案基本就能把三代和二代分开。研究重复区和结构变异读长就排在第一位研究低频体细胞突变深度优先研究群体规模的变异频率通量优先。第二问我对最终序列质量的目标是什么是想拿到一个“能发表”的草图还是“金标准”级别的完成图如果目标是完成图级别长读长的占比就必须足够高甚至直接上双平台长读长。第三问样本数量和起始DNA质量允许我失败多少次有些临床样本DNA本来就极端降解这种样本你再怎么追求读长也只是空谈必须选择对样本质量容忍度更高的平台或策略。第四问团队有没有能力跑通相应的分析流程有GPU、有存储、有生信人员ONT才值得认真考虑团队以湿实验为主、分析能力薄弱HiFi加成熟商业云流程的路径会稳妥得多。第五问如果预算只够做一次测序我选择哪个平台“最少后悔”这个问题逼着你在所有约束条件里做一个最保守的决策。很多情况下HiFi是最不后悔的长读长选择因为它既保证了读长又保证了准确率数据几乎没有“废掉”的可能而ONT是当你明确知道自己需要超长读长或实时时才会选择的方向。6.2 几个亲身踩过的坑第一个坑是ONT ultra-long读长断崖。前面提过涡旋混匀导致读长从20kb级掉到3kb级的问题这真的是最典型的“湿实验一个动作毁掉整个run”的案例。之后我给所有合作方的操作手册里都写明高分子量DNA提取后绝对不涡旋、不反复吹打离心和混匀都改用宽口吸头宁可慢也不求快。第二个坑是低估了ONT数据的存储和计算成本。有一次一个PromethION run的原始pod5加上后续分析文件几天时间吃掉了整个集群将近10TB空间。从此以后我的项目预算里都会单独划一笔“数据管理和计算费用”而不是默认集群“应该够用”。第三个坑是用了Illumina reads直接去polish ONT组装结果。这里有个底层逻辑问题Illumina的短读长在重复区域会产生错误的比对信号而这些错误恰恰会污染组装结果。真正效果更稳的polish方案是优先用HiFi这类高质量长读长数据或者用专门设计的多平台polish工具链而不是简单地把所有短reads一股脑align上去。吃过一次亏之后我现在任何组装项目的polish策略都会先做平台差异分析再决定用哪份数据干这件事。第四个坑是版本和chemistry的切换。ONT的孔版本从R9到R10.4basecaller模型一更新旧的比对和分析参数可能就不再适用PacBio从Sequel到Revio也经历了好几轮chemistry变化。做长周期项目时一定要在方案里写清楚“使用哪个chemistry和basecaller版本”否则几个月后回头补数据时会发现新旧数据的错误模式完全不兼容分析起来非常痛苦。说到底三代测序选型的答案从来不是“谁最先进就选谁”而是**“哪种数据形态最能直接回答我的生物学问题”**。我把这套逻辑整理成一句话先定质量目标再配平台组合最后用预算和分析能力约束边界。PacBio HiFi、Nanopore和Illumina这三家在未来几年还会继续迭代价格也会继续下探但“读长-准确率-通量-成本”这个权衡框架不会过时。新项目启动前把样品量、DNA状态、目标质量、分析能力这四件事先摆上桌面你会发现选型其实没那么纠结。