news 2026/10/4 12:24:42

Sanger、NGS还是三代测序?教你根据应用场景选对平台

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Sanger、NGS还是三代测序?教你根据应用场景选对平台

1. 为什么"一台测序仪走天下"在实操中根本不成立

如果只看宣传材料,很容易产生一种错觉:三代测序都出来了,一代、二代是不是该进博物馆了?但我在实验室里真实跑过三年各种测序平台之后,可以很明确地说:这个想法会把你坑得很惨。

我见过最典型的翻车场景,是一个课题组想研究某个物种的基因组结构变异,负责人听说"三代测序读长最长、信息最全",二话不说上马了三代平台。结果样品DNA提取质量不够,高分子量DNA片段全断成了几百 bp的碎片,几十万的测序费用砸下去,最后组装出来的基因组contig N50还不如别人用二代数据拼的好。原因很简单:三代测序的长读长优势,从DNA抽提那一步就已经决定了。

选择测序平台,本质上不是选"哪一代最好",而是选"哪一个平台能回答你的科学问题或临床问题"。Sanger、NGS、三代长读长测序,本身对应的是完全不同的任务场景,它们之间的关系更像是扳手、螺丝刀和电钻,而不是旧版本和新版本的替代关系。

要做这个判断,先搞清楚三者的核心矛盾:一代测序赢在单碱基准确度和单次反应的便捷,但通量提不上去;二代测序赢在中高通量下的成本均摊,但读长短、依赖PCR扩增;三代测序赢在读长和单分子信息,但单位数据的成本、对样品质量的要求、下游分析的复杂度都不是新手可以直接上手的那种。

这篇文章我不打算给你堆技术名词,而是站在实际选型和使用体验的角度,把三代测序的底层逻辑、优缺点、真实应用场景,以及我在实际项目里踩过的坑,一次性说清楚。看完之后,你再遇到"该用哪代测序"的问题,至少能自己做判断,而不是被别人带着走。

2. Sanger测序:公认的"金标准",但为什么只用在特定环节

2.1 双脱氧终止反应的原理,一句话就能说清

一代测序的学名叫"双脱氧链终止法",是Sanger在1977年提出的。它的思路非常朴素:DNA聚合酶在合成新链的时候,如果掺入的是正常的脱氧核苷酸(dNTP),链可以继续延长;如果掺入的是双脱氧核苷酸(ddNTP),因为核糖的3'位缺少羟基,链的延伸就到此为止。所以只要把四管反应分别加入标记了不同荧光的ddATP、ddTTP、ddCTP、ddGTP,每个延伸中的DNA链就会在不同的碱基位置随机终止,产生一系列长度相差一个碱基的片段。最后用毛细管电泳按大小分离这些片段,荧光信号一读,就能从短到长依次还原出模板的碱基序列。

这个原理听起来很简单,但它保证了每一轮测序反应的每一个碱基都是"逐一验证"的,而不是靠统计学拼出来的。这就是为什么Sanger至今还是公认的核苷酸序列判读"金标准",在临床检验和法规监管场景里,Sanger的结果几乎被默认当成最终裁决依据。

2.2 优点和局限,都要放在任务里看

Sanger最突出的优势是读长和准确度。一次性可以读到700~1000 bp,单碱基准确度在高质量区间可以做到99.99%以上(对应Phred分数Q40甚至更高),而且对模板的GC偏好、重复序列的容忍度都比NGS好得多。另一个容易被忽略的优势是成本结构:如果你只需要验证一两个位点,做一个Sanger反应只需要几十分钟、几十块钱,而上一台NGS跑一圈,不管目的区域多小,都要承担建库加测序整条流程的成本。

但它的缺点也拦不住:通量太低,一次一个反应只能读一个片段。哪怕是做96个样本的单个位点验证,看起来也还行,可一旦要同时筛查几十个基因的上百个外显子,Sanger的人工成本和试剂消耗会直线攀升。还有一个实际问题:Sanger对混合模板的敏感度不高,一般只能可靠检出比例在20%-30%以上的突变。也就是说,样品里如果只有5%的细胞携带突变,Sanger很可能给出一个模糊的杂峰,甚至直接漏掉。

2.3 现在还在大规模用Sanger的场景

Sanger真正不可替代的场景,是"验证"而不是"发现"。我在临床上接触最多的用法是针对NGS检出的位点做正交验证:NGS给出一个低频突变,但实验室规范要求换一种原理独立验证,这时候Sanger仍然是最合适的选择,因为它独立于NGS的文库构建和生物信息分析流程,能有效避免NGS系统误差带来的假阳性。

另一个常用场景是单基因病的Sanger测序诊断,比如地中海贫血、遗传性耳聋这些基因比较明确、位点相对集中的项目。在这种场景下,Sanger流程简单、成本可控、结果判读直观,拿到的序列文件直接人工核对,不需要一堆PGx注释工具和变异过滤管线。法医DNA分型里做STR/SNP(短串联重复序列/单核苷酸多态性)确认、质粒测序和克隆验证,也基本是Sanger的地盘。

说句实话,Sanger不是不能做大规模,而是比不过NGS的规模化优势;但它做得好的那些小任务,NGS硬要顶上反而更贵更慢。这就是我为什么一直不赞成"用代际判断工具优劣"的原因。

3. NGS的高通量优势,是靠哪些代价换来的

3.1 循环测序和簇扩增,奠定了成本与通量的基础

二代测序的英文名更好理解:Next Generation Sequencing,下一代测序。它的核心技术路线是"边合成边测序"。以目前最普及的Illumina平台为例,DNA片段两端接上接头之后,在flow cell表面通过桥式PCR扩增,形成成千上万个相同的"DNA簇"。每个簇里的模板是单分子DNA的克隆拷贝,机器在合成过程中逐个碱基加入荧光标记的可逆终止子,每加入一个碱基就拍一次照,然后切掉荧光基团和终止基团进入下一轮。这样一来,一个flow cell上数百万个DNA簇可以同时被读取,通量直接比Sanger提升了好几个数量级。

类似的还有华大智造的DNBSEQ技术,用滚环扩增形成DNA纳米球,以及Ion Torrent的半导体测序,通过检测DNA聚合过程中释放的氢离子浓度变化来识别碱基。虽然各有细节差异,但共性都很明显:大量片段平行测序,单碱基成本比Sanger低几个数量级,这是NGS能横扫市场的根本原因。

3.2 读长短、依赖PCR,这两个缺点要认真对待

NGS最核心的代价是读长。早期的SE50、SE75现在基本被PE150(双端各150 bp)取代,但即使双端测序拼接成一条约300-500 bp的片段,依然处理不了基因组里的长片段重复区、大段结构变异和高度同源的基因家族。我做过一个家系全外显子组测序项目,里面有一段2 kb左右的复杂重复区,NGS数据比对之后覆盖度为0,后来用Sanger逐段扩增才补出来。这种区域在人类基因组里不少,遇到就别指望NGS能给你准确答案。

NGS第二个隐性问题是"PCR扩增带来的偏向性"。建库阶段需要PCR扩增来放大信号,扩增本身对GC含量高的区域更不利,对极端GC区域会有系统性丢失;扩增还会引入错配和嵌合体,虽然概率低,但低频突变检测场景下这些噪声就不是小问题了。另外,NGS测序错误在序列末端容易升高,我常跟团队里的人说:"前150个碱基可信度很高,第二个150的碱基质量要睁大眼睛看。"

3.3 应用场景全,但每个场景的开销逻辑不一样

NGS的应用广度,目前没有任何一个平台能比得过:

  • 全基因组测序(WGS):以30X以上深度为基准,用来做结构变异、突变图谱、微生物鉴定与溯源这类全景式扫描。
  • 全外显子组测序(WES):成本比WGS低很多,适合锁定编码区突变,特别在罕见病家系研究里性价比极高。
  • 靶向panel测序:只富集与疾病相关的几个到几百个基因,深度可加到500X-1000X,低频突变检测能力最强,是肿瘤基因检测的主力方案。
  • RNA测序、甲基化测序、染色质免疫沉淀测序(ChIP-seq)、宏基因组测序:这些场景要么依赖NGS的数字定量优势,要么依赖文库构建流程的成熟度,在可见范围内都没有替代方案。

但这里有个容易被忽略的维度:NGS最便宜的时候,是你要处理的项目规模足够大,能把机器运行成本、建库试剂、分析人力都摊薄。如果一个小课题组每个月只有一两个样本要做,那每次开机都得攒样本,或者花钱外包拼机,最后算下来单样本成本反而不是最经济的。

4. 三代测序的"长读长",凭什么能被单独拎出来

4.1 单分子测序,绕过了PCR扩增的瓶颈

三代测序之所以被单独归为一代,核心不是"读得更长"这么简单,而是它从根本原理上改写了测序的逻辑:不再需要先PCR扩增产生克隆簇,而是直接对单个DNA分子进行测序。PacBio的SMRT技术用零模波导孔(ZMW)束缚DNA聚合酶,酶一边合成一边发光,记录荧光脉冲的时序来识别碱基;Oxford Nanopore则让DNA单链穿过一个纳米孔蛋白,通过不同碱基引起的电流变化特征直接判定序列。

这两个路线有一个共同的突破:读长不受PCR效率限制。Nanopore的极限读长甚至可以达到数百kb到Mb级别,PacBio常规也能做到15-25 kb,HiFi模式则在这个基础上产生高准确度的长读长序列。这种"单分子级"信息还带来一个额外好处:DNA骨架上的碱基修饰可以被直接读出,不需要另外做甲基化建库。对于想同时看序列和修饰的研究者来说,这个特性省了一大截工作量。

4.2 优点讨喜,但"贵"和"复杂"是真实的门槛

长读长的最大价值在于搞定NGS完全无能为力的基因组区域:高度重复序列、结构变异、端粒着丝粒区域、复杂单倍型。人类基因组计划用NGS完成了92%的序列,剩下的8%恰恰是这些区域。T2T联盟靠三代测序把最后约2亿个碱基补齐的时候,做的那些技术上"拼图"的突破,放到临床和农业育种里都有直接价值:复杂肿瘤结构变异、高杂合基因组的单倍型分型、复杂病原体全长基因组,这些用NGS做会非常痛苦,用三代测序就能相对优雅地解决。

但是三代测序的短板也必须直说:首先是单碱基成本的绝对值仍然高于NGS,虽然这几年下降很可观,但同等深度下的总花销和中高通量NGS平台不是同一个量级。其次是对DNA质量的要求极其挑剔,三代测序真正需要的是高分子量DNA(通常要求主带在20 kb以上甚至更高),普通试剂盒抽提出来的DNA根本喂不饱它。最后是分析门槛,长读长比对、组装、变异检测的算法虽然进步很大,但远没有NGS分析工具那么成熟,对没有专门生信支持的小实验室来说,上手曲线会陡很多。

4.3 已经在落地的应用,和那些正在被改写的流程

在实际项目中,三代测序目前已经很少是"实验室炫技"了。微生物研究里,用Nanopore做16S-ITS-23S全长操作子测序或者全基因组组装,一个MinION口袋设备就能在野外或者基层医院完成物种鉴定、耐药基因筛查甚至疫情溯源,这种"快速现场可移动"的优点是NGS一个集中式机房永远比不了的。PacBio HiFi则在高杂合的动植物基因组、肿瘤结构变异和单倍型分型方面做得越来越扎实,很多头部基因组项目都默认采用"HiFi为主+NGS辅助纠错"的混合组装策略。

我在一个甘蔗的基因组项目里体会特别深:之前用纯NGS组出来的基因组,因为高杂合和大量重复序列,碎片化严重;后来加入PacBio HiFi数据做混合组装,才把草酸积累相关的代谢通路基因簇拼完整。但要注意,这不是说三代取代了二代,而是你的科学问题决定了你必须用什么工具组合。

5. 三代技术同台对比:从参数到使用成本的完整梳理

日常选测序平台时,大家普遍关心几个指标:读长、单碱基成本、准确度、通量、分析时间。我把这三个平台的典型参数放在一张表里,方便对照:

指标SangerIllumina/NGSPacBio HiFi/SMRTOxford Nanopore
核心原理双脱氧链终止边合成边测序(桥式扩增簇)单分子合成测序(ZMW孔)单分子纳米孔电流检测
典型读长700~1000 bpPE150为主,可到PE30015~25 kb(HiFi模式)数十kb至Mb级
单碱基准确度高(Q40常见)Q30-Q40区间,依赖深度HiFi模式Q20-Q30原始读长Q10-Q20,共识序列可更高
单碱基错误模式随机低概率系统偏向(如GC偏好、末端降质)随机错误(可自我校正)以插入缺失为主,有系统偏向
单碱基成本高很低高中等(设备小巧但耗材不低)
通量规模单反应/96道很大,Gb-Tb级/run中上,Gb级/run芯片可缩放(Flongle到PromethION)
运行时间约1-2小时/反应约1-3天/run约10-30小时/run(模式依赖)从几分钟到数天,实时输出
扩增依赖有PCR步骤建库依赖PCR(可降低)无PCR单分子无PCR单分子
设备与运行门槛低中高,需要机房级管理和生信能力中高,DNA抽提及生信要求高中低,设备便携,但数据分析较专业
最佳场景单/少量位点验证、小片段Sanger、临床确证全基因组、外显子、panel、转录组、宏基因组等通量型任务复杂基因组组装、结构变异、单倍型、甲基化快速鉴定、现场溯源、超长结构变异、need实时分析

补充一个我在实际考察中逐渐形成的判断:这张表里的"单碱基成本"是最容易误导人的指标。测序项目的总成本=实验建库成本+测序开机成本+数据分析人力成本+质控复查成本。NGS虽然把单碱基成本打了下来,但后面跟着的是生信人力的持续投入;三代虽然贵,但往往能在一个组装或者变异检测项目里省掉后面几轮"补缺口"的反复试错。所以选平台时一定要算全链路成本,而不是盯着某一个数字。

6. 我的真实使用体会:选平台不是选最强,是选择合适

6.1 三个具体项目的选型复盘

我做过的项目跨度比较大,正好可以当案例说。

第一个是地贫基因检测。这个项目目标非常聚焦:筛查HBA1、HBA2、HBB等几个基因的热点突变和常见缺失。我当时直接建议用Sanger加缺口PCR,而不是上NGS panel。为什么?因为位点明确、方法成熟、临床报告周期短,Sanger对已知位点的检出能力完全足够,成本低,而且结果容易被临床医生和监管接受。硬要用NGS做一个定制panel,建库、生信分析、变异过滤全流程下来,报告周期会比Sanger长两到三天,成本还会高出不少,对临床决策没有增益。

第二个是肿瘤FFPE样本多基因检测。组织经过福尔马林固定后DNA高度碎片化,这种样本你要的是"在碎片模板上高深度地捞取低频突变",显然NGS靶向panel是正解。我一般把测序深度拉高到1000X以上,重点看目标区域的覆盖均匀性,而不是盲目追求总数据量。这个场景里如果你听别人说"三代读长更好",只会给自己找麻烦——FFPE样本根本提不出能让三代平台发挥长读长优势的高质量DNA。

第三个是现代栽培稻的复杂基因组组装。稻属基因组虽不算超大,但重复序列和结构变异也不少。我们当时用了PacBio HiFi加BioNano光学图谱辅助的混合方案,RagTag做挂载,最终得到的连续性远超纯NGS结果。这个项目从一开始就没打算用NGS做de novo组装,因为目标不是"测到足够的深度",而是"把重复区域和结构变异拼完整"。

6.2 容易踩的坑,统一说一遍

第一个坑:以为三代测序可以完全取代NGS。实际上目前最稳妥、最高效的复杂基因组组装路线,绝大多数是三代长读长+二代短读长纠错和校验的混合模式。NGS的深度覆盖在错误校正、杂合位点确认、以及固定片段上的定量信息方面仍然有不可替代的作用。

第二个坑:忽略样品质量就急着下单。三代测序对DNA质量的要求远比NGS苛刻。如果你的DNA抽提试剂盒只给出OD值达标的结果,而电泳图片显示降解严重,那测序数据大概率不会好看。我在送测之前一定会先用电泳和Qubit确认主带完整性,达不到20 kb以上坚决不硬送。

第三个坑:低估数据分析的人力成本。三代数据的错误模型和NGS完全不同,Nanopore的原始读长错误主要是插入缺失,而不是替换,这导致常规的NGS比对工具直接处理三代数据时表现很差,必须用专为长读长设计的工具(比如minimap2),后续变异检测也要选择适配错误模型的工具。团队的生物信息学能力如果跟不上,数据下机后可能停在"能用但没法解读"的尴尬状态。

6.3 我的取舍逻辑,你可以直接拿去用

现在我在接新项目时,习惯先回答三个问题:

  • 我的核心科学/临床问题,需要的是"单核苷酸确认"、"大规模位点筛查"还是"基因组结构视野"?
  • 样品的数量和DNA质量,能够支撑哪类平台?
  • 团队有多少生信能力?项目中后续验证环节愿意投入多少?

这三个问题回答完,选型基本就定了。做单基因病分子确证,闭眼选Sanger;做肿瘤多基因检测或大规模人群筛查,NGS panel是标准答案;做基因组组装、结构变异、复杂重复区、快速现场鉴定,才轮到三代长读长平台发挥价值。

测序技术发展很快,但工具的本质从来没变过:你问的问题,决定了你用的工具。我自己的体会是,与其追着"第几代"跑,不如把每一代平台的脾气摸透,知道它擅长什么、怕什么。能做到这一点,你在实验室的成本和产出效率,一般都不会差到哪去。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/4 12:23:02

眼动数据分析实战:动态AOI如何追踪视频刺激物

“眼动数据分析基础_AOI分析动态刺激物”这个标题里的信息量其实挺大的。很多刚开始接触眼动数据的人,第一反应是把静态图片切几个兴趣区(AOI),然后统计注视时长。这当然没错,但一旦刺激物变成视频、动画或者游戏中会移…

作者头像 李华
网站建设 2026/10/4 12:12:35

微信小程序长连接实战:WebSocket封装与稳定通信设计

简介:这是一份面向微信小程序开发者与网络协议学习者的实战型源码资源,聚焦TCP/IP长连接通信在小程序端的实现方案,适用于即时消息、实时数据推送等需要双向持久通信的业务场景。资源包含35个文件,主体为18个Go语言编写的后端服务…

作者头像 李华
网站建设 2026/10/4 12:11:52

STM32L496+MR25H40CDF:工业频繁写不掉电的MRAM存储实战

做工业设备最怕的不是算力不够,而是现场断电那一瞬间,正在写的数据到底落没落盘。这几年我在几个需要频繁改写参数、又要严格保证掉电不丢数据的项目里,最后都选了 Everspin 的 MR25H40CDF 这颗 4Mbit 串行 SPI MRAM,配合 STM32L4…

作者头像 李华
网站建设 2026/10/4 12:10:31

Cursor插件开发核心:plugin.json五层校验与激活机制

1. “plugins”不是功能菜单,而是Cursor生态的神经中枢 你点开Cursor右下角那个小齿轮图标,翻到Settings → Extensions,看到满屏“Install”按钮时,大概率以为这只是个“插件市场”——就像VS Code那样,装几个主题、…

作者头像 李华