引入

生命的指令写在DNA 的结构的碱基序列里——A、T、C、G四个字母,构成了所有生物的”源代码”。如果能读出这段源代码,我们就能找到致病突变、追踪病毒进化、重建物种亲缘关系,甚至为每个患者定制治疗方案。DNA测序,就是这套读取生命信息的技术。

测序技术的演化史,本质上是”如何更快、更便宜、更准确地读取碱基序列”的工程学进化史。从1977年Sanger发明第一代测序,到今天一个人全基因组只需几百美元和几个小时——这场技术革命彻底改变了生物学的研究方式,也开启了精准医疗的大门。

每一代测序技术都建立在DNA 的复制的基本原理之上:DNA聚合酶按模板合成互补链,只是工程师们找到了不同的方法来”观察”这个合成过程。


正文

定义

**DNA测序(DNA sequencing)**是指确定DNA分子中碱基(A、T、C、G)排列顺序的技术。从广义上,它涵盖了从样本制备、碱基读取到序列分析的全流程。

第一代测序:Sanger双脱氧链终止法

1977年由Frederick Sanger发明,是第一个实用的DNA测序方法,也是人类基因组计划(1990-2003,耗资约30亿美元,历时13年)所依赖的核心技术。

原理

DNA聚合酶在合成新链时,需要dNTP(正常的脱氧核苷三磷酸)。如果在反应体系中同时加入少量ddNTP(双脱氧核苷三磷酸)——它缺少3’-OH基团,一旦被聚合酶掺入,链的延伸就立即终止

设置四个反应管,每管分别加入ddATP、ddTTP、ddCTP、ddGTP。聚合酶在每个模板的每个位置都有概率掺入ddNTP,因此产生一系列不同长度、但都以特定碱基结尾的片段。

将这些片段通过毛细管电泳按长度分离,从短到长读取末端碱基,即可还原出原始序列。

特点:读长约800-1000bp,准确度高(>99.99%),但通量极低——一次反应只能读一条序列。适合验证性测序和小规模项目。

人类基因组计划

1990年启动,2003年完成,是人类科学史上最大的协作项目之一。它证明了一个完整的人类基因组序列是可以被读取的,也为后续所有基因组学研究奠定了参考框架。参见PCR——PCR技术在文库构建中不可或缺。

第二代测序(NGS):大规模并行短读长

第二代测序(Next-Generation Sequencing)的核心思想是:把数百万条DNA片段同时测序,彻底突破了Sanger的串行瓶颈。

Illumina 边合成边测序(SBS)是目前主流平台

1. 文库制备:将DNA随机打断成短片段(300-600bp),两端连接接头(adapters)。

2. 桥式扩增(bridge amplification):DNA片段结合在流动槽(flow cell)表面的引物上,弯曲成”桥”形,通过聚合酶扩增形成局部克隆簇(cluster),每个簇约1000条相同序列,用于增强信号。

3. 边合成边测序:加入带有荧光标记的可逆终止dNTP。每次只掺入一个碱基,激光激发后拍照记录颜色(四种颜色对应四种碱基),然后切除荧光基团和终止基团,进行下一轮。数百万个簇同步读取

特点:通量极高(一次运行可产出数百Gb数据),单碱基成本低,但读长短(150-300bp),对重复序列和结构变异检测存在困难。

第三代测序:单分子长读长

第三代测序直接读取单个DNA分子,无需PCR扩增(见PCR),避免了扩增偏差,且读长大幅提升

PacBio SMRT测序(单分子实时测序)

DNA聚合酶被固定在一个纳米级小孔(zero-mode waveguide,ZMW)底部,加入四种带不同荧光标记的dNTP。聚合酶每掺入一个碱基,对应颜色的荧光脉冲被实时捕捉。

读长平均10-30kb,最长可达100kb以上。准确度单次约85-90%,但通过环形一致性测序(CCS/HiFi)——让聚合酶绕环形模板多次读取同一条序列——可将准确度提升至>99.9%。

Oxford Nanopore 纳米孔测序

原理完全不同:一条DNA单链在电压驱动下穿过一个嵌在膜上的蛋白质纳米孔。不同碱基(或碱基组合)经过孔道时,阻断电流的方式不同,通过实时监测电流变化来识别碱基。

读长理论上无上限(已实现>4Mb的读长),设备小型化(MinION如U盘大小,可随身携带)。早期准确度较低(约85-95%),近年已提升至>99%(R10.4孔+最新碱基识别算法)。

三代测序技术比较

特性Sanger(一代)Illumina(二代)PacBio / Nanopore(三代)
读长800-1000 bp150-300 bp10 kb - 数 Mb
通量极低极高中至高
单碱基准确度>99.99%>99.9%85-99.9%(依模式)
单Gb成本极高最低(约$5-10)较高(约$15-50)
速度数小时至数天实时至数小时
主要优势金标准验证通量与成本长读长,结构变异检测
主要局限通量低短读长,重复序列成本较高,错误率略高

测序的应用场景

测序技术的价值在于它能回答的生物学问题:

基因组组装:将短读长(二代)和长读长(三代)组合,拼接出完整基因组。长读长跨越重复区域,短读长纠错,这是当前高质量基因组组装的标准策略。

变异检测:比对到参考基因组后,识别SNP(单核苷酸多态性)、InDel(插入缺失)和结构变异(SV)。这是研究基因突变与变异和寻找致病位点的核心工具。

转录组测序(RNA-seq):对mRNA反转录后测序,可定量基因表达水平、发现可变剪接、识别新转录本。不需要预先知道要检测哪些基因。

表观基因组测序

  • ChIP-seq:结合染色质免疫沉淀和测序,定位蛋白质(组蛋白修饰、转录因子)在基因组上的结合位点
  • 全基因组甲基化测序(WGBS):用亚硫酸氢盐处理DNA,未甲基化的C转变为U,比对后识别每个C的甲基化状态——这是表观遗传学研究的重要工具
  • Nanopore直接检测:纳米孔测序可以直接区分甲基化胞嘧啶和未甲基化胞嘧啶,无需化学处理

宏基因组测序:直接从环境样本(土壤、肠道、海洋)中提取DNA并测序,无需培养微生物。16S rRNA基因测序可鉴定物种组成,全宏基因组测序(shotgun metagenomics)还能重建微生物的功能基因。这是研究人体微生物组的主要手段。

生物信息学:从数据到知识

测序产生的原始数据(FASTQ文件,包含序列和质量分数)需要一套完整的分析流程才能转化为生物学洞见:

质控(QC):去除低质量读段和接头序列。

比对(alignment):将读段定位到参考基因组(BWA、Bowtie2等工具)。三代长读长用minimap2。

变异识别(variant calling):在比对结果上识别与参考基因组的差异(GATK、DeepVariant等)。

注释(annotation):将变异映射到基因和功能区域,判断其潜在影响(同义突变、错义突变、剪接位点突变等)。

下游分析:基因表达定量、通路富集、系统发育重建、群体遗传学分析——具体取决于研究问题。

这一系列流程构成了生物信息学的核心工作,也是现代生物学研究无法绕开的技能。

从基因组到精准医疗

测序技术的终极价值在于临床转化:

  • 肿瘤基因组测序:识别驱动突变,指导靶向治疗选择(如EGFR突变→吉非替尼,参见癌症的生物学
  • 无创产前检测(NIPT):通过母体血液中游离胎儿DNA筛查染色体异常
  • 罕见病诊断:全外显子测序(WES)可将罕见遗传病的诊断率从不到10%提升至40%以上
  • 病原体监测:快速测序追踪病毒变异(新冠疫情中SARS-CoV-2基因组的全球监测网络)
  • 药物基因组学:根据个体基因变异预测药物反应,避免无效或有害治疗

CRISPR与基因编辑的发展让”从读取到改写”成为可能,而测序则是验证编辑效果和发现新靶点的基础设施。


引出

  • Nanopore测序中,碱基识别(basecalling)算法如何利用深度学习提升准确度?
  • 长读长测序如何改善**结构变异(SV)**检测,这些变异在人类疾病中的作用为何长期被低估?
  • 单细胞测序(scRNA-seq)如何在细胞异质性层面提供bulk RNA-seq无法揭示的信息?
  • 空间转录组学(spatial transcriptomics)如何将基因表达数据与组织空间位置关联?
  • 全基因组测序成本降至$100以下时,全民基因组测序在伦理和隐私层面会面临哪些挑战?