开头我从一个实际经历说起。我第一次拿到组学平台的质谱操作界面时,面对一堆参数——扫描范围、离子传输时间、碰撞能量、AGC target——完全不知道这些数字在指挥机器干什么。后来跟应用工程师反复调方法、跑样品、对比结果,才慢慢把质谱原理和数据采集模式这两件事串起来。蛋白质组学领域现在几乎绕不开质谱,而质谱结果的质量一半取决于硬件,另一半取决于你选什么采集模式。DDA和DIA这两个词,几乎决定了你的实验是"探索发现"还是"定量比较"。这篇文章不打算复述教科书,我想从实际操作角度拆解质谱原理,再把DDA和DIA的设计逻辑、参数取舍、数据特征和选择策略讲清楚。刚进组学实验室的同学、准备从DDA转向DIA的课题组,或者只是想知道质谱跑出来那些文件到底怎么来的,都可以参考。
1. 质谱仪到底在测什么——蛋白质组学视角的底层逻辑
1.1 从蛋白质到肽段:质谱只能测"分子碎片"
很多人第一次接触蛋白质组学,容易直接问"质谱能不能测蛋白质序列"。实际上,完整蛋白直接进质谱虽然可行,但灵敏度、分离度都远不如酶解后的肽段。现在主流蛋白质组学流程(shotgun proteomics)的第一步,是先把蛋白质提取出来,用胰蛋白酶把蛋白切成肽段。胰蛋白酶切在赖氨酸和精氨酸的C端,一个平均大小的蛋白能切成十几到几十条肽段。
为什么必须这么干?原因有两个。
第一,肽段比完整蛋白更"听话"。蛋白质动不动几十上百kDa,离子化效率低,进入碰撞池后碎裂位点过多,谱图复杂到根本无法解析。肽段通常只有几百到两三千Da,带电后质荷比落在质谱仪最灵敏的范围内,碎裂后产生的碎片离子恰恰能反映序列信息。
第二,肽段直接对应蛋白身份。每个肽段序列其实就是蛋白序列的一个"子字符串"。你只要测出一条独有肽段的序列,基本就能锁定它来自哪个蛋白。越多的肽段被鉴定到,蛋白覆盖度越高。所以蛋白质组学定量,说到底是在测"每个蛋白的肽段离子信号有多强"。
质谱就是在做一件事:测量带电荷的肽段离子的质荷比,然后把它打断,测量碎片离子的质荷比。前者是MS1扫描(前体离子谱图),后者是MS2扫描(碎片离子谱图)。一张完整的组学原始文件里,成千上万张这样的谱图拼接起来,就构成了蛋白丰度的估计基础。
1.2 ESI电离源、四极杆与飞行时间:三段式解剖
要理解采集模式,至少得搞清楚主流仪器里三个核心模块在干什么。
第一个是电离源。现在高灵敏度的组学平台几乎都用纳升电喷雾电离(nanoESI)。液相色谱把肽段洗脱出来,进入一个非常细的喷针,针尖加上高压(一般1.5到3 kV),溶剂在电场和气流作用下雾化成小液滴。液滴不断蒸发变小,表面电荷密度越来越高,最后电荷转移到肽段分子上,形成带多电荷的气相离子——大多数肽段会带2+或3+电荷,有的更长或带更多电荷。所以你在质谱图里看到的分母m/z,已经把电荷数算进去了。一个1000Da的肽段如果带2个电荷,表现出的m/z大约是500.5。
第二个是质量分析器。市场上最常见的组学仪器组合是四极杆(Quadrupole)和飞行时间(TOF)。四极杆由四根平行金属杆组成,在杆上施加射频和直流电压组合。特定电压下,只有特定质荷比的离子能稳定振荡穿过四极杆,其余离子撞在杆上丢掉。改变电压就能让不同m/z离子依次通过。所以四极杆既可以当"全传"通道,也可以当"过滤器"——这是DDA模式下选母离子、DIA模式下切窗口的核心执行部件。
飞行时间分析器的原理很直白:离子在电场中被加速后飞向检测器,轻的离子飞得快,重的飞得慢。记录离子到达时间,就能算出m/z。TOF质量分辨率可以做得很高,能区分质量差异只有几毫道尔顿的离子,这正是区分某些同质量肽段归属的关键。现代TOF还配了反射器(reflectron),相当于把离子的飞行路径折叠了一次,用来补偿初始动能差异,把分辨率进一步提高。
还有一类主流平台是Orbitrap,用静电场阱让离子沿中心电极做轴向振荡,再把振荡频率做傅里叶变换得到质量谱。分辨率极高、质量准确度极好,尤其适合需要区分复杂等重肽段或做TMT标记定量的场景。近年Thermo把Orbitrap与高场不对称离子迁移谱(FAIMS)联用,在DIA定量中提分辨率效果相当明显。
第三个是碰撞池。离子经过四极杆筛选后,进入碰撞池与氮气(或氩气)碰撞,获得内能,碎裂成b/y系列碎片离子——这两个系列的本质是肽段沿着肽键断开,一端保留N端,一端保留C端。b离子和y离子的质量差对应一个个氨基酸残基,反过来推就能读出序列。
1.3 碰撞碎裂与二级谱图:蛋白质身份的"指纹"
在DDA和DIA里,碰撞能量(CE)都需要针对不同m/z做梯度调节——肽段越大,碰撞能力要求反而要越高。有些平台用"阶梯碰撞能量"(stepped NCE),在一个碎裂事件里叠加多档能量,保证大小碎片同时出现,这个细节对鉴定能力影响很大。
二级谱图是蛋白质身份识别的"指纹"。一个肽段被打碎后,产生的b/y系列离子位置像一把尺子的刻度,算法(比如搜索引擎和数据库匹配)会拿这把刻度与理论酶解肽段的碎裂模式比对,给出PSM(肽段-谱图匹配)分数。DDA和DIA在数据形态上有个根本区别:DDA的MS2谱图通常对应单个母离子(干净谱图),DIA的MS2谱图对应窗口内一群母离子的混合碎裂谱图(混合谱图)。这个区别,决定了两者数据解析逻辑完全不同——DDA是"先选后测",DIA是"全测后算"。
2. 数据依赖采集模式DDA:锁定前N强的选择逻辑
2.1 topN策略与动态排除
DDA的逻辑直白得近乎原始:每轮MS1扫描结束后,软件看一看这个谱图里有哪些峰,按强度排序,选前N个最强峰,逐一送入四极杆做MS2碎裂。选多少?最常见的设置是top 15到top 20。为什么不是top 50?因为每个MS2事件要花时间,一轮循环(Cycle time)做得太长,色谱峰定时不够,定量就不准。你在软件里看到的"cycle time"就是MS1扫描时间加N个MS2扫描时间的总和。色谱峰的洗脱宽度一般20到40秒,你至少想在峰顶附近采到6到10个点来还原峰形,循环时间就得控制在1.5到3秒之间。
动态排除(dynamic exclusion)是DDA的关键机制。同一个最强肽段离子,如果不加限制,会在好几轮循环里反复被选中碎裂,浪费MS2事件。软件会把这个m/z列入"黑名单"20到60秒,在这段时间里不再选它做母离子,把机会让给其他丰度更低的峰。参数调得越大,谱图多样性越好,但代价是同一个峰的MS2重复次数变少,低丰度定量噪点变大。一般我会把动态排除设成30秒,片段离子强度高、序列较长的肽段可以适当放宽。
值得留意的是,DDA模式在高丰度背景干扰多的样本里,有个天然倾向:反复选中同一批高丰度肽段。血浆样本尤其明显——白蛋白和免疫球蛋白的肽段把MS2采样机会占掉大半,低丰度蛋白很难被选到。处理办法无非是预分离(比如high pH反相分级)把动态范围摊开,或者用高丰度蛋白去除试剂盒,但这些操作本身会引入额外误差和样本损失。
2.2 DDA参数设计中的关键平衡点
DDA方法的参数调优,本质上是在做四个变量的权衡:循环时间、排除时间、MS2分辨率/积累时间和碰撞能量。我给新手一个相对稳妥的起始方法参考:
| 参数 | 推荐起始值 | 说明 |
|---|---|---|
| MS1分辨率 | 60k–120k(Orbitrap体系) | 越高越能分辨同质量肽段,但扫描变慢 |
| MS1扫描范围 | 350–1200 m/z | 覆盖大多数酶解肽段;太宽浪费电荷容量 |
| AGC target (MS1) | 1e6–3e6 | 控制离子累计量,防止空间电荷效应 |
| 最大注入时间 (MS1) | 25–50 ms | 别给太长,否则循环时间压不住 |
| topN | 15–20 | 取决于样本复杂度和色谱峰宽 |
| 动态排除 | 30 s | 兼顾多样性与定量重复性 |
| 碰撞能量 | 27–30 NCE(可加stepped) | 先跑标准品查看b/y系列覆盖度 |
Orbitrap平台上,MS2分辨率从15k提到30k,会明显提升低丰度碎片峰的质量分辨,但也会让循环时间增加一点点。DDA在短梯度(比如30分钟快速方法)里通常做不到特别深——峰太少,MS2机会有限。想要鉴定深度,就得把梯度拉长,配合分级来摊机会。这也是为什么很多发现蛋白质组学项目往往一针要跑60到120分钟。
2.3 DDA的实际局限:丢失低频信号和缺失值问题
我实际跑DDA数据最有体会的一点是:它其实不擅长"重现性"。同一个样本重复进三针,每针选中的前N强会有差异——靠近阈值线的峰可能这针选了那针没选,于是样本间就出现大量缺失值。定量层面,有的蛋白在这组样本中被定量了,在另一组样本中却因为没被选上而完全没有数据点,这对后续统计是个大麻烦。你如果用DDA做比较蛋白组学,缺失值比例20%到40%都不稀奇。
DDA更适合什么?无标记非靶向,但更典型的其实是基于TMT/iTRAQ标记的多重定量,以及需要"找新东西"的发现性项目。TMT标记之后,所有样本混合成一管,只需要在MS2层面用报告离子相对定量,DDA对母离子的重复选择要求没那么严格,因为每根肽段离子碎裂一次就能提供所有通道的信息。所以现在做TMT研究,DDA依然是首选。
但如果你要做无标记、跨几十上百个样本的丰度比较,DDA的低重复性和缺失值问题会被无限放大。这就是DIA被不断推进的核心原因。
3. 数据非依赖采集模式DIA:窗口式全景扫描的工程思路
3.1 SWATH与窗口划分:如何把动态范围压缩到可测范围
DIA的思路跟DDA完全相反:不筛选母离子,而是把所有离子按质荷比分成一个个窗口,窗口内的全部离子都送入四极杆碎裂。每个窗口产生一张MS2谱图,里面混合了这个窗口内所有肽段碎片。只要窗口覆盖整个扫描范围,那么理论上你获得了样本里每个离子的碎裂信息。SWATH是SCIEX对DIA商业化的名称,也是目前最经典的窗口策略。
窗口怎么划,是DIA方法设计的核心。窗口太宽,一个窗口里同时碎裂几十上百个前体离子,碎片谱图混叠严重,软件解析时容易张冠李戴;窗口太窄,虽然选择性好,但需要的窗口总数变多,每个窗口占用的时间变长,循环时间就压不下来。经典的SWATH方法在400到1000 m/z范围内用32个窗口,每个窗口约25到26 Da宽,循环时间约2到3秒。亮点在于,窗口与窗口之间要保证一定的重叠(大约1 Da),防止恰好落在边界的峰丢失。
后来有了"variable window"概念——低m/z区域离子密度大、同位素峰又密,窗口划窄一点(比如100到500 m/z用12个窗口,每个窗口10到15 Da);高m/z区域肽段密度稀疏,窗口放宽到30到50 Da。优化时,你可以根据DDA数据统计肽段分布,把窗口边界对齐到"几乎没有肽段窗界的区域",减少峰被切开分配到两个窗口的概率。
DIA数据分析的基石是谱图库(spectral library)。谱图库记录了每个肽段的保留时间、母离子质量、碎片离子m/z和强度。DIA扫描到的混合谱图,就是用这些信息去"查"——算法从库里取出理论碎片特征,在混合谱图对应的保留时间区间内做信号提取。没有库覆盖的肽段,DIA数据里虽然有碎片信号,但无法通过常规流程解析。这也是早期DIA"不建库就没法用"的痛点来源。
3.2 离子淌度与diaPASEF:在时间轴上再开一维
传统DIA只有两个维度:正交的m/z窗口和色谱保留时间。如果两个不同肽段落在同一个窗口且保留时间接近,它们的碎片就混在一起。Bruker的timsTOF系列把离子淌度(ion mobility)加了进来,开辟了第三维——离子在气体中迁移的速度取决于它们的碰撞截面。timtof把DIA升级成diaPASEF(parallel accumulation-serial fragmentation)。
diAPASEF最巧妙的地方在于"平行累积、串行碎裂"。传统DIA把窗口一个个切出来,是"串行"的——一次只做一段窗口;diaPASEF把前体离子先累积在离子淌度管里,随着淌度驱动电场逐渐加大,不同淌度的离子依次被释放出来,四极杆则根据当前淌度区域动态调整窗口位置,实现"扫描随淌度实时跟踪"。这么一来,一个循环里可以覆盖更多的窗口(通常数百个),循环时间反而短。最直观的效果是:在相同上样量下,diaPASEF的鉴定深度和定量稳定性都明显好过同等价位的传统Q-TOF DIA。这个优势在微量样本和单细胞蛋白质组学里体现得尤为突出——本来就没多少样品,采集效率就成了命门。
需要注意,diaPASEF的方法设计不再用固定的"等宽窗口列表",而是基于离子淌度的二维参数图调整窗口位置和宽度。不同m/z、不同淌度区间的离子密度差别很大,策略上要在离子密度高的二维区域用多而窄的窗口,在稀疏区域用少而宽的窗口。Bruker配套软件(如timeControl)里有一些预设方法,新手建议直接跑预设的"diaPASEF-positive-100ToD"这类方法开始,再根据实际数据密度做优化。
3.3 数据处理:谱图库、库-free与DIA-NN这类工具的演进
DIA数据处理早期依赖两件事:建库和提取定量信号。建库的过程通常是把一个混合样本分成几十个组分,每组分再跑DDA,把所有鉴定到的肽段谱图集合成一张大库。库的质量直接决定DIA分析上限——库不好,DIA解析就好不了。后来出现了无库分析(library-free),代表工具是DIA-NN。DIA-NN用深度学习预测肽段的碎裂行为、离子淌度和保留时间,直接从DIA数据本身学习信号特征,再配合"干湿结合"的算法,甚至能在没有库的情况下做直接定量。
我用过的最顺手的组合是:前期用DIA-NN做一轮"预分析"得到特征,再用特征生成项目专用库,最后回到DIA-NN做正式定量。这样做的好处是库的特征跟本项目的色谱条件和碎裂条件高度匹配,比拿公共库硬套准得多。跨样本批次时,公共库(比如Pan Human Library)虽然方便,但对色谱梯度、液相体系的差异非常敏感——保留时间预测偏差会让信号提取窗口选错位置,定量噪点立刻变大。
另一个关键点是FDR控制策略。DIA的分析单位不是PSM,而是"前体离子×碎片离子×保留时间"四维特征匹配。用DIA-NN跑出来的结果,除了一般的global q-value(前体水平FDR),还要关注蛋白水平FDR和Run-specific FDR三者的联动。尽量把肽段和蛋白质水平的FDR控制在1%以内,不要只看软件默认的q值,很多软件默认的阈值并不针对DIA混合谱图。
4. DDA与DIA的选择策略:不同样本类型和实验目的怎么选
4.1 参数对比与适用场景
不少课题组问我,是不是DIA一定比DDA好。我觉得这不成立——两者各有擅长的阶段。把核心差异放一张表里比较容易说明白。
| 对比维度 | DDA | DIA |
|---|---|---|
| MS2选择逻辑 | 只选topN峰 | 扫描全部窗口 |
| MS2谱图纯度 | 高(单母离子) | 低(窗口混合) |
| 鉴定深度(同梯度) | 偏低,受采样机会限制 | 高,碎片信息全覆盖 |
| 定量缺失值 | 高(低丰度常没选上) | 低(每个窗口都采) |
| 跨样本重现性 | 一般 | 很好 |
| 数据量 | 中等 | 大,分析计算量大 |
| 软件生态 | 成熟(MaxQuant、Proteome Discoverer等) | 仍在快速演进(DIA-NN、Spectronaut、Skyline等) |
| 典型场景 | TMT多重定量、发现新蛋白、PTM位点鉴定 | 无标记大队列比较、标志物筛选、单细胞微量组学 |
DDA的高纯谱图优势在PTM位点鉴定上仍然有决定性——修饰肽段丰度低、信号碎片复杂,混合谱图经常让修饰位点归属模糊。如果你做磷酸化富集后的样本,想在激酶底物位点层面精确定位,DDA加高分辨率MS2依然是稳妥路径。DIA做磷酸化不是不能做,只是位点定位的准确度需要额外的位点概率统计(比如PhosphoRS打分)来兜底。
4.2 真实项目中的"组合拳"打法
实际项目里,我很少只用单一模式到底。最常见的组合是前期DDA建库,后期DIA定量:先取代表性样本(或等量混合样)分级成8到12个组分跑DDA,得到项目专属库;再用库支持的DIA方法跑所有样本。这样发挥两边的优点——DDA负责"发现和建库",DIA负责"一致定量"。另外一个思路是同一根色谱柱、同一梯度条件下,先跑一针DDA做方法开发和检查色谱分离质量,再用DIA跑正式实验,因为DIA数据里包含着DDA几乎全部可鉴定肽段的信息,方法开发阶段的琐碎调整不会浪费正式实验的样本。
单细胞蛋白质组学这块,我目前更倾向直接上diaPASEF。原因很简单:上样量只有纳克级,传统DDA把topN机会浪费在背景和噪声上,珍贵的离子信号在MS1扫描阶段就丢掉了。DIA窗口能保留大部分离子信息,再用低流速色谱和窄喷针提高离子化效率,单针鉴定深度能做到3000到5000个蛋白,这在普通DDA模式下几乎做不到。
4.3 数据分析的陷阱:假阳性、共洗脱干扰和批次效应
DIA数据解析有一个很容易被低估的坑:共洗脱干扰。色谱分离、m/z窗口和碎片段三者都接近的肽段会在库匹配时互相竞争特征信号。DIA-NN这类工具允许你查看"干扰程度"相关的得分——一般叫干扰评分或precision,精确性不佳的定量特征在后续统计时会被过滤掉。我在处理时习惯保留严格的干扰阈值(例如DIA-NN的干扰评分大于0.5才保留),宁可少统计一些蛋白,也不要让定量数据里掺入共洗脱噪点。
批次效应在DIA里同样严重。不同批次的色谱柱状态、喷针、样品制备试剂,都会让保留时间出现漂移。对策有三个:一是跑正式样本前用QC样(商业标准品或实验室内部混合样)检查保留时间漂移和总离子流强度;二是在DIA-NN分析时打开match-between-runs或保留时间校准相关性选项,让跨样本的保留时间对齐;三是在统计学建模时把批次设为协变量或随机效应,别天真到直接做组间比较。
5. 质谱组学正在变快、变敏感——我看到的趋势
5.1 硬件层面:更高的分辨率、更短的循环时间
这两年硬件的方向很清楚:提高扫描速度、分辨率和离子利用效率。Thermo的Orbitrap Astral把Orbitrap与Astral分析器结合在一起,MS2扫描速度可以到每秒数百谱图,扫描速度与分辨率不再是鱼和熊掌。过去DIA最常见的批评之一是"MS2谱图太多,处理费劲",现在Astral这类平台反而希望扫描越快越好——更快的循环时间意味着可以用更窄的窗口做DIA,混合谱图的复杂程度会进一步下降。
5.2 软件层面:深度学习重构DIA数据处理范式
DIA-NN和Spectronaut这类软件已经从"查询谱图库"进化到"学习谱图特征"。未来趋势是:库变得项目自适应,深度模型直接预测碎片离子保留时间、淌度和强度,使得没有实验库的项目也能做到与建库方法相当的定量精度。我还注意到,可解释性AI模型开始能帮忙做离子分组和DIA峰判定,这些任务原来靠规则判断,现在靠模型泛化。数据处理环节对新手越来越友好,但反过来,如果你不理解背后的特征匹配逻辑,光会用软件点按钮,很容易得到表面漂亮实则充满系统性偏倚的结果。
5.3 从定性到绝对定量:DIA在临床大队列中的优势
临床蛋白质组学的大趋势是从几千个蛋白的发现筛选走向几十到几百个蛋白的靶向验证——DIA天然适合这个转变。DIA数据里含有所有肽段的信号,你想在后期追加验证某个新候选标志物,不需要重新跑实验,调出原始文件、提取目标特征即可。这种"回顾性验证"能力,是DDA完全不具备的。我在神经退行性疾病和肿瘤标志物项目里,越来越倾向于用DIA做"发现+验证"的连续流程——前20例样本先做深度分级的全景数据,候选名单锁定后再在200例队列的常规DIA里定向提取。
5.4 仍在变多的维度:宏蛋白组、空间蛋白组与翻译后修饰的DIA化
最后聊两个正在发生的方向。空间蛋白质组学(激光显微切割加纳米级LC-MS)让DIA在小区域样本里发挥价值,因为样本量少,所有离子都必须保留下来;翻译后修饰层面的DIA现在也在加速,专门的磷酸化DIA库和乙酰化DIA库相继公开,虽然位点定级准确性仍需人工验证,但大规模修饰组学走向DIA应该只是时间问题。宏蛋白组(宏基因组预测蛋白组)由于物种复杂、动态范围巨大,传统DDA经常采样不足,DIA的"全景记录+离线解析"思路反而是更合理的工程解。
我个人越来越认同一个观点:DDA和DIA的选型不是为了跟风,而是取决于你的样本量、定量类型和最终要回答的科学问题。刚接触组学的人最好先拿标准样品把两种模式都跑一遍,感受DDA"干净但缺失"和DIA"全面但需要懂解析"的差别。真正上手之后,你会慢慢发现多数高深度定量项目最终会走向DIA——不是因为DDA过时了,而是因为DIA更符合生物学研究对一致性和可重复性的需求。这个领域变化很快,我提到的参数和软件版本过几年肯定会迭代,但底层原理和数据采集模式的取舍逻辑,值得任何时候先想明白。