ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

质谱在蛋白质组学中的应用:从MALDI-TOF到ESI-MS/MS

质谱在蛋白质组学中的应用:从MALDI-TOF到ESI-MS/MS 如果你接触过蛋白质组学不管是在实验室里跑样品还是只看过几篇组学文献质谱这四个字大概是绕不开的。我第一次碰质谱是研一时候帮师兄做蛋白鉴定那时候对MALDI-TOF和ESI-MS/MS的概念一头雾水只知道把靶板推进仪器等几分钟出一堆峰然后师兄对着电脑说“这个是某某蛋白”。后来轮到自己接手课题才慢慢意识到这些峰背后是一整套从电离、质量分析、碎裂到数据库搜索的逻辑。这篇文章就想把这些基础东西掰开讲清楚MALDI-TOF和ESI-MS/MS到底在蛋白质组学里扮演什么角色肽段是怎么被鉴定出来的定量又是怎么实现的。适合刚进组的同学、想补质谱底子的生物背景研究者以及所有对蛋白质组学“知其然而不知其所以然”的人。1. 蛋白质组学为什么绕不开质谱1.1 蛋白质是功能的执行者但测起来很麻烦基因组测序告诉我们“可能有什么”转录组测序告诉我们在RNA水平“可能正在准备什么”但真正干活的往往是蛋白质。跑通一条信号通路、催化一个代谢反应、维持细胞骨架靠的都是蛋白质直接执行。问题在于蛋白质的丰度、修饰状态和亚细胞定位和mRNA水平并不是严格对应的关系有时候mRNA上调了但蛋白根本没变有时候蛋白被磷酸化修饰激活了但总量一点没变。所以想真正理解一个生物学过程蛋白层面必须要看。但蛋白本身不好测。二十种氨基酸排列组合出成千上万的蛋白没有PCR那样能直接扩增蛋白的手段抗原抗体反应又只能针对已知靶标。质谱是少有的高通量、无偏方法它不依赖预先知道你要找什么而是直接把肽段的质量和碎裂信息变成可计算的数字再通过这些数字去数据库里匹配出蛋白身份。这也是为什么蛋白质组学里讨论质谱的篇幅永远占大头。1.2 主流玩法叫Bottom-up先切成肽段再鉴定现在做蛋白质组学绝大多数是Bottom-up策略中文常叫“自下而上”或“鸟枪法”。思路很直白完整蛋白太大而且不同蛋白的溶解性、分子量差异巨大直接进质谱既难电离又难碎裂数据库匹配也不现实。所以先把蛋白用蛋白酶最常用胰蛋白酶切成十几到几十个氨基酸的肽段再对这些肽段做质谱分析最后通过肽段的序列拼回蛋白身份。肽段做质谱有几个天然优势分子量小ESI电离效率高碎裂模式更规律主要在肽键处断裂而且液相色谱能很好地分离它们。整套流程下来一套体系可以同时鉴定几千甚至上万个蛋白这在完整蛋白层面几乎做不到。所以理解蛋白质组学质谱本质上是理解“如何让肽段在质谱里被看见、被测量、被匹配”。1.3 电离方式是整个故事的起点质谱里有个核心概念质谱只能测量气相离子样品不管原来是什么状态先进去一定得变成“带电的气体分子”。这一步骤叫电离。蛋白质组学里最常见的两种电离方式就是MALDI和ESI。名称看起来吓唬人但本质只解决一个问题让一个不挥发、不耐热的蛋白或多肽变成能飞进质量分析器里的离子。MALDI和ESI的发明者后来都拿了诺贝尔化学奖2002年与Fenn和Tanaka相关足见这一步对整个生命科学领域有多关键。而这两者分别对应了两种完全不同的应用场景MALDI适合快速、相对简单的样品ESI则适合和液相色谱联用做深度、高通量的组学鉴定。搞清楚二者的分工和原理后面所有内容都好理解。2. MALDI-TOF实测盘点它能干什么不能干什么2.1 原理级的理解基质、激光与飞行时间MALDI全称是基质辅助激光解吸电离读起来长拆开就好懂了。样品先和大量的小分子基质如CHCA或SA混合滴在金属靶板上干燥形成共结晶。然后仪器里一束激光通常是氮气激光337 nm或固体激光355 nm打到结晶上。基质的作用是吸收激光能量它吸收效率远超分析物本身激光轰击瞬间基质发生相变和膨胀把样品“带”到气相同时完成质子转移让分析物带上电荷。整个过程是“软电离”也就是说肽段或蛋白基本不会被打碎看到的通常是完整的分子离子峰比如[MH]。TOF是飞行时间质量分析器。原理特别朴素所有离子先在同一加速电场里获得相同的动能然后飞过一根一定长度的无场飞行管。质量轻的飞得快质量重的飞得慢记录从起始到检测器的时间换算即可得到质荷比m/z。加一个反射器reflectron可以纠正初始动能分散分辨率能显著提升。信息量很大但MALDI-TOF操作上有个很直观的体验把靶板送进仪器点几个孔几秒钟出一张质谱图。这也是它“快”的来源。2.2 MALDI-TOF的几个典型应用场景在实际工作中MALDI-TOF最常见的角色不是深度蛋白质组学而是“快速鉴定已知身份”。几个典型场景我现在都还在用蛋白纯品验证表达纯化一个重组蛋白想知道分子量对不对、有没有降解MALDI-TOF点一下就能看到主峰非常省事。相比SDS-PAGE它还能给出精确的质量偏差。肽质量指纹图谱PMF把蛋白胶条切下来酶切提取肽段MALDI-TOF测出所有肽段的精确质量再和理论酶切肽段列表比对。这个方法是早期的蛋白鉴定思路现在做单个蛋白鉴定仍然有用。微生物鉴定临床和疾控常用的微生物质谱鉴定本质上也是MALDI-TOF测微生物蛋白指纹再和数据库比对几秒就能定到属/种。这是MALDI-TOF目前商业化最成功的应用之一。MALDI成像组织切片上覆盖基质逐点扫描可以绘制某种肽段或蛋白在组织里的空间分布。这个方向很热门本质还是MALDI在二维空间上的逐点质谱采集。2.3 为什么组学深度鉴定不能只靠MALDI-TOFMALDI-TOF虽然快但有明显的天花板。最大的问题是离子抑制效应复杂样品里大量组分一起进入离子源时丰度高的会抑制丰度低的响应导致低丰度肽段根本看不到。它和液相色谱的联用又不像ESI那么自然因为MALDI是脉冲式电离需要一个靶板收集馏分再逐个点样通量和动态范围都吃亏。还有一个限制是串联质谱能力相对弱。做序列鉴定时单纯一个肽段的分子量信息往往不够需要把肽段进一步碎裂并测碎片离子而这恰恰是深度组学的核心需求。MALDI-TOF也有TOF/TOF串联模式但做大规模组学鉴定时效率和灵敏度还是不如ESI-MS/MS的体系。所以现在主流蛋白质组学实验室里MALDI-TOF更多是辅助工具深度鉴定的绝对主力是ESI-MS/MS。3. ESI-MS/MS工作流一步步拆给你看3.1 ESI是怎么“软”电离出多电荷离子的ESI叫电喷雾电离名字同样直白。肽段溶液通过一根很细的喷针针尖施加高电压通常是2-5 kV溶液在电场中形成泰勒锥然后在尖端脱出带电液滴。一路辅以加热干燥气或鞘气液滴不断蒸发变小表面电荷密度急剧升高当电荷排斥力超过液滴表面张力时就会发生“库仑爆炸”变成更小的液滴重复这个过程最终溶质以气相离子形式进入质谱。ESI最妙的一点是它产生的离子经常带多个电荷比如一个分子量2000 Da的肽段带2个电荷时m/z只有约1000。这样即使样品分子量再大也能落在大多数质量分析器可测量的范围里这也是完整蛋白质也能用ESI测量的原因。另外ESI是连续进样天然适合连接液相色谱。色谱在前面按疏水性分离肽段ESI紧接着把流出的溶液变成离子送进质谱这一套组合就是LC-MS的基石。3.2 MS/MS碎裂b/y离子如何拼出序列单靠MS1层面测一个多电荷离子质量只能知道这个肽段的分子量推不出序列。想要序列信息得做串联质谱也就是MS/MS。流程是第一级质量分析器比如四极杆先选一个特定m/z的母离子把它放进碰撞池与氮气或氩气碰撞肽段沿肽键断裂。断裂产物进入第二级质量分析器得到碎片离子的质谱图。肽段骨架断裂最典型的是酰胺键断裂。碎片保留N端部分的是b离子保留C端部分的是y离子。两个相邻b离子或y离子的质量差正好对应一个氨基酸残基的质量差所以谱图里由小到大的y离子峰就像一把由短到长的尺子能“数”出氨基酸序列。实际操作中你不一定手动读谱但理解了b/y离子的意义才能理解搜索引擎在干什么。这个碎裂环节决定了Q-TOF、Q-Orbitrap这类仪器的基本架构。当前主流是用四极杆选择母离子然后在碰撞池做HCD或CID碎裂最后用TOF或Orbitrap检测碎片。3.3 一台LC-MS/MS仪器的典型采集参数组学实验室里常见的LC-MS/MS平台有Thermo的Orbitrap系列Exploris、Eclipse等、布鲁克的timsTOF、SCIEX的TripleTOF、安捷伦的Q-TOF等。不同平台参数细节不同但核心采集模式类似。以最常见的DDA数据依赖采集为例典型参数是这样一套逻辑先打一张MS1全扫比如400-1200 m/z范围分辨率6万或12万软件从MS1里挑强度排前10-20的母离子所以叫Top-N方法Top20很常见逐个做碎裂对每个母离子设定一个隔离窗口常见1.6-2.0 Da确保只选到一个同位素峰簇MS/MS的分辨率通常是1.5万或3万扫描速度越快单位时间能鉴定的肽段越多还要设动态排除比如一个母离子鉴定完后30-60秒内不再重复选它防止高丰度肽段反复占据采集名额。实际调参时源气、喷雾电压、离子传输管温度、碰撞能量标准化CE或者对电荷状态做阶梯能量都会影响响应和谱图质量。我给过一个新手很直观的建议拿一个标准Bsa酶切肽段先用仪器自带的Optimization流程跑一遍确认基峰和总离子流图稳定了再去跑真正的样品。3.4 蛋白样品上机前的标准前处理ESI-MS/MS再强样品前处理不到位也白搭。我们实验室的标准流程大概是裂解细胞或组织用含尿素和硫脲的裂解液或者SDS/RIPA体系充分裂解超声或研磨打断核酸和粘稠度低温离心取上清还原和烷基化用DTT或TCEP还原二硫键再加碘乙酰胺IAA把游离巯基烷基化。这一步很关键不做的话半胱氨酸会形成二硫键导致肽段酶切位点和状态不统一酶切经典选择是Trypsin37度酶解常用过夜或高温快速酶切。酶和蛋白质量比一般1:50到1:100看样品复杂度脱盐酶切后的肽段溶液含有大量盐和尿素直接进质谱会严重影响信号用C18脱盐柱或StageTip清洗掉极性干扰物洗脱后真空浓缩复溶上样用0.1%甲酸水复溶调整浓度到0.5-1 μg/μL左右进LC-MS/MS。每步都有坑。比如还原烷基化不彻底你搜库时会看到半胱氨酸的修饰状态混乱鉴定数直线下降脱盐不干净喷雾稳定性差色谱峰前沿严重。这些我在后面第6章会展开说。4. 数据库搜索把MS/MS谱图变成蛋白名单的关键4.1 搜索引擎怎么“猜”肽段拿到一堆MS/MS谱图后下一步不是人眼去读而是交给数据库搜索引擎。原理可以理解为“对照实验”我们把样本所属物种的蛋白数据库比如人类UniProt库在电脑里用同样的酶切规则Trypsin虚拟切一遍得到所有理论上可能出现的肽段序列再根据肽段质量算出理论母离子质量和理论碎片离子质量。接下来用实际每张MS/MS谱图的母离子质量去筛候选肽段再拿实际碎片离子与理论碎片离子比对按匹配程度打分得分最高的就是最可能的肽段序列。这就像你手里有一把锁实验谱图数据库里有一堆钥匙理论肽段你不需要去理解钥匙怎么造出来的只要一把把试看哪把能打开。搜索引擎的本质就是在做“穷举匹配打分”。目前常用的搜索引擎有Mascot、Sequest、Andromeda内置在MaxQuant里、MSFragger等。其中MSFragger近年比较火因为它是“open search”思路前体离子质量容差可以放宽到几十甚至几百道尔顿特别适合找带着质量偏移的修饰肽段运行速度也快得离谱。4.2 参数设置容差、酶切规则和修饰搜索参数设置是新手最头疼的部分但也是决定结果质量的关键。我列几个每次搜索必须仔细检查的项目酶切规则Trypsin通常设定为“K/R后切但P前不切”漏切位点数量missed cleavages一般设2允许个别位点酶切不充分前体离子质量容差precursor tolerance高分辨质谱现在普遍设10 ppm以内甚至5 ppm或更低碎片离子容差fragment tolerance则看仪器Orbitrap数据常设0.02 DaQ-TOF数据可设20-50 ppm固定修饰fixed modification半胱氨酸的Carbamidomethyl (C)是烷基化后必须设的可变修饰variable modification最常加的是甲硫氨酸氧化Oxidation (M)和蛋白N端乙酰化Acetyl (Protein N-term)。加的修饰越多搜索空间越大FDR压力也越大不要贪多。一个常见误区是前体容差设太大。你明明用的是Orbitrap质量精度在ppm级别却把容差设成1.5 Da结果就是搜索时间长且假阳性暴增。反过来如果设得太严因为校准不好导致的系统偏移又会把真阳性的肽段漏掉。4.3 FDR到底怎么算谱图匹配分数再高也可能有随机匹配。怎么判断哪些匹配可信行业标准做法是“靶-诱饵数据库”策略。具体操作把目标蛋白数据库反转或随机化生成一个诱饵数据库大小与目标库一致。把实验谱图同时搜目标库和诱饵库。由于诱饵库里的蛋白是随机序列理论上匹配到诱饵库的肽段都是假阳性。我们可以用诱饵命中数来估计目标库里的假阳性数然后设定阈值使肽段层面的FDR假发现率低于1%。日常工作里你会在结果报告里看到“1% FDR”指的就是这个控制标准。FDR控制是组学可信度的生命线。有人为了让数据“好看”而把阈值放宽到5%甚至更高这在发表时会被审稿人直接质疑。我的习惯是figure里报告的数据都是1% FDR以上补充材料里可以放更宽的结果但主结论绝不用。5. 定量方法选型SILAC、TMT和LFQ怎么挑5.1 标记定量SILAC和TMT的核心差异鉴定只是第一步很多课题真正要的回答是“组学水平的差异”。比如疾病组vs对照组哪些蛋白变了。定量方法可以分成标记定量和非标记定量两大类我先讲标记。SILAC稳定同位素标记氨基酸是“代谢标记”思路。细胞培养时把培养基里的必需氨基酸通常是赖氨酸和精氨酸换成带稳定同位素的“重”版本。细胞每合成一个新蛋白就把重赖氨酸/重精氨酸掺入进去。等你在“轻”和“重”两种培养基里分别培养了两种组别再等量混合后一起处理、酶切、进质谱同一个肽段会以差8 Da或10 Da的成对峰出现。轻峰和重峰的峰面积比值就代表两个样本里该蛋白的相对丰度。SILAC定量非常准比如我在研究信号通路时间序列时用过三通道SILAC同一个肽段的离子流比可以做到非常稳定。但SILAC有硬伤它只适合能培养的细胞不能用于组织样本、临床样本。而且最贵的重标记氨基酸完全标记需要大约5-6个倍增周期很耗时。TMT串联质谱标签是“化学标记”思路用带有不同质量报告基团的试剂在蛋白或肽段层面化学标记不同样本。标记后的样本等量混合成一个样品进行LC-MS/MS。因为标签的母离子质量设计成一样不同样本来源的同一个肽段会在MS1中一起出现但在碎裂后产生不同的报告离子如126、127、128等。报告离子强度就是各样本的相对丰度。TMT可以做到10标甚至更多通道临床样本、组织裂解液都适用是多组学大样本的主流选择。5.2 非标记定量和DIA的取舍非标记定量LFQ不需要任何同位素标签每个样本单独跑一遍LC-MS/MS然后用MS1层面的色谱峰面积或MS2强度来量化每个肽段。不同样本之间通过信号强度归一化来比较。它的优势是操作简单、成本低、适用于任何样本类型劣势是定量准确性受色谱重现性和仪器稳定性影响大批次间波动会比较明显。样本量大的多组学项目里LFQ需要非常严格的QC和批次设计。DIA数据非依赖采集是另一种思路。传统DDA是挑最强离子做MS/MSDIA则是在整个m/z范围内划分一个个窗口比如每次扫400-500 Da、500-600 Da把所有离子都碎裂一遍无差别记录。好处是采集到的是完整、系统的碎片离子矩阵数据可追溯性强重复性高代价是谱图高度复杂需要依赖谱图库或DIA-NN这类的软件来做解卷积和定量。现在越来越多的队列研究选择DIA方案尤其适合大样本差异蛋白筛选。5.3 定量数据处理里最容易翻车的三个环节第一个是归一化。LFQ和TMT都要做归一化处理最常用的是中位数归一化或总强度归一化。如果不做样本间上样量差异、进样时间漂移都会表现为大规模的系统偏移直接影响差异蛋白判断。第二个是缺失值。蛋白质组学数据天生会有很多零值尤其低丰度蛋白。原因可能是真没表达也可能是低于检测限。简单地把所有零值删掉会损失大量信息但盲目把缺失值填补成0也是错的。比较专业的做法是用Perseus这样的工具按分组信息做基于最小值的imputation同时报告缺失率让审稿人知道你是如何处理缺失的。第三个是ratio compression。这是TMT特有的问题如果你用普通的HCD MS/MS进行定量共流出肽段的干扰谱峰会混入报告离子区域导致真实差异被压缩比如两个样本实际差异4倍测出来可能只有1.5倍。改善方法是使用同步母离子选择SPSMS3策略或者在分析时采用更严格的隔离窗口。处理不当的话TMT结果的差异倍数会严重失真。6. 质谱实验高频坑位我踩过的问题与排查6.1 信号全无怎么办刚接触质谱的人第一次上机会很慌满心期待看到肽段峰结果基峰图里要么是平的要么全是乱七八糟的峰。如果总离子流TIC几乎为零优先检查喷雾是否稳定看喷雾针尖有没有液滴挂上是否是稳定泰勒锥。针尖堵了会表现为压力升高且TIC骤降这时需要超声或换针离子源参数喷雾电压是否打开正离子模式应该加正电压。我见过最离谱的一次是电压根本没给上检查十分钟才发现软件连接出错样品问题高盐、高尿素样本严重抑制电离先脱盐再试质谱本身污染源内累积了太多盐和缓冲液离子传输效率会大幅下降定期清洗离子源和Skimmer是必须的。一个很简单的定位方法先用标准品比如5 fmol BSA酶切物跑一针如果标准品也什么都没出来那是仪器/液相端的问题如果标准品正常但样品不行那问题大概率在样品制备或进样环节。6.2 图谱质量差、鉴定数量少最典型的表现是仪器看起来正常搜库也有结果但鉴定蛋白数只有预期的一半优质谱图少。这时候我会按顺序排查酶切效率还原烷基化有没有做到位漏切位点比例高不高如果高适当增加酶量或延长酶切时间如果用的是过夜酶切确认没有因为样品被污染导致酶失活色谱性能柱效下降会导致峰宽增大、分辨率下降从而降低MS/MS采集效率看看色谱柱柱压是否异常、保护柱有没有堵塞进样量是否合适前体质量偏移如果仪器校准漂移了母离子m/z对不上搜索引擎匹配时有效候选会大幅减少跑一针校准液看看质量轴偏了多少采集速度DDA模式下如果MS/MS扫描速度太慢很多中低丰度肽段根本来不及被选中碎裂现代仪器可以尝试把MS/MS分辨率降到1.5万-3万来换取扫描速度或用更短的动态排除时间。另外鉴定数低可能只是“看起来低”。如果你用的是小物种的数据而搜索库选择了人的数据库或数据库里加了太多冗余序列搜索空间过大会压制有效匹配。用物种特异性数据库或者整理过的reviewed数据库往往会好很多。6.3 定量重复性差的排查定量重复性差有几种常见原因。一是上样量不一致。定量实验的每个样本必须测浓度后统一上样量最好再跑一管QC样本监控整体平行性。二是液相梯度漂移。保留时间不稳定会导致MS1峰积分不准特别是LFQ模式进样针和管路里的气泡也会引起体积偏差每次进样前做气泡排除。三是样本前处理批次差异大。酶切时间、脱盐方式、复溶体积不一致都会造成系统偏移尽量同一批处理、同一批上机。有一次我做TMT实验前24个样本重复性极好第25个开始全部偏移查了半天发现是换了一瓶乙腈批次间流动相纯度有细微差异导致梯度改变了。从那以后我所有定量实验都固定试剂批次并且每天换新流动相时先跑QC针监控。6.4 质谱实验问题速查表为了方便日常排查我把自己常用的检查表放在这里现象常见原因快速排查方向TIC几乎为零喷针堵塞/电压未开/样品高盐换针、检查电压、脱盐后重试基线高、信号飘离子源污染/流动相不干净清洗离子源、换新流动相母离子质量偏移仪器校准漂移外标校准用内标锁定质量鉴定数少酶切不完全/搜索库不匹配/柱效低检查漏切率、换数据库、评估色谱柱谱图碎片峰稀疏碰撞能量不足/母离子纯度差调整CE或阶梯能量、缩小隔离窗口定量批次偏移试剂批次/上样量/色谱漂移固定批次、加QC样本、随机化进样顺序TMT比值压缩共流出干扰/Ms2定量改用MS3或SPS、缩小隔离窗口这张表现在还在我实验室的SOP里每次有人跑来问“数据怎么这么奇怪”我就让他们先对着表做一轮基础排查。最后再分享一个习惯质谱数据一定不要只看软件打分。拿到结果后我会随机抽几十张PSM谱图手动检查b/y离子匹配是否合理、修饰位点是否有足够侧翼证据支持。这一步不能替代统计质控但它能帮你建立对数据和软件的判断力尤其是当你尝试一个新仪器平台或新搜索软件时手动抽查往往能比任何参数设置指南更快地发现哪里出了问题。
返回列表