MaxQuant、MSFragger 与 Comet
DDA 数据常用的搜库引擎。MaxQuant 集成鉴定和 LFQ 定量,上手容易;MSFragger 搜索快,适合开放搜索找未预设修饰;Comet 开源轻量,常嵌入 OpenMS 流程。结果应报告肽段和蛋白两级 FDR。
17个分析 Skill · Codar 生信插件
蛋白质组学用质谱回答样本里有哪些蛋白、各有多少、带了哪些修饰。典型数据是 DDA、DIA 或 TMT 标记采集的原始质谱文件。这个插件在 Codar 里覆盖从原始数据到结果的主要环节:肽段鉴定与蛋白推断、DIA 与 TMT 定量、翻译后修饰位点分析、亲和蛋白质组、数据质控,以及结构域和功能注释。
收集原始质谱文件或 PRIDE 项目编号,写清分组、批次和 TMT 通道对应关系,选定物种蛋白库。
搜库并用 target-decoy 方法把肽段和蛋白水平 FDR 控制在常用的 1%,共享肽段按蛋白组归并。
按采集方式选择 DIA、TMT 或 label-free 定量,汇总到蛋白水平,并记录缺失值比例。
检查鉴定数、保留时间稳定性、样本相关性和 PCA,找出离群样本和批次效应后再做比较。
修饰数据需结合位点定位概率与蛋白水平变化;亲和实验要和对照比较以区分特异结合与背景蛋白。
对目标蛋白做结构域和功能注释,输出定量表、图表、报告和可复现脚本。
DDA 数据常用的搜库引擎。MaxQuant 集成鉴定和 LFQ 定量,上手容易;MSFragger 搜索快,适合开放搜索找未预设修饰;Comet 开源轻量,常嵌入 OpenMS 流程。结果应报告肽段和蛋白两级 FDR。
用于 DIA 数据的谱图提取和定量。DIA-NN 开源,支持有库和无库模式;Spectronaut 是商业软件;OpenSWATH 基于 OpenMS,适合要求全开源的流程。选择时主要看有无项目自建谱图库和样本规模。
用于蛋白水平的组间统计。MSstats 从肽段层面建模,适合 label-free 和 DIA;MSstatsTMT 处理多批次 TMT 的参考通道;limma 适合已汇总的蛋白矩阵和复杂设计。缺失值处理方式要写清楚。
磷酸化等修饰分析的关键是确定修饰落在哪个氨基酸上。常见做法是保留定位概率大于 0.75 的位点,并把位点丰度变化与所在蛋白的丰度变化分开看,避免把蛋白表达量变化误读为修饰水平变化。
共 17 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。
在 Codar 左上角选择 Codar 生信。
在插件页找到「蛋白质组学」,安装或启用。
用一句话写清数据和目标,确认分析方案后开始执行。
帮我处理这批 DIA 蛋白质组数据,完成肽段鉴定、蛋白定量和质控,再对鉴定到的蛋白做结构域与功能注释。
DDA 每个周期只挑选信号最强的若干母离子做碎裂,样本间缺失值较多;DIA 按质荷比窗口把所有母离子都碎裂,定量重复性更好、缺失值更少,但谱图复杂、依赖专门软件解析。大队列定量研究通常倾向 DIA,DDA 仍常用于建库和修饰发现。
TMT 把多个样本混在一针里测,同一批内缺失值少、通量高,但存在比率压缩,样本数超过一个标记套装时需要参考通道衔接批次。label-free 不受通道数限制、成本低,适合样本陆续收集的研究,但对仪器稳定性和保留时间对齐要求更高。
先判断缺失原因:低丰度导致的缺失与随机缺失处理方式不同。常见做法是先按每组检出比例过滤,再对低丰度缺失用接近检测下限的值填补,对随机缺失用 KNN 等方法。填补会影响统计结果,建议同时报告填补前后的差异蛋白数量。