Codar
下载

17个分析 Skill · Codar 生信插件

蛋白质组学 AI 分析

蛋白质组学用质谱回答样本里有哪些蛋白、各有多少、带了哪些修饰。典型数据是 DDA、DIA 或 TMT 标记采集的原始质谱文件。这个插件在 Codar 里覆盖从原始数据到结果的主要环节:肽段鉴定与蛋白推断、DIA 与 TMT 定量、翻译后修饰位点分析、亲和蛋白质组、数据质控,以及结构域和功能注释。

蛋白质组学能回答哪些研究问题

  • 处理组和对照组之间哪些蛋白的丰度发生了变化?
  • 这批 DIA 数据的鉴定深度和定量重复性是否达标?
  • 刺激后哪些磷酸化位点发生了变化,定位是否可靠?
  • 免疫沉淀富集到的蛋白里,哪些是真正的互作蛋白?
  • 鉴定到的未知蛋白含有哪些结构域,可能有什么功能?

蛋白质组学分析流程

  1. 1

    整理数据与样本表

    收集原始质谱文件或 PRIDE 项目编号,写清分组、批次和 TMT 通道对应关系,选定物种蛋白库。

  2. 2

    肽段鉴定与蛋白推断

    搜库并用 target-decoy 方法把肽段和蛋白水平 FDR 控制在常用的 1%,共享肽段按蛋白组归并。

  3. 3

    蛋白定量

    按采集方式选择 DIA、TMT 或 label-free 定量,汇总到蛋白水平,并记录缺失值比例。

  4. 4

    质量控制

    检查鉴定数、保留时间稳定性、样本相关性和 PCA,找出离群样本和批次效应后再做比较。

  5. 5

    修饰与互作分析

    修饰数据需结合位点定位概率与蛋白水平变化;亲和实验要和对照比较以区分特异结合与背景蛋白。

  6. 6

    功能注释与汇报

    对目标蛋白做结构域和功能注释,输出定量表、图表、报告和可复现脚本。

常用方法与怎么选

MaxQuant、MSFragger 与 Comet

DDA 数据常用的搜库引擎。MaxQuant 集成鉴定和 LFQ 定量,上手容易;MSFragger 搜索快,适合开放搜索找未预设修饰;Comet 开源轻量,常嵌入 OpenMS 流程。结果应报告肽段和蛋白两级 FDR。

DIA-NN、Spectronaut 与 OpenSWATH

用于 DIA 数据的谱图提取和定量。DIA-NN 开源,支持有库和无库模式;Spectronaut 是商业软件;OpenSWATH 基于 OpenMS,适合要求全开源的流程。选择时主要看有无项目自建谱图库和样本规模。

MSstats、MSstatsTMT 与 limma

用于蛋白水平的组间统计。MSstats 从肽段层面建模,适合 label-free 和 DIA;MSstatsTMT 处理多批次 TMT 的参考通道;limma 适合已汇总的蛋白矩阵和复杂设计。缺失值处理方式要写清楚。

修饰位点定位:ptmRS 与 MaxQuant 定位概率

磷酸化等修饰分析的关键是确定修饰落在哪个氨基酸上。常见做法是保留定位概率大于 0.75 的位点,并把位点丰度变化与所在蛋白的丰度变化分开看,避免把蛋白表达量变化误读为修饰水平变化。

需要准备的数据

  • 原始质谱文件(.raw、.d 或 .mzML)
  • 对应物种的蛋白序列 FASTA 库
  • 样本信息表:分组、批次、TMT 通道
  • DIA 谱图库(可选,也可无库分析)
  • 或者 PRIDE 等公共库的项目编号

能得到的结果

  • 按 FDR 过滤后的肽段和蛋白鉴定列表
  • 蛋白丰度矩阵与组间比较统计表
  • 质控报告:鉴定数、相关性、PCA 图
  • 修饰位点表及定位概率
  • 蛋白结构域与功能注释表
  • 图表、分析报告和可复现脚本

蛋白质组学插件包含的分析能力

共 17 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。

  • DIA蛋白质组分析
  • 蛋白质质谱数据处理
  • 蛋白质翻译后修饰分析
  • 蛋白质丰度定量
  • 蛋白质结构域与功能注释
  • TMT定量蛋白质组分析
  • 亲和蛋白质组分析
  • 蛋白质组数据质量控制
  • 肽段鉴定与蛋白质推断
  • 蛋白质组公共数据检索

nf-core 标准流程(7 个)

  • nf-core-ddamsproteomics流程
  • nf-core-diaproteomics流程
  • nf-core-mspepid流程
  • nf-core-proteinannotator流程
  • nf-core-proteinfamilies流程
  • nf-core-proteomicslfq流程
  • nf-core-quantms流程

在 Codar 里怎么用

  1. 1

    切换到生信模式

    在 Codar 左上角选择 Codar 生信。

  2. 2

    启用「蛋白质组学」

    在插件页找到「蛋白质组学」,安装或启用。

  3. 3

    描述研究问题

    用一句话写清数据和目标,确认分析方案后开始执行。

可以这样提问
帮我处理这批 DIA 蛋白质组数据,完成肽段鉴定、蛋白定量和质控,再对鉴定到的蛋白做结构域与功能注释。

蛋白质组学常见问题

DIA 和 DDA 蛋白质组有什么区别,该选哪个?

DDA 每个周期只挑选信号最强的若干母离子做碎裂,样本间缺失值较多;DIA 按质荷比窗口把所有母离子都碎裂,定量重复性更好、缺失值更少,但谱图复杂、依赖专门软件解析。大队列定量研究通常倾向 DIA,DDA 仍常用于建库和修饰发现。

TMT 标记和 label-free 定量怎么选?

TMT 把多个样本混在一针里测,同一批内缺失值少、通量高,但存在比率压缩,样本数超过一个标记套装时需要参考通道衔接批次。label-free 不受通道数限制、成本低,适合样本陆续收集的研究,但对仪器稳定性和保留时间对齐要求更高。

蛋白质组数据缺失值怎么处理?

先判断缺失原因:低丰度导致的缺失与随机缺失处理方式不同。常见做法是先按每组检出比例过滤,再对低丰度缺失用接近检测下限的值填补,对随机缺失用 KNN 等方法。填补会影响统计结果,建议同时报告填补前后的差异蛋白数量。

其他生信插件