Codar
下载

18个分析 Skill · Codar 生信插件

代谢组学 AI 分析

代谢组学测量生物样本中小分子代谢物的种类和含量,常见数据来自 LC-MS、GC-MS、CE-MS 和 NMR。这个插件在 Codar 里覆盖靶向与非靶向代谢组、脂质组、代谢物注释、质控与批次校正、差异和多变量统计、通路富集,也包括稳定同位素示踪、ICP-MS 金属组和暴露组分析。

代谢组学能回答哪些研究问题

  • 疾病组和对照组之间哪些代谢物发生了显著变化?
  • 这些差异代谢物集中在哪些代谢通路上?
  • 跨多个批次进样的数据,批次效应能否校正?
  • 哪几个代谢物组合可作为候选标志物?
  • 同位素标记的葡萄糖碳流向了哪些下游代谢物?

代谢组学分析流程

  1. 1

    确认实验设计

    明确分组、进样顺序和 QC 插入方式;还未上机的项目可先规划 DDA 或 DIA 采集方案。

  2. 2

    峰提取与对齐

    从原始数据中提取特征峰并跨样本对齐,得到保留时间、质荷比和峰面积组成的特征矩阵。

  3. 3

    质控与批次校正

    依据 QC 样本过滤不稳定特征,校正进样漂移和批次差异,再做归一化和缺失值处理。

  4. 4

    代谢物注释

    结合精确质量、二级谱图和公共数据库给特征注释,并标注每个注释的置信等级。

  5. 5

    统计与标志物

    做单变量检验、PCA 和 OPLS-DA 等多变量分析,筛选差异代谢物和候选标志物组合。

  6. 6

    通路解读

    对差异代谢物做通路富集,输出统计表、图表、报告和可复现脚本。

常用方法与怎么选

XCMS、MS-DIAL 与 MZmine

都用于 LC-MS 数据的峰提取、对齐和缺失峰回填。XCMS 基于 R,便于脚本化复现;MS-DIAL 对脂质组和 DIA 数据支持较好;MZmine 模块化、可视化强。参数需按色谱峰宽和仪器分辨率调整。

SIRIUS、GNPS 与 MSI 鉴定等级

非靶向数据中多数特征难以确认结构。GNPS 分子网络利用二级谱相似性归类未知物,SIRIUS 预测分子式和结构候选。报告时通常按代谢组学标准倡议(MSI)分级:一级需标准品确证,二级为谱图匹配推定。

QC-RLSC、SERRF 与 ComBat

校正进样漂移和批次效应的常用方法。QC-RLSC 用 QC 样本做 LOESS 拟合;SERRF 用随机森林借助代谢物间相关性;ComBat 不依赖 QC,但批次不能与分组重合。校正后常剔除 QC 中波动大的特征。

PCA、PLS-DA 与 OPLS-DA

PCA 是无监督方法,先用来看整体分布、QC 聚集和离群样本;PLS-DA 和 OPLS-DA 是有监督方法,用于找区分组别的代谢物,常用 VIP 值排序。有监督模型容易过拟合,需要用置换检验和交叉验证评估 Q2。

需要准备的数据

  • 原始质谱文件(.raw、.mzML)或 NMR 谱
  • 或已导出的峰面积 / 浓度矩阵
  • 样本信息表:分组、批次、进样顺序
  • QC 样本和空白样本的标识
  • 靶向定量时的标准曲线与内标信息

能得到的结果

  • 经质控和批次校正的特征矩阵
  • 带置信等级的代谢物注释表
  • 差异代谢物统计表与火山图
  • PCA、OPLS-DA 得分图及置换检验结果
  • 代谢通路富集结果与通路图
  • 分析报告和可复现脚本

代谢组学插件包含的分析能力

共 18 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。

  • 暴露组学分析
  • 代谢标志物发现
  • 稳定同位素示踪与代谢流分析
  • ICP-MS离子组与金属组分析
  • 代谢物鉴定与注释
  • 靶向代谢组定量
  • 非靶向代谢组分析
  • 代谢组质量控制归一化与批次校正
  • CE-MS代谢组分析
  • 代谢组差异与多变量统计
  • 脂质组学分析
  • 离子迁移率与CCS分析
  • NMR代谢组分析
  • 代谢组公共数据库检索
  • DDA与DIA质谱采集方案设计
  • 代谢通路富集分析

nf-core 标准流程(2 个)

  • nf-core-metaboigniter流程
  • nf-core-ribomsqc流程

在 Codar 里怎么用

  1. 1

    切换到生信模式

    在 Codar 左上角选择 Codar 生信。

  2. 2

    启用「代谢组学」

    在插件页找到「代谢组学」,安装或启用。

  3. 3

    描述研究问题

    用一句话写清数据和目标,确认分析方案后开始执行。

可以这样提问
帮我分析这份非靶向代谢组数据,做批次校正和多变量统计,筛选差异代谢物并做通路富集。

代谢组学常见问题

靶向代谢组和非靶向代谢组有什么区别?

非靶向代谢组尽可能多地检测特征,用于发现性研究,结果是相对定量,很多特征只能推定注释。靶向代谢组针对预先确定的一组代谢物,用标准品和内标做绝对或半定量,准确度更高但覆盖面窄。常见思路是先用非靶向发现候选,再用靶向方法验证。

OPLS-DA 模型怎么判断有没有过拟合?

看 R2Y 和 Q2 的差距以及置换检验。R2Y 很高但 Q2 低,或置换检验中随机分组得到的 Q2 与真实模型接近,都提示过拟合。样本量小、特征多时尤其要警惕,VIP 筛选结果最好再用单变量检验和 FDR 校正交叉确认。

代谢组实验中 QC 样本应该怎么设置?

通常把所有样本等量混合制成 pooled QC,在序列开头连续进样几针平衡系统,之后每隔若干个样本插入一针,常见间隔为 5 到 10 个样本。样本进样顺序应随机化,避免分组与进样时间重合,否则仪器漂移会被误当成组间差异。

其他生信插件