XCMS、MS-DIAL 与 MZmine
都用于 LC-MS 数据的峰提取、对齐和缺失峰回填。XCMS 基于 R,便于脚本化复现;MS-DIAL 对脂质组和 DIA 数据支持较好;MZmine 模块化、可视化强。参数需按色谱峰宽和仪器分辨率调整。
18个分析 Skill · Codar 生信插件
代谢组学测量生物样本中小分子代谢物的种类和含量,常见数据来自 LC-MS、GC-MS、CE-MS 和 NMR。这个插件在 Codar 里覆盖靶向与非靶向代谢组、脂质组、代谢物注释、质控与批次校正、差异和多变量统计、通路富集,也包括稳定同位素示踪、ICP-MS 金属组和暴露组分析。
明确分组、进样顺序和 QC 插入方式;还未上机的项目可先规划 DDA 或 DIA 采集方案。
从原始数据中提取特征峰并跨样本对齐,得到保留时间、质荷比和峰面积组成的特征矩阵。
依据 QC 样本过滤不稳定特征,校正进样漂移和批次差异,再做归一化和缺失值处理。
结合精确质量、二级谱图和公共数据库给特征注释,并标注每个注释的置信等级。
做单变量检验、PCA 和 OPLS-DA 等多变量分析,筛选差异代谢物和候选标志物组合。
对差异代谢物做通路富集,输出统计表、图表、报告和可复现脚本。
都用于 LC-MS 数据的峰提取、对齐和缺失峰回填。XCMS 基于 R,便于脚本化复现;MS-DIAL 对脂质组和 DIA 数据支持较好;MZmine 模块化、可视化强。参数需按色谱峰宽和仪器分辨率调整。
非靶向数据中多数特征难以确认结构。GNPS 分子网络利用二级谱相似性归类未知物,SIRIUS 预测分子式和结构候选。报告时通常按代谢组学标准倡议(MSI)分级:一级需标准品确证,二级为谱图匹配推定。
校正进样漂移和批次效应的常用方法。QC-RLSC 用 QC 样本做 LOESS 拟合;SERRF 用随机森林借助代谢物间相关性;ComBat 不依赖 QC,但批次不能与分组重合。校正后常剔除 QC 中波动大的特征。
PCA 是无监督方法,先用来看整体分布、QC 聚集和离群样本;PLS-DA 和 OPLS-DA 是有监督方法,用于找区分组别的代谢物,常用 VIP 值排序。有监督模型容易过拟合,需要用置换检验和交叉验证评估 Q2。
共 18 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。
在 Codar 左上角选择 Codar 生信。
在插件页找到「代谢组学」,安装或启用。
用一句话写清数据和目标,确认分析方案后开始执行。
帮我分析这份非靶向代谢组数据,做批次校正和多变量统计,筛选差异代谢物并做通路富集。
非靶向代谢组尽可能多地检测特征,用于发现性研究,结果是相对定量,很多特征只能推定注释。靶向代谢组针对预先确定的一组代谢物,用标准品和内标做绝对或半定量,准确度更高但覆盖面窄。常见思路是先用非靶向发现候选,再用靶向方法验证。
看 R2Y 和 Q2 的差距以及置换检验。R2Y 很高但 Q2 低,或置换检验中随机分组得到的 Q2 与真实模型接近,都提示过拟合。样本量小、特征多时尤其要警惕,VIP 筛选结果最好再用单变量检验和 FDR 校正交叉确认。
通常把所有样本等量混合制成 pooled QC,在序列开头连续进样几针平衡系统,之后每隔若干个样本插入一针,常见间隔为 5 到 10 个样本。样本进样顺序应随机化,避免分组与进样时间重合,否则仪器漂移会被误当成组间差异。