Codar
下载

10个分析 Skill · Codar 生信插件

多组学整合 AI 分析

多组学整合把同一批样本的转录组、蛋白组、甲基化、代谢组等数据放在一起建模,寻找单一组学看不到的共同变异来源或分子分型。Codar 会先根据研究问题和样本配对情况设计整合方案,完成数据对齐与标准化,再用 MOFA 因子分析、DIABLO 监督建模或 SNF 相似性网络融合联合分析,并对结果做跨组学解释与验证。

多组学整合能回答哪些研究问题

  • 转录组、蛋白组和甲基化数据有哪些共同的变异来源?
  • 哪些跨组学特征组合能够区分不同疾病亚型?
  • 整合多组学后,患者能否分成分子特征不同的亚群?
  • 同一个细胞的基因组变异与表达变化之间有何关联?
  • mRNA 与蛋白丰度的变化在哪些基因上不一致?

多组学整合分析流程

  1. 1

    设计整合方案

    先明确是探索性问题还是有分组标签的问题,统计各组学的样本配对情况,据此选择方法。

  2. 2

    数据对齐

    统一样本编号和特征标识,处理缺失样本,把基因、蛋白、CpG 位点对应到可比较的单位。

  3. 3

    分组学标准化

    每种组学按自身特点标准化、过滤并校正批次,避免方差大的组学主导整合结果。

  4. 4

    联合建模

    用 MOFA、DIABLO 或 SNF 建模,通过交叉验证或稳定性检验确定因子数、成分数等参数。

  5. 5

    解释与验证

    查看因子或成分的特征载荷,关联临床变量,并在单组学结果或独立数据中核对。

  6. 6

    结果交付

    输出方案说明、因子与载荷图、样本分群结果、关联分析表和分析脚本。

常用方法与怎么选

MOFA / MOFA+

无监督的多组学因子分析,从多个组学中提取共有或某一组学特有的潜在因子,适合不预设分组、先看清主要变异来源的研究。它允许部分样本缺失某些组学,得到的因子可以再与临床表型、生存信息做关联。

DIABLO(mixOmics)

监督式方法,在已知分组的前提下,寻找既能区分组别、又在组学之间相互关联的特征组合,适合分类和生物标志物筛选。这类模型容易过拟合,需要用交叉验证评估分类表现,样本较少时对选出的特征要更谨慎。

SNF 相似性网络融合

为每种组学分别构建样本相似性网络,再迭代融合成一个网络用于聚类,常用于肿瘤分子分型。它关注的是样本之间的关系,不直接给出驱动特征,得到亚群后还要做差异分析来解释各亚群的分子特点。

早期拼接与晚期整合

最直接的做法是把各组学特征拼接后统一建模,但不同组学的维度和尺度差异大,容易被高维组学主导。晚期整合先分别分析再合并结论,稳健但会错过跨组学的协同信号。MOFA 这类中间整合方法介于两者之间。

需要准备的数据

  • 同一批样本的两种或以上组学矩阵
  • 样本对应表:各组学样本编号的匹配关系
  • 临床或表型信息:分组、生存、处理等
  • 各组学的预处理说明(标准化方式、批次)

能得到的结果

  • 整合方案说明与方法选择理由
  • 对齐、标准化后的各组学矩阵
  • MOFA 因子方差解释图与特征载荷表
  • DIABLO 选出的跨组学特征与分类评估
  • SNF 融合网络得到的样本分群
  • 分析脚本与参数记录

多组学整合插件包含的分析能力

共 10 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。

  • G&T-seq基因组与转录组联合分析
  • DIABLO监督式多组学建模
  • 多组学数据对齐与标准化
  • 多组学联合解释与验证
  • MOFA多组学因子分析
  • SNF多组学相似性网络融合
  • 多组学整合方案设计

nf-core 标准流程(3 个)

  • nf-core-differentialabundance流程
  • nf-core-omicsgenetraitassociation流程
  • nf-core-proteogenomicsdb流程

在 Codar 里怎么用

  1. 1

    切换到生信模式

    在 Codar 左上角选择 Codar 生信。

  2. 2

    启用「多组学整合」

    在插件页找到「多组学整合」,安装或启用。

  3. 3

    描述研究问题

    用一句话写清数据和目标,确认分析方案后开始执行。

可以这样提问
我有同一批患者的转录组、蛋白组和甲基化数据,帮我设计整合方案,用 MOFA 找出与预后相关的因子。

多组学整合常见问题

MOFA 和 DIABLO 有什么区别?

MOFA 是无监督方法,不使用分组信息,目标是找出数据中主要的变异来源;DIABLO 是监督方法,直接寻找能区分已知组别的跨组学特征。想先探索数据结构可选 MOFA,想做分类或筛选标志物可选 DIABLO,两者也可以先后使用。

多组学整合需要每个样本都有全部组学数据吗?

不一定。MOFA 等因子模型允许部分样本缺失某些组学,但完全配对的样本越多,跨组学关联的估计越可靠。DIABLO 和 SNF 通常要求样本在各组学间一一对应,缺失较多时需要先取交集或考虑插补,并评估这样做对结论的影响。

多组学整合分析需要多少样本?

没有统一标准,取决于方法和研究问题。无监督因子分析对样本量相对宽容,监督建模和亚型发现对样本量更敏感,样本少时容易过拟合。样本有限时宜选较简单的模型,并用交叉验证或独立队列检验结果是否稳定。

其他生信插件