MOFA / MOFA+
无监督的多组学因子分析,从多个组学中提取共有或某一组学特有的潜在因子,适合不预设分组、先看清主要变异来源的研究。它允许部分样本缺失某些组学,得到的因子可以再与临床表型、生存信息做关联。
10个分析 Skill · Codar 生信插件
多组学整合把同一批样本的转录组、蛋白组、甲基化、代谢组等数据放在一起建模,寻找单一组学看不到的共同变异来源或分子分型。Codar 会先根据研究问题和样本配对情况设计整合方案,完成数据对齐与标准化,再用 MOFA 因子分析、DIABLO 监督建模或 SNF 相似性网络融合联合分析,并对结果做跨组学解释与验证。
先明确是探索性问题还是有分组标签的问题,统计各组学的样本配对情况,据此选择方法。
统一样本编号和特征标识,处理缺失样本,把基因、蛋白、CpG 位点对应到可比较的单位。
每种组学按自身特点标准化、过滤并校正批次,避免方差大的组学主导整合结果。
用 MOFA、DIABLO 或 SNF 建模,通过交叉验证或稳定性检验确定因子数、成分数等参数。
查看因子或成分的特征载荷,关联临床变量,并在单组学结果或独立数据中核对。
输出方案说明、因子与载荷图、样本分群结果、关联分析表和分析脚本。
无监督的多组学因子分析,从多个组学中提取共有或某一组学特有的潜在因子,适合不预设分组、先看清主要变异来源的研究。它允许部分样本缺失某些组学,得到的因子可以再与临床表型、生存信息做关联。
监督式方法,在已知分组的前提下,寻找既能区分组别、又在组学之间相互关联的特征组合,适合分类和生物标志物筛选。这类模型容易过拟合,需要用交叉验证评估分类表现,样本较少时对选出的特征要更谨慎。
为每种组学分别构建样本相似性网络,再迭代融合成一个网络用于聚类,常用于肿瘤分子分型。它关注的是样本之间的关系,不直接给出驱动特征,得到亚群后还要做差异分析来解释各亚群的分子特点。
最直接的做法是把各组学特征拼接后统一建模,但不同组学的维度和尺度差异大,容易被高维组学主导。晚期整合先分别分析再合并结论,稳健但会错过跨组学的协同信号。MOFA 这类中间整合方法介于两者之间。
共 10 项。启用插件后,Codar 会按任务自动选用,不需要逐个记住名称。
在 Codar 左上角选择 Codar 生信。
在插件页找到「多组学整合」,安装或启用。
用一句话写清数据和目标,确认分析方案后开始执行。
我有同一批患者的转录组、蛋白组和甲基化数据,帮我设计整合方案,用 MOFA 找出与预后相关的因子。
MOFA 是无监督方法,不使用分组信息,目标是找出数据中主要的变异来源;DIABLO 是监督方法,直接寻找能区分已知组别的跨组学特征。想先探索数据结构可选 MOFA,想做分类或筛选标志物可选 DIABLO,两者也可以先后使用。
不一定。MOFA 等因子模型允许部分样本缺失某些组学,但完全配对的样本越多,跨组学关联的估计越可靠。DIABLO 和 SNF 通常要求样本在各组学间一一对应,缺失较多时需要先取交集或考虑插补,并评估这样做对结论的影响。
没有统一标准,取决于方法和研究问题。无监督因子分析对样本量相对宽容,监督建模和亚型发现对样本量更敏感,样本少时容易过拟合。样本有限时宜选较简单的模型,并用交叉验证或独立队列检验结果是否稳定。